newspaper3kはウェブからの記事抽出・キュレーション用Python3ライブラリ。本文・メタデータ抽出、NLPキーワード生成、30言語以上対応、マルチスレッドDLなどに対応。
オープンソース。新しい可能性。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONEasySpiderは完全無料の可視化ノーコードWebクローラー・ブラウザ自動化ツールで、グラフィカルインターフェースでマウス操作のみで収集タスクを設計可能。コマンドライン実行、フローチャート論理、定期タスク、二次開発をサポート。
DouyinとTikTok向けのオープンソース・セルフホスト型データAPI。投稿・プロフィール・コメント・プレイリストの取得や、ウォーターマークなし動画・画像アルバムダウンロードをサポート。自己修復型アイデンティティプール、PostgreSQL+TimescaleDBによる永続化、REST API/MCPサーバー/CLI/Webコンソールを提供。
Luxは、Goで書かれた高速でシンプルな動画ダウンーダーCLIツールです。YouTube、Bilibili、Instagramなど、さまざまなサイトから動画、プレイリスト、画像、音声をダウンロードできます。
Huginnは、イベントの監視とアクションの実行を通じてオンラインタスクを自動化するエージェントを構築するための、セルフホスト型システムです。
Firecrawlは、ウェブサイトをLLM対応データに変換するオープンソースAPIサービスです。検索、スクレイピング、クロール、サイトマッピング、バッチスクレイピング、AIエージェント機能を提供し、AIエージェントやRAGパイプラインを構築する開発者向けに設計されています。
Crawleeは、Python向けのWebスクレイピングおよびブラウザ自動化ライブラリで、信頼性の高いクローラーを構築するために設計されています。HTTPおよびヘッドレスブラウザでのクロール、自動リトライ、プロキシローテーション、AI/LLMアプリケーション向けのデータ保存をサポートします。
requestsベースで実装されたBilibili動画の一括ダウンローダーです。分Pダウンロード、字幕、弾幕、カバー画像の取得をサポートし、GUIおよびAIコーパス転写機能を提供します。