newspaper3kはウェブからの記事抽出・キュレーション用Python3ライブラリ。本文・メタデータ抽出、NLPキーワード生成、30言語以上対応、マルチスレッドDLなどに対応。
オープンソース。新しい可能性。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONEasySpiderは完全無料の可視化ノーコードWebクローラー・ブラウザ自動化ツールで、グラフィカルインターフェースでマウス操作のみで収集タスクを設計可能。コマンドライン実行、フローチャート論理、定期タスク、二次開発をサポート。
DouyinとTikTok向けのオープンソース・セルフホスト型データAPI。投稿・プロフィール・コメント・プレイリストの取得や、ウォーターマークなし動画・画像アルバムダウンロードをサポート。自己修復型アイデンティティプール、PostgreSQL+TimescaleDBによる永続化、REST API/MCPサーバー/CLI/Webコンソールを提供。
Scrapyは、Python用の高速で高レベルなWebスクレイピングフレームワークです。構造化データの抽出に使用され、クロスプラットフォーム対応でPython 3.10以上が必要です。Zyteおよびコントリビューターによって維持管理されています。
Luxは、Goで書かれた高速でシンプルな動画ダウンーダーCLIツールです。YouTube、Bilibili、Instagramなど、さまざまなサイトから動画、プレイリスト、画像、音声をダウンロードできます。
Python向けの適応型Webスクレイピングフレームワーク。インテリジェントなDOM追跡、アンチボット回避フェッチャー、一時停止/再開可能な並行クロール、プロキシローテーション、MCP/AI対応出力を備える。
Firecrawlは、ウェブサイトをLLM対応データに変換するオープンソースAPIサービスです。検索、スクレイピング、クロール、サイトマッピング、バッチスクレイピング、AIエージェント機能を提供し、AIエージェントやRAGパイプラインを構築する開発者向けに設計されています。
AH Crawlerは、ウェブサイトの検索と分析に使用できるオープンソースツールで、PHP環境で動作します。
Crawleeは、Python向けのWebスクレイピングおよびブラウザ自動化ライブラリで、信頼性の高いクローラーを構築するために設計されています。HTTPおよびヘッドレスブラウザでのクロール、自動リトライ、プロキシローテーション、AI/LLMアプリケーション向けのデータ保存をサポートします。