newspapercodelucas
新着newspaper3kはウェブからの記事抽出・キュレーション用Python3ライブラリ。本文・メタデータ抽出、NLPキーワード生成、30言語以上対応、マルチスレッドDLなどに対応。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONnewspaper3kはウェブからの記事抽出・キュレーション用Python3ライブラリ。本文・メタデータ抽出、NLPキーワード生成、30言語以上対応、マルチスレッドDLなどに対応。
DouyinとTikTok向けのオープンソース・セルフホスト型データAPI。投稿・プロフィール・コメント・プレイリストの取得や、ウォーターマークなし動画・画像アルバムダウンロードをサポート。自己修復型アイデンティティプール、PostgreSQL+TimescaleDBによる永続化、REST API/MCPサーバー/CLI/Webコンソールを提供。
Scrapyは、Python用の高速で高レベルなWebスクレイピングフレームワークです。構造化データの抽出に使用され、クロスプラットフォーム対応でPython 3.10以上が必要です。Zyteおよびコントリビューターによって維持管理されています。
Python向けの適応型Webスクレイピングフレームワーク。インテリジェントなDOM追跡、アンチボット回避フェッチャー、一時停止/再開可能な並行クロール、プロキシローテーション、MCP/AI対応出力を備える。