newspaper3kはウェブからの記事抽出・キュレーション用Python3ライブラリ。本文・メタデータ抽出、NLPキーワード生成、30言語以上対応、マルチスレッドDLなどに対応。
オープンソース。新しい可能性。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTION国内42の主要病院の採用情報をSeleniumで毎日収集し、RaiT検証ゲートウェイでデータの整合性を点検後、重複を除去してエクセルレポートとして出力するGitHub Actionsベースの自動化パイプラインです。
Weibo Spiderは、新浪微博のユーザー情報や投稿内容(テキスト、画像、動画)をPythonで収集するツールです。CSV、JSON、DBへの保存に対応し、学術研究やデータ分析に利用されます。
ElysiaとFFmpegで構築された軽量APIで、アニメエピソードのHLSリンクからスクリーンショットのキャプチャやGIFの生成を行います。
Scrapyは、Python用の高速で高レベルなWebスクレイピングフレームワークです。構造化データの抽出に使用され、クロスプラットフォーム対応でPython 3.10以上が必要です。Zyteおよびコントリビューターによって維持管理されています。
Python向けの適応型Webスクレイピングフレームワーク。インテリジェントなDOM追跡、アンチボット回避フェッチャー、一時停止/再開可能な並行クロール、プロキシローテーション、MCP/AI対応出力を備える。
OCRmyPDF は、スキャンされた PDF ファイルに検索可能な OCR テキストレイヤーを追加し、検証済みの PDF/A 出力を生成するコマンドライン ツールです。Tesseract を使用して 100 種類以上の言語を認識し、傾き補正と回転補正をサポートし、Linux、macOS、Windows、FreeBSD で動作します。
抖音/TikTok作品ダウンロードとデータ収集ツール。動画/画像集の一括ダウンロード、コメントデータ収集、ライブストリームURL取得に対応。ターミナル対話、Web API、Docker展開を提供。
spotDLは、Spotifyのプレイリストから楽曲を検索し、YouTube経由でダウンロードするコマンドラインツールです。アルバムアート、歌詞、メタデータも同時に取得します。