このプロジェクトについて

newspaper3kはPython 3用のニュース記事スクレイピング・キュレーションライブラリです。URLから全テキスト、メタデータ、画像を抽出したり、クローラーを構築してニュースソース全体を対象に作業したりできます。 主な機能: - 記事抽出: URLから主要テキスト、著者名、公開日時、代表画像を自動識別・抽出 - ソースクロール: `build()`関数でニュース主页の全記事URLとカテゴリURLを発見可能 - 自然言語処理(NLP): 抽出テキストからのキーワードおよび要約生成を内蔵 - 多言語対応: 英語、中国語、ドイツ語、アラビア語など30言語以上をサポート、自動言語検出付き - マルチスレッドダウンロード: `news_pool`フレームワークで複数記事を並列DL可能 - HTML解析: HTML文字列から直接本文を抽出する`fulltext`ユーティリティを提供 技術名: newspaper3k、build()、news_pool、fulltext