このプロジェクトについて
newspaper3kはPython 3用のニュース記事スクレイピング・キュレーションライブラリです。URLから全テキスト、メタデータ、画像を抽出したり、クローラーを構築してニュースソース全体を対象に作業したりできます。
主な機能:
- 記事抽出: URLから主要テキスト、著者名、公開日時、代表画像を自動識別・抽出
- ソースクロール: `build()`関数でニュース主页の全記事URLとカテゴリURLを発見可能
- 自然言語処理(NLP): 抽出テキストからのキーワードおよび要約生成を内蔵
- 多言語対応: 英語、中国語、ドイツ語、アラビア語など30言語以上をサポート、自動言語検出付き
- マルチスレッドダウンロード: `news_pool`フレームワークで複数記事を並列DL可能
- HTML解析: HTML文字列から直接本文を抽出する`fulltext`ユーティリティを提供
技術名: newspaper3k、build()、news_pool、fulltext
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.