このプロジェクトについて
Crawleeは、Python向けの包括的なWebスクレイピングおよびブラウザ自動化ライブラリであり、開発者が信頼性の高いクローラーを迅速に構築できるように設計されています。URLの発見からデータの抽出・保存まで、クロールおよびスクレイピングのためのエンドツーエンドのソリューションを提供します。
主な機能は以下の通りです:
- **HTTPベースおよびヘッドレスブラウザクロールの両方のための統一インターフェース**
- **システムリソースに基づく自動並列クロール**
- **開発者体験の向上とバグ削減のための型ヒント**
- **エラーまたはブロック時の自動リトライ**
- **プロキシローテーションおよびセッション管理**
- **URLを適切なハンドラーに振り向けるための設定可能なリクエストルーティング**
- **クロールのための永続的なURLキュー**
- **表形式データおよびファイルのためのプラグ可能なストレージ**
- **堅牢なエラーハンドリング**
Crawleeは、2つの主要なクローラータイプを提供します:
- **BeautifulSoupCrawler**:HTTPライブラリとBeautifulSoupを使用してHTMLを解析し、JavaScriptを実行せずに効率的なデータ抽出に最適です。
- **PlaywrightCrawler**:Playwrightを介してヘッドレスブラウザを使用し、インタラクションを必要とするJavaScript多用サイトに適しています。
Parsel、BeautifulSoup、生のHTTPなど、さまざまな解析ライブラリをサポートし、HTML、PDF、JPG、PNGなどのファイルをダウンロードできます。このライブラリは、ヘッドフルモードとヘッドレスモードの両方で動作します。
Scrapyと比較して、Crawleeはasyncioベースであり、完全な型ヒントを備え、統合がより簡単(通常のPythonスクリプト)で、中断時の状態永続化、整理されたデータストレージ(データセットとキーバリューストア)を提供します。
インストールはpipを介して簡単で、追加機能のためのオプションのエクストラがあります。テンプレートを使用した迅速なプロジェクトセットアップのためのCLIツールも利用可能です。CrawleeはApifyによって開発されており、クラウド実行のためにApifyプラットフォームにデプロイできます。
ドキュメント、ガイド、および例はCrawleeプロジェクトのウェブサイトで入手でき、JavaScript/TypeScript向けのTypeScript実装も利用可能です。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.