このプロジェクトについて

Crawleeは、Python向けの包括的なWebスクレイピングおよびブラウザ自動化ライブラリであり、開発者が信頼性の高いクローラーを迅速に構築できるように設計されています。URLの発見からデータの抽出・保存まで、クロールおよびスクレイピングのためのエンドツーエンドのソリューションを提供します。 主な機能は以下の通りです: - **HTTPベースおよびヘッドレスブラウザクロールの両方のための統一インターフェース** - **システムリソースに基づく自動並列クロール** - **開発者体験の向上とバグ削減のための型ヒント** - **エラーまたはブロック時の自動リトライ** - **プロキシローテーションおよびセッション管理** - **URLを適切なハンドラーに振り向けるための設定可能なリクエストルーティング** - **クロールのための永続的なURLキュー** - **表形式データおよびファイルのためのプラグ可能なストレージ** - **堅牢なエラーハンドリング** Crawleeは、2つの主要なクローラータイプを提供します: - **BeautifulSoupCrawler**:HTTPライブラリとBeautifulSoupを使用してHTMLを解析し、JavaScriptを実行せずに効率的なデータ抽出に最適です。 - **PlaywrightCrawler**:Playwrightを介してヘッドレスブラウザを使用し、インタラクションを必要とするJavaScript多用サイトに適しています。 Parsel、BeautifulSoup、生のHTTPなど、さまざまな解析ライブラリをサポートし、HTML、PDF、JPG、PNGなどのファイルをダウンロードできます。このライブラリは、ヘッドフルモードとヘッドレスモードの両方で動作します。 Scrapyと比較して、Crawleeはasyncioベースであり、完全な型ヒントを備え、統合がより簡単(通常のPythonスクリプト)で、中断時の状態永続化、整理されたデータストレージ(データセットとキーバリューストア)を提供します。 インストールはpipを介して簡単で、追加機能のためのオプションのエクストラがあります。テンプレートを使用した迅速なプロジェクトセットアップのためのCLIツールも利用可能です。CrawleeはApifyによって開発されており、クラウド実行のためにApifyプラットフォームにデプロイできます。 ドキュメント、ガイド、および例はCrawleeプロジェクトのウェブサイトで入手でき、JavaScript/TypeScript向けのTypeScript実装も利用可能です。