このプロジェクトについて

MediaCrawlerはオープンソースのマルチプラットフォームメディアデータ収集ツールで、小紅書、抖音、快手、Bilibili、微博、貼吧、知乎などの主要プラットフォームの公開情報を収集可能です。本プロジェクトはPlaywrightブラウザ自動化フレームワークを基盤とし、ログイン状態を保持したブラウザコンテキスト環境を利用してデータを取得するため、複雑な暗号化アルゴリズムの逆解析は不要です。 機能にはキーワード検索、指定ポストIDのクロール、2段階コメントの収集、指定クリエイターのホームページクロール、ログイン状態のキャッシュ、IPプロキシプール、コメントのワードクラウド生成が含まれます。データはCSV、JSON、JSONL、Excel、SQLite、MySQL形式で保存可能です。 コマンドライン操作とWebUIビジュアルインターフェースを提供し、ユーザーはWebUIを通じてクローラーパラメータの設定、実行状態とログのリアルタイム確認、データのプレビューおよびエクスポートが可能です。使用にはChromeブラウザのリモートデバッグ機能の設定が必要で、既存のログイン状態を再利用することでリスク管理のリスクを低減します。 本プロジェクトは学習および研究目的にのみ使用することを明確に宣言しており、商業利用や違法な用途は禁止されています。