このプロジェクトについて

Maxunは、オープンソースでセルフホスト可能なノーコードウェブデータプラットフォームであり、ウェブサイトを構造化された再利用可能なデータソースに変換するように設計されています。ユーザーは、抽出、ページスクレイピング、サイトクローリング、ウェブ検索、ドキュメント解析のためにコードを書かずに自動化ロボットを作成できます。 抽出機能は、ブラウジング操作を記録して再利用可能なロボットに変換するか、ユーザーが自然言語で目的のデータを記述するAIモードを使用できます。ページネーション、スクロール、スケジュール実行、認証ページ、ウェブサイトのレイアウト変更時の自動復旧をサポートします。抽出されたデータは、RESTfulエンドポイントを通じて公開するか、Google SheetsやAirtableにエクスポートできます。 スクレイプロボットは、ウェブページ全体をクリーンなMarkdownまたはHTMLに変換し、スクリーンショットをキャプチャできます。出力はAIワークフロー、エージェント、ドキュメント処理を目的としています。クロールロボットはウェブサイトを巡回し、発見したページからコンテンツを抽出しつつ、クロール範囲を制御します。検索ロボットは、時間ベースのフィルターを含む自動ウェブ検索を実行し、結果のページを収集またはスクレイピングできます。 Maxunは、ドキュメントと画像の抽出も処理します。PDF、DOCX、XLSX、CSVファイルを解析し、スキャンされたPDF、JPG、PNGにはOCRを使用し、ファイルをMarkdown、HTML、リンク、または要約に変換し、AI支援で構造化フィールドを抽出します。使用例には、領収書、請求書、紙のフォーム、表のスクリーンショット、スキャン文書が含まれます。 開発者向けに、Maxunはロボットの作成、実行のトリガー、スケジュール管理、データ取得のためのSDKとCLIを提供します。また、Model Context Protocolのサポートと、抽出データを他のツールと接続するための統合機能も含まれています。 このプロジェクトはAGPLv3ライセンスです。app.maxun.devでホスト型アプリケーションを提供しており、Docker Composeまたは非Dockerセットアップを使用してローカルにインストールまたはセルフホストでき、環境変数とアップグレードに関するドキュメントも用意されています。