このプロジェクトについて
Unstractは、大規模言語モデル(LLM)を使用して、非構造化ドキュメント(PDF、画像、スキャン、スプレッドシート、プレゼンテーション)を構造化JSONデータに変換するために設計されたオープンソースプラットフォームです。ユーザーは自然言語プロンプトで抽出スキーマを定義し、その抽出をREST APIまたはETLパイプラインとしてデプロイできます。主な機能には、スキーマ定義のためのPrompt Studio、APIデプロイ、ETLパイプライン統合、AIエージェント向けのMCPサーバー、自動化ワークフロー向けのn8nノードが含まれます。複数のLLMプロバイダー(OpenAI、Anthropic、Bedrock、Gemini、Ollamaなど)、ベクトルデータベース(Qdrant、Pinecone、Weaviateなど)、テキスト抽出ツール(LLMWhisperer、Unstructured.io、LlamaIndex Parse)をサポートしています。このプラットフォームは、簡単なスクリプトでDocker Composeを介してローカルで実行でき、デュアルLLM検証、ヒューマン・イン・ザ・ループレビュー、SSO、コンプライアンス認証などの追加機能を備えたクラウド/エンタープライズオプションも提供しています。Reactフロントエンド、Djangoバックエンド、Celeryワーカー、FastAPIプラットフォームサービスで構築され、PostgreSQL、Redis、RabbitMQを使用しています。このプロジェクトはAGPL-3.0の下でライセンスされており、コントリビューションを歓迎しています。
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.