इस प्रोजेक्ट के बारे में

Unstract एक ओपन-सोर्स प्लेटफ़ॉर्म है जिसे बड़े भाषा मॉडल (LLM) का उपयोग करके असंरचित दस्तावेज़ों (PDF, छवियाँ, स्कैन, स्प्रेडशीट, प्रस्तुतियाँ) को संरचित JSON डेटा में बदलने के लिए डिज़ाइन किया गया है। यह उपयोगकर्ताओं को प्राकृतिक भाषा प्रॉम्प्ट के साथ निष्कर्षण स्कीमा परिभाषित करने की अनुमति देता है, फिर निष्कर्षण को REST API या ETL पाइपलाइन के रूप में तैनात करता है। मुख्य विशेषताओं में स्कीमा परिभाषा के लिए Prompt Studio, API तैनाती, ETL पाइपलाइन एकीकरण, AI एजेंटों के लिए MCP सर्वर, और स्वचालन वर्कफ़्लो के लिए n8n नोड शामिल हैं। यह कई LLM प्रदाताओं (OpenAI, Anthropic, Bedrock, Gemini, Ollama, आदि), वेक्टर डेटाबेस (Qdrant, Pinecone, Weaviate, आदि), और टेक्स्ट एक्सट्रैक्टर (LLMWhisperer, Unstructured.io, LlamaIndex Parse) का समर्थन करता है। प्लेटफ़ॉर्म को एक सरल स्क्रिप्ट के साथ Docker Compose के माध्यम से स्थानीय रूप से चलाया जा सकता है, और अतिरिक्त सुविधाओं जैसे दोहरी-LLM सत्यापन, मानव-इन-द-लूप समीक्षा, SSO, और अनुपालन प्रमाणपत्र के साथ क्लाउड/एंटरप्राइज़ विकल्प प्रदान करता है। यह React फ्रंटएंड, Django बैकएंड, Celery वर्कर, और FastAPI प्लेटफ़ॉर्म सेवा के साथ बनाया गया है, जिसमें PostgreSQL, Redis, और RabbitMQ का उपयोग किया गया है। परियोजना AGPL-3.0 के तहत लाइसेंस प्राप्त है और योगदान का स्वागत करती है।