इस प्रोजेक्ट के बारे में
Unstract एक ओपन-सोर्स प्लेटफ़ॉर्म है जिसे बड़े भाषा मॉडल (LLM) का उपयोग करके असंरचित दस्तावेज़ों (PDF, छवियाँ, स्कैन, स्प्रेडशीट, प्रस्तुतियाँ) को संरचित JSON डेटा में बदलने के लिए डिज़ाइन किया गया है। यह उपयोगकर्ताओं को प्राकृतिक भाषा प्रॉम्प्ट के साथ निष्कर्षण स्कीमा परिभाषित करने की अनुमति देता है, फिर निष्कर्षण को REST API या ETL पाइपलाइन के रूप में तैनात करता है। मुख्य विशेषताओं में स्कीमा परिभाषा के लिए Prompt Studio, API तैनाती, ETL पाइपलाइन एकीकरण, AI एजेंटों के लिए MCP सर्वर, और स्वचालन वर्कफ़्लो के लिए n8n नोड शामिल हैं। यह कई LLM प्रदाताओं (OpenAI, Anthropic, Bedrock, Gemini, Ollama, आदि), वेक्टर डेटाबेस (Qdrant, Pinecone, Weaviate, आदि), और टेक्स्ट एक्सट्रैक्टर (LLMWhisperer, Unstructured.io, LlamaIndex Parse) का समर्थन करता है। प्लेटफ़ॉर्म को एक सरल स्क्रिप्ट के साथ Docker Compose के माध्यम से स्थानीय रूप से चलाया जा सकता है, और अतिरिक्त सुविधाओं जैसे दोहरी-LLM सत्यापन, मानव-इन-द-लूप समीक्षा, SSO, और अनुपालन प्रमाणपत्र के साथ क्लाउड/एंटरप्राइज़ विकल्प प्रदान करता है। यह React फ्रंटएंड, Django बैकएंड, Celery वर्कर, और FastAPI प्लेटफ़ॉर्म सेवा के साथ बनाया गया है, जिसमें PostgreSQL, Redis, और RabbitMQ का उपयोग किया गया है। परियोजना AGPL-3.0 के तहत लाइसेंस प्राप्त है और योगदान का स्वागत करती है।
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.