프로젝트 소개

Unstract는 대규모 언어 모델(LLM)을 사용해 비정형 문서(PDF, 이미지, 스캔, 스프레드시트, 프레젠테이션)를 구조화된 JSON 데이터로 변환하도록 설계된 오픈소스 플랫폼입니다. 사용자는 자연어 프롬프트로 추출 스키마를 정의한 다음 추출을 REST API 또는 ETL 파이프라인으로 배포할 수 있습니다. 주요 기능으로는 스키마 정의를 위한 Prompt Studio, API 배포, ETL 파이프라인 통합, AI 에이전트용 MCP 서버, 자동화 워크플로용 n8n 노드가 있습니다. 여러 LLM 제공자(OpenAI, Anthropic, Bedrock, Gemini, Ollama 등), 벡터 데이터베이스(Qdrant, Pinecone, Weaviate 등), 텍스트 추출기(LLMWhisperer, Unstructured.io, LlamaIndex Parse)를 지원합니다. 이 플랫폼은 간단한 스크립트로 Docker Compose를 통해 로컬에서 실행할 수 있으며, 이중 LLM 검증, 휴먼 인 더 루프 검토, SSO, 규정 준수 인증과 같은 추가 기능을 갖춘 클라우드/엔터프라이즈 옵션도 제공합니다. React 프런트엔드, Django 백엔드, Celery 워커, FastAPI 플랫폼 서비스로 구축되었으며 PostgreSQL, Redis, RabbitMQ를 사용합니다. 이 프로젝트는 AGPL-3.0 라이선스로 제공되며 기여를 환영합니다.