프로젝트 소개
Docling은 IBM Research에서 개발한 문서 처리 라이브러리로, 생성형 AI 애플리케이션을 위해 문서를 준비하는 데 특화되어 있습니다. 이 도구는 PDF, DOCX, PPTX, XLSX, HTML, EPUB, ODF, Apple Pages, LaTeX, 일반 텍스트를 비롯해 PNG, TIFF, JPEG 같은 이미지 파일과 WAV, MP3 오디오, MP4, AVI, MOV, MKV, WebM 비디오, EML 및 MSG 이메일, XBRL 재무 보고서 등 광범위한 형식을 지원합니다.
PDF 처리 측면에서는 페이지 레이아웃, 읽기 순서, 표 구조, 코드, 수식 및 이미지 분류에 대한 고급 이해 능력을 제공합니다. 모든 문서는 통일된 DoclingDocument 형식으로 표현되며, Markdown, HTML, JSON, WebVTT, DocLang, DocTags 등으로 내보낼 수 있습니다. 또한 격리 환경에서의 로컬 실행 지원, 스캔된 파일용 포괄적인 OCR 기능, 그리고 GraniteDocling과 같은 선택적 시각적 언어 모델(VLM) 지원을 포함합니다.
오디오 트랜스크립션은 ASR(자동 음성 인식)을 통해 수행되며, 비디오 파싱은 트랜스크립션과 키프레임을 생성합니다. 프로젝트에는 간단한 CLI, API 서버, MCP 서버가 포함되어 있으며, LangChain, LlamaIndex, Crew AI, Haystack와의 네이티브 통합을 지원합니다. MIT 라이선스를 따르며 LF AI & Data 산하에 호스팅됩니다. Python 3.10 이상에서 pip를 통해 설치할 수 있으며, README 예제를 통해 몇 줄의 Python 코드로 PDF URL을 Markdown으로 변환하는 방법을 확인할 수 있습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.