프로젝트 소개
dots.ocr는 문서 레이아웃 파싱에 특화된 오픈소스 비전-언어 모델입니다. README에 따르면 보편적 접근성을 목표로 설계되었으며 다양한 인간 문자 체계를 인식할 수 있습니다. 비슷한 규모의 모델들 사이에서 다국어 문서 파싱 벤치마크에서 강력한 성능을 보여준다고 보고되며, 차트나 다이어그램 같은 구조화된 그래픽을 SVG 코드로 변환하는 기능과 웹 화면 및 장면 텍스트 처리도 지원합니다.
README에 설명된 주요 기능:
- 다국어 문서 파싱: 이미지와 PDF에서 레이아웃 요소를 경계 상자, 범주, 텍스트 내용과 함께 추출합니다.
- 레이아웃 범주: Caption, Footnote, Formula, List-item, Page-footer, Page-header, Picture, Section-header, Table, Text, Title이 포함됩니다.
- 출력 형식: 수식은 LaTeX, 표는 HTML, 기타 텍스트는 Markdown으로 출력하며, 요소는 사람의 읽기 순서대로 정렬됩니다.
- 구조화된 그래픽 파싱: 차트, 다이어그램, 화학식, 로고를 SVG 코드로 변환합니다.
- 추가 작업: 웹 페이지 파싱 및 장면 텍스트 탐지.
- 일반적인 비전 질문 응답도 지원합니다.
배포 및 사용법:
- conda와 pip로 설치할 수 있으며, Docker 이미지도 제공됩니다.
- 제공된 스크립트로 모델 가중치를 다운로드할 수 있고 ModelScope 옵션도 있습니다.
- 배포에는 vLLM이 권장되며, README는 dots.ocr가 vLLM 0.11.0부터 통합되었다고 밝힙니다.
- Hugging Face Transformers 추론을 지원하며, 이슈에서 참조된 CPU 추론 경로도 포함됩니다.
- 파서 스크립트는 단일 이미지나 PDF를 처리할 수 있고, 레이아웃 감지 전용 또는 텍스트 전용 파싱 옵션을 제공하며, 구조화된 JSON, Markdown, 레이아웃 시각화 이미지를 출력할 수 있습니다.
- 라이브 데모가 제공됩니다.
README는 또한 한계점을 나열합니다. 복잡한 표와 수학 공식은 컴팩트한 모델 구조상 여전히 어렵고, 구조화된 그래픽의 SVG 기반 파싱은 아직 완전히 견고하지 않으며, 가끔 파싱 실패가 발생할 수 있다고 합니다. 또한 dots.ocr-1.5는 나중에 dots.mocr로 이름이 바뀌었고, 업데이트된 가중치와 논문이 제공된다고 언급합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.