프로젝트 소개
Dolphin은 ByteDance의 오픈소스 문서 이미지 파싱 모델로, ACL 2025 논문 『Document Image Parsing via Heterogeneous Anchor Prompting』에서 소개되었습니다. 디지털 생성 문서와 촬영된 문서 이미지를 모두 JSON 및 Markdown 같은 구조화된 출력으로 변환하며, 텍스트 단락, 그림, 수식, 표, 코드 블록처럼 복잡하게 얽힌 요소가 포함된 문제를 다룹니다.
이 모델은 단일 비전-언어 모델을 기반으로 하는 문서 유형 인지형 2단계 아키텍처를 사용합니다. 1단계에서는 문서 유형(디지털 대 촬영)을 분류하고 읽기 순서 예측을 포함한 레이아웃 분석을 수행합니다. 2단계에서는 촬영된 문서에 대해 전체적 파싱을, 디지털 문서에 대해 병렬 요소 단위 파싱을 적용하는 하이브리드 파싱 전략을 사용하며, 서로 다른 요소 유형에 맞춘 이질적 앵커 프롬프트를 활용합니다. 병렬 파싱 메커니즘은 경량 아키텍처에서도 추론 효율을 유지하기 위한 프로젝트의 방식 중 일부입니다.
버전 이력: 원본 Dolphin(매개변수 0.3B)은 2025년 5월에 공개되었습니다. Dolphin-1.5(2025년 10월)는 0.3B 크기를 유지하면서 파싱 품질을 개선했습니다. Dolphin-v2(2025년 12월)는 매개변수 3B로 확장되고 21개 요소 탐지, 속성 필드 추출, 전용 수식 및 코드 파싱, 더 견고한 촬영 문서 파싱이 추가되었습니다. 이전 버전은 별도 브랜치에서 계속 사용할 수 있습니다. 이 프로젝트는 문서 파싱 평가를 위해 Fox 데이터셋의 수동 정제 하위 집합인 Fox-Page 벤치마크도 공개했습니다.
OmniDocBench(v1.5)에서 README는 Dolphin의 종합 점수 74.67, Dolphin-1.5의 85.06, Dolphin-v2의 89.78을 보고하며, 버전 간에 텍스트 편집 거리, 수식 CDM, 표 TEDS/TEDS-S, 읽기 순서 지표에서도 이에 상응하는 개선이 나타납니다.
사용법: 저장소는 세 가지 세분도의 스크립트를 제공합니다. 페이지 단위 파싱(전체 페이지 또는 다중 페이지 PDF를 구조화된 JSON/Markdown으로 변환하며 병렬 요소 디코딩을 위해 배치 크기를 설정할 수 있음), 요소 단위 파싱(개별 텍스트, 표, 수식 또는 코드 요소), 레이아웃 파싱입니다. 사전 학습된 모델은 Hugging Face(ByteDance/Dolphin-v2)에서 배포되며 통합을 위해 Hugging Face Transformers를 지원합니다. 추론 가속을 위해 프로젝트에는 vLLM 및 TensorRT-LLM 배포 가이드가 포함되어 있습니다. 설치는 일반적입니다: 저장소를 복제하고, pip 요구 사항을 설치한 뒤, Hugging Face Hub에서 모델을 다운로드합니다.
코드는 MIT 라이선스이며, 유지 관리자는 모델의 추가 개선을 위해 GitHub 이슈를 통해 나쁜 사례를 보고하도록 사용자를 적극 초대합니다. 이 프로젝트는 OmniDocBench, Donut, Nougat, GOT-OCR2.0, MinerU, Swin Transformer를 포함한 관련 오픈소스 노력에 감사를 표합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.