这个项目能做什么
Dolphin是字节跳动开源的文档图像解析模型,在ACL 2025论文《Document Image Parsing via Heterogeneous Anchor Prompting》中提出。它将文档图像(包括数字生成和拍摄的图像)转换为结构化输出(如JSON和Markdown),解决了文本段落、图形、公式、表格和代码块等复杂交织元素的解析难题。
该模型采用基于单一视觉语言模型的文档类型感知两阶段架构。第一阶段分类文档类型(数字或拍摄)并执行布局分析和阅读顺序预测。第二阶段应用混合解析策略:对拍摄文档进行整体解析,对数字文档进行并行逐元素解析,使用针对不同元素类型定制的异构锚点提示。并行解析机制是项目在轻量架构下保持推理效率的关键部分。
版本历史:原始Dolphin(0.3B参数)于2025年5月发布;Dolphin-1.5(2025年10月)保持0.3B大小,同时提升解析质量;Dolphin-v2(2025年12月)扩展到3B参数,并新增21元素检测、属性字段提取、专用公式和代码解析,以及更稳健的拍摄文档解析。旧版本仍可在单独分支获取。项目还发布了Fox-Page基准,这是Fox数据集的手动精炼子集,用于文档解析评估。
在OmniDocBench(v1.5)上,README报告Dolphin总体得分为74.67,Dolphin-1.5为85.06,Dolphin-v2为89.78,各版本在文本编辑距离、公式CDM、表格TEDS/TEDS-S和阅读顺序指标上均有相应提升。
用法:仓库提供三种粒度的脚本——页面级解析(整页或多页PDF转换为结构化JSON/Markdown,可配置批大小以并行元素解码)、元素级解析(单个文本、表格、公式或代码元素)和布局解析。预训练模型在Hugging Face(ByteDance/Dolphin-v2)上分发,并支持Hugging Face Transformers集成。为加速推理,项目包含vLLM和TensorRT-LLM部署指南。安装标准:克隆仓库、安装pip依赖、从Hugging Face Hub下载模型。
代码采用MIT许可证,维护者积极邀请用户通过GitHub问题报告不良案例,以指导模型改进。项目致谢相关开源工作,包括OmniDocBench、Donut、Nougat、GOT-OCR2.0、MinerU和Swin Transformer。
评论
0 评分人数达到10人后显示
登录后参与讨论。