这个项目能做什么

Marker 是 Datalab 出品的文档转换工具,可将 PDF 及其他文档格式转换为 Markdown、JSON、HTML 或分块。根据 README,它支持所有语言的 PDF、图片、PPTX、DOCX、XLSX、HTML 和 EPUB 输入,并处理表格、表单、公式、行内数学、链接、引用和代码块。它可以提取并保存图片,移除页眉、页脚和其他杂质。 该项目提供两种主要转换模式。平衡模式面向 GPU,使用 surya VLM 进行布局、对内联数学进行 OCR,并在嵌入文本质量差时重新 OCR 整页。快速模式针对 CPU 优化,使用轻量级 rf-detr 布局检测器配合 pdftext 提取,并尽量少用 VLM。--disable_ocr 选项可关闭所有 VLM 调用以进行纯文本层提取。Marker 可在 GPU、CPU 或 MPS 上运行。 可选的 --use_llm 标志启用混合模式以提高准确性,支持 Gemini、Claude、兼容 OpenAI 的端点、Azure、Vertex、OpenRouter 和 Ollama。README 称,平衡模式在 olmocr-bench(包含 1,403 个 PDF 的第三方基准)上总体得分 76.0%,在原生数字 PDF 上得分 83.5%。 安装方式为 pip install marker-pdf,非 PDF 格式需使用 marker-pdf[full]。用法包括 Streamlit GUI(marker_gui)、单文件转换(marker_single)和文件夹转换(marker),支持页面范围、输出格式、工作进程数、跨机器分块以及跳过已有文件等选项。Python API 提供 PdfConverter、TableConverter 和 OCRConverter 类,以及用于自定义配置的 ConfigParser。输出格式包括带图片链接和 LaTeX 公式的 Markdown、HTML、带块类型和多边形坐标的树状结构 JSON,以及用于 RAG 的扁平化分块格式。也可通过 marker_server 启动简单的 FastAPI 服务器。 代码采用 Apache 2.0 许可,而模型权重使用修改后的 AI Pubs Open Rail-M 许可。README 还提到一个托管平台,运行准确度更高的 Chandra 模型,默认零数据保留,通过 SOC 2 Type 2 认证,并提供自定义 BAA。