这个项目能做什么

PaddleOCR 是飞桨(PaddlePaddle)开发的全方位 OCR 与文档 AI 工具包,可将 PDF 文档和图片转换为 JSON 或 Markdown 格式的 LLM 就绪数据。 核心组件: - PP-OCRv6:多语言文本识别模型,单一统一模型支持 50+ 种语言,涵盖中文、英文、日文及 46 种拉丁语系语言,同时覆盖西里尔字母、阿拉伯文、天城文等 100+ 种语言。提供三种尺寸规格(tiny 1.5M 参数、small 7.7M 参数、medium 34.5M 参数),适配边缘、移动端和服务器部署。 - PaddleOCR-VL:0.9B 参数的视觉语言模型,专为文档解析设计,在 OmniDocBench 等基准测试中表现优异,可处理文字、公式、表格、图表、古籍、印章及罕见字符,输出带坐标信息的结构化 Markdown 和 JSON。 - PP-StructureV3:结构感知型文档转换流水线,为表格单元格、文本区域及其他版式元素提供细粒度坐标信息。 - HPD-Parsing:轻量级视觉语言模型,采用分层并行解码实现高吞吐文档解析。 工具包支持多种硬件后端,包括 NVIDIA GPU、Intel CPU、昆仑芯 XPU 及各类型 AI 加速卡。可通过 ONNX、OpenVINO、TensorRT 进行部署,也可作为 HTTP API 提供服务。PaddleOCR 已集成至 Dify、RAGFlow、Pathway、Cherry Studio 等 AI 应用平台。 官方浏览器推理 SDK PaddleOCR.js 允许直接在浏览器中运行 PP-OCR 模型。项目还支持将 Word、Excel 和 PowerPoint 文档转换为 Markdown,并可将解析结果导出为 DOCX 格式。