Об этом проекте
PaddleOCR — это комплексный OCR-инструментарий и набор для документного AI, разработанный PaddlePaddle. Он конвертирует PDF-документы и изображения в структурированные данные в форматах JSON или Markdown, готовые для работы с LLM.
Ключевые компоненты:
- PP-OCRv6: многоязычная модель распознавания текста, поддерживающая более 50 языков в единой модели, включая китайский, английский, японский и 46 языков латинского алфавита. Также охватывает кириллицу, арабскую, деванагири и другие письменности — всего более 100 языков. Доступна в трёх размерах (tiny 1,5M, small 7,7M, medium 34,5M параметров) для развёртывания на edge-устройствах, мобильных платформах и серверах.
- PaddleOCR-VL: vision-language модель (0,9 млрд параметров) для анализа документов. Демонстрирует высокие результаты на бенчмарках OmniDocBench и обрабатывает текст, формулы, таблицы, диаграммы, древние документы, печати и редкие символы. Выдаёт структурированный Markdown и JSON с координатной информацией.
- PP-StructureV3: конвейер структурированного преобразования документов, обеспечивающий детализированную координатную информацию для ячеек таблиц, текстовых областей и других элементов макета.
- HPD-Parsing: лёгкая vision-language модель для высокопроизводительного анализа документов с иерархическим параллельным декодированием.
Инструментарий поддерживает несколько аппаратных бэкендов, включая NVIDIA GPU, Intel CPU, Kunlunxin XPU и различные AI-акселераторы. Развёртывание возможно через ONNX, OpenVINO, TensorRT или в виде HTTP API. PaddleOCR интегрирован с AI-платформами, такими как Dify, RAGFlow, Pathway и Cherry Studio.
Официальный SDK браузерного вывода PaddleOCR.js позволяет запускать модели PP-OCR непосредственно в браузере. Проект также поддерживает конвертацию документов Word, Excel и PowerPoint в Markdown, а также экспорт результатов анализа в формат DOCX.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.