Об этом проекте

PaddleOCR — это комплексный OCR-инструментарий и набор для документного AI, разработанный PaddlePaddle. Он конвертирует PDF-документы и изображения в структурированные данные в форматах JSON или Markdown, готовые для работы с LLM. Ключевые компоненты: - PP-OCRv6: многоязычная модель распознавания текста, поддерживающая более 50 языков в единой модели, включая китайский, английский, японский и 46 языков латинского алфавита. Также охватывает кириллицу, арабскую, деванагири и другие письменности — всего более 100 языков. Доступна в трёх размерах (tiny 1,5M, small 7,7M, medium 34,5M параметров) для развёртывания на edge-устройствах, мобильных платформах и серверах. - PaddleOCR-VL: vision-language модель (0,9 млрд параметров) для анализа документов. Демонстрирует высокие результаты на бенчмарках OmniDocBench и обрабатывает текст, формулы, таблицы, диаграммы, древние документы, печати и редкие символы. Выдаёт структурированный Markdown и JSON с координатной информацией. - PP-StructureV3: конвейер структурированного преобразования документов, обеспечивающий детализированную координатную информацию для ячеек таблиц, текстовых областей и других элементов макета. - HPD-Parsing: лёгкая vision-language модель для высокопроизводительного анализа документов с иерархическим параллельным декодированием. Инструментарий поддерживает несколько аппаратных бэкендов, включая NVIDIA GPU, Intel CPU, Kunlunxin XPU и различные AI-акселераторы. Развёртывание возможно через ONNX, OpenVINO, TensorRT или в виде HTTP API. PaddleOCR интегрирован с AI-платформами, такими как Dify, RAGFlow, Pathway и Cherry Studio. Официальный SDK браузерного вывода PaddleOCR.js позволяет запускать модели PP-OCR непосредственно в браузере. Проект также поддерживает конвертацию документов Word, Excel и PowerPoint в Markdown, а также экспорт результатов анализа в формат DOCX.