PaddleOCR — open-source OCR-инструментарий для конвертации PDF и изображений в структурированные данные (JSON/Markdown) для LLM. Включает PP-OCRv6 для распознавания 100+ языков, PaddleOCR-VL для анализа документов и PP-StructureV3 для структурированного преобразования с учётом макета.
OPEN SOURCE, OPEN TO EVERYONE
Открытый код. Новые возможности.
Находите качественные проекты с открытым исходным кодом, отправляйте проекты анонимно, заявляйте права на свои проекты и редактируйте их.
✳Выбор редакции · Находите хороший open source4101найдено
Немного любопытства. Мир открытого кода.
THE FIRST COLLECTIONTopic: pdf-parser清除
paddleocrPaddlePaddle
НОВОЕmineruopendatalab
НОВОЕMinerU — это открытый движок разбора документов, преобразующий PDF, изображения, DOCX, PPTX и XLSX в структурированный Markdown/JSON для рабочих процессов LLM, RAG и агентов. Поддерживает двойные движки VLM+OCR, OCR на 109 языках и приватное/офлайн-развёртывание.
dolphinbytedance
НОВОЕDolphin — это открытая модель ByteDance для разбора изображений документов (ACL 2025), преобразующая PDF и фотографии страниц в структурированные Markdown/JSON, охватывая разметку, порядок чтения, текст, таблицы, формулы и код.