PaddleOCR es una herramienta de OCR de código abierto que convierte PDFs e imágenes en datos estructurados (JSON/Markdown) para LLMs. Incluye PP-OCRv6 para reconocimiento multilingüe (más de 100 idiomas), PaddleOCR-VL para análisis de documentos, y PP-StructureV3 para conversión basada en el diseño.
OPEN SOURCE, OPEN TO EVERYONE
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
✳Selección editorial · Descubre buen código abierto4109descubiertos
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONTopic: document-parsing清除
paddleocrPaddlePaddle
NUEVOdoclingdocling-project
NUEVODocling es una biblioteca de IBM Research para procesar documentos destinados a IA generativa. Soporta formatos como PDF, DOCX, imágenes y audio, con análisis avanzado de layouts y tablas. Exporta a Markdown/JSON, incluye OCR, modelos visuales y se integra con LangChain y LlamaIndex.