Sobre el proyecto
dots.ocr es un modelo de visión-lenguaje de código abierto centrado en el análisis del diseño de documentos. Según su README, está diseñado para la accesibilidad universal y puede reconocer una amplia variedad de escrituras humanas. Reporta resultados sólidos en puntos de referencia de análisis de documentos multilingües entre modelos de tamaño comparable, y también maneja gráficos estructurados como tablas y diagramas convirtiéndolos en código SVG, además de capturas web y texto de escena.
Capacidades clave descritas en el README:
- Análisis de documentos multilingüe: extrae elementos de diseño con cuadros delimitadores, categorías y contenido de texto de imágenes y PDF.
- Las categorías de diseño incluyen Caption, Footnote, Formula, List-item, Page-footer, Page-header, Picture, Section-header, Table, Text y Title.
- Formato de salida: fórmulas como LaTeX, tablas como HTML y otro texto como Markdown, con elementos ordenados según el orden de lectura humano.
- Análisis de gráficos estructurados: convierte tablas, diagramas, fórmulas químicas y logotipos en código SVG.
- Tareas adicionales: análisis de páginas web y detección de texto en escenas.
- También se admite respuesta a preguntas visuales generales.
Despliegue y uso:
- Instalación mediante conda y pip, con una imagen Docker como alternativa.
- Los pesos del modelo se pueden descargar con un script proporcionado, incluida una opción de ModelScope.
- Se recomienda vLLM para el despliegue; el README afirma que dots.ocr se ha integrado en vLLM desde la versión 0.11.0.
- Se admite la inferencia con Hugging Face Transformers, incluida una ruta de inferencia en CPU mencionada en un issue.
- Un script de análisis puede procesar una sola imagen o PDF, con opciones de solo detección de diseño o solo texto, y puede generar JSON estructurado, Markdown y una imagen de visualización del diseño.
- Hay una demo en vivo disponible.
El README también enumera limitaciones: las tablas complejas y las fórmulas matemáticas siguen siendo difíciles debido a la arquitectura compacta del modelo, el análisis basado en SVG de gráficos estructurados aún no es totalmente robusto, y todavía pueden ocurrir fallos de análisis ocasionales. Señala que dots.ocr-1.5 fue posteriormente renombrado como dots.mocr, con pesos actualizados y un artículo.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.