Sobre el proyecto

dots.ocr es un modelo de visión-lenguaje de código abierto centrado en el análisis del diseño de documentos. Según su README, está diseñado para la accesibilidad universal y puede reconocer una amplia variedad de escrituras humanas. Reporta resultados sólidos en puntos de referencia de análisis de documentos multilingües entre modelos de tamaño comparable, y también maneja gráficos estructurados como tablas y diagramas convirtiéndolos en código SVG, además de capturas web y texto de escena. Capacidades clave descritas en el README: - Análisis de documentos multilingüe: extrae elementos de diseño con cuadros delimitadores, categorías y contenido de texto de imágenes y PDF. - Las categorías de diseño incluyen Caption, Footnote, Formula, List-item, Page-footer, Page-header, Picture, Section-header, Table, Text y Title. - Formato de salida: fórmulas como LaTeX, tablas como HTML y otro texto como Markdown, con elementos ordenados según el orden de lectura humano. - Análisis de gráficos estructurados: convierte tablas, diagramas, fórmulas químicas y logotipos en código SVG. - Tareas adicionales: análisis de páginas web y detección de texto en escenas. - También se admite respuesta a preguntas visuales generales. Despliegue y uso: - Instalación mediante conda y pip, con una imagen Docker como alternativa. - Los pesos del modelo se pueden descargar con un script proporcionado, incluida una opción de ModelScope. - Se recomienda vLLM para el despliegue; el README afirma que dots.ocr se ha integrado en vLLM desde la versión 0.11.0. - Se admite la inferencia con Hugging Face Transformers, incluida una ruta de inferencia en CPU mencionada en un issue. - Un script de análisis puede procesar una sola imagen o PDF, con opciones de solo detección de diseño o solo texto, y puede generar JSON estructurado, Markdown y una imagen de visualización del diseño. - Hay una demo en vivo disponible. El README también enumera limitaciones: las tablas complejas y las fórmulas matemáticas siguen siendo difíciles debido a la arquitectura compacta del modelo, el análisis basado en SVG de gráficos estructurados aún no es totalmente robusto, y todavía pueden ocurrir fallos de análisis ocasionales. Señala que dots.ocr-1.5 fue posteriormente renombrado como dots.mocr, con pesos actualizados y un artículo.