Sobre o projeto

dots.ocr é um modelo de visão-linguagem de código aberto focado em análise de layout de documentos. De acordo com seu README, é projetado para acessibilidade universal e pode reconhecer uma ampla gama de scripts humanos. Relata resultados fortes em benchmarks de análise de documentos multilíngues entre modelos de tamanho comparável, e também lida com gráficos estruturados, como gráficos e diagramas, convertendo-os em código SVG, além de capturas de tela da web e texto de cena. Principais capacidades descritas no README: - Análise de documentos multilíngues: extrai elementos de layout com caixas delimitadoras, categorias e conteúdo de texto de imagens e PDFs. - Categorias de layout incluem Legenda, Nota de rodapé, Fórmula, Item de lista, Rodapé de página, Cabeçalho de página, Imagem, Cabeçalho de seção, Tabela, Texto e Título. - Formatação de saída: fórmulas como LaTeX, tabelas como HTML, e outros textos como Markdown, com elementos ordenados em ordem de leitura humana. - Análise de gráficos estruturados: converte gráficos, diagramas, fórmulas químicas e logotipos em código SVG. - Tarefas adicionais: análise de páginas da web e detecção de texto em cena. - Resposta a perguntas visuais gerais também é suportada. Implantação e uso: - Instalação via conda e pip, com uma imagem Docker oferecida como alternativa. - Os pesos do modelo podem ser baixados com um script fornecido, incluindo uma opção ModelScope. - vLLM é recomendado para implantação; o README afirma que dots.ocr foi integrado ao vLLM desde a versão 0.11.0. - A inferência com Hugging Face Transformers é suportada, incluindo um caminho de inferência em CPU referenciado em uma issue. - Um script de análise pode processar uma única imagem ou PDF, com opções para detecção de layout apenas ou análise somente de texto, e pode gerar JSON estruturado, Markdown e uma imagem de visualização de layout. - Uma demonstração ao vivo está disponível. O README também lista limitações: tabelas complexas e fórmulas matemáticas permanecem difíceis devido à arquitetura compacta do modelo, a análise baseada em SVG de gráficos estruturados ainda não é totalmente robusta, e falhas ocasionais de análise podem ocorrer. Observa que dots.ocr-1.5 foi posteriormente renomeado para dots.mocr, com pesos atualizados e um artigo.