Sobre o projeto
dots.ocr é um modelo de visão-linguagem de código aberto focado em análise de layout de documentos. De acordo com seu README, é projetado para acessibilidade universal e pode reconhecer uma ampla gama de scripts humanos. Relata resultados fortes em benchmarks de análise de documentos multilíngues entre modelos de tamanho comparável, e também lida com gráficos estruturados, como gráficos e diagramas, convertendo-os em código SVG, além de capturas de tela da web e texto de cena.
Principais capacidades descritas no README:
- Análise de documentos multilíngues: extrai elementos de layout com caixas delimitadoras, categorias e conteúdo de texto de imagens e PDFs.
- Categorias de layout incluem Legenda, Nota de rodapé, Fórmula, Item de lista, Rodapé de página, Cabeçalho de página, Imagem, Cabeçalho de seção, Tabela, Texto e Título.
- Formatação de saída: fórmulas como LaTeX, tabelas como HTML, e outros textos como Markdown, com elementos ordenados em ordem de leitura humana.
- Análise de gráficos estruturados: converte gráficos, diagramas, fórmulas químicas e logotipos em código SVG.
- Tarefas adicionais: análise de páginas da web e detecção de texto em cena.
- Resposta a perguntas visuais gerais também é suportada.
Implantação e uso:
- Instalação via conda e pip, com uma imagem Docker oferecida como alternativa.
- Os pesos do modelo podem ser baixados com um script fornecido, incluindo uma opção ModelScope.
- vLLM é recomendado para implantação; o README afirma que dots.ocr foi integrado ao vLLM desde a versão 0.11.0.
- A inferência com Hugging Face Transformers é suportada, incluindo um caminho de inferência em CPU referenciado em uma issue.
- Um script de análise pode processar uma única imagem ou PDF, com opções para detecção de layout apenas ou análise somente de texto, e pode gerar JSON estruturado, Markdown e uma imagem de visualização de layout.
- Uma demonstração ao vivo está disponível.
O README também lista limitações: tabelas complexas e fórmulas matemáticas permanecem difíceis devido à arquitetura compacta do modelo, a análise baseada em SVG de gráficos estruturados ainda não é totalmente robusta, e falhas ocasionais de análise podem ocorrer. Observa que dots.ocr-1.5 foi posteriormente renomeado para dots.mocr, com pesos atualizados e um artigo.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.