Sobre o projeto
O Docling é uma biblioteca de processamento de documentos desenvolvida pela IBM Research, projetada especificamente para preparar dados para aplicações de Inteligência Artificial Generativa. Ela oferece suporte à análise de uma ampla gama de formatos, incluindo PDF, DOCX, PPTX, XLSX, HTML, EPUB, ODF, Apple Pages, LaTeX, texto simples, além de mídias como imagens (PNG, TIFF, JPEG), áudio (WAV, MP3), vídeo (MP4, AVI, MOV, MKV, WebM), emails (EML, MSG) e relatórios financeiros XBRL.
Para arquivos PDF, o Docling proporciona uma compreensão avançada do layout da página, ordem de leitura, estrutura de tabelas, código, fórmulas e classificação de imagens. Os documentos são representados em um formato unificado chamado DoclingDocument, que pode ser exportado para Markdown, HTML, JSON, WebVTT, DocLang e DocTags. A ferramenta suporta execução local para ambientes isolados (air-gapped), possui extenso reconhecimento óptico de caracteres (OCR) para arquivos digitalizados e oferece suporte opcional a Modelos de Linguagem Visual (VLMs), como o GraniteDocling.
A transcrição de áudio utiliza ASR (Reconhecimento Automático de Fala), enquanto a análise de vídeo gera transcrições e quadros-chave. O projeto inclui uma interface de linha de comando (CLI) simples, um servidor API e um servidor MCP, além de integrações nativas com frameworks populares como LangChain, LlamaIndex, Crew AI e Haystack. Licenciado sob a licença MIT e hospedado sob a LF AI & Data, o Docling pode ser instalado via pip (requer Python 3.10+). O README do projeto demonstra como converter uma URL de PDF em Markdown em poucas linhas de Python.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.