Sobre el proyecto
Docling es una biblioteca de procesamiento de documentos desarrollada por IBM Research, diseñada específicamente para preparar documentos para aplicaciones de inteligencia artificial generativa. Ofrece la capacidad de analizar una amplia gama de formatos, incluyendo PDF, DOCX, PPTX, XLSX, HTML, EPUB, ODF, Apple Pages, LaTeX, texto plano, imágenes (PNG, TIFF, JPEG), audio (WAV, MP3), video (MP4, AVI, MOV, MKV, WebM), correos electrónicos (EML, MSG) e informes financieros XBRL.
Para los archivos PDF, Docling proporciona una comprensión avanzada del diseño de página, el orden de lectura, la estructura de las tablas, el código, las fórmulas matemáticas y la clasificación de imágenes. Los documentos procesados se representan en un formato unificado llamado DoclingDocument, que puede exportarse a Markdown, HTML, JSON, WebVTT, DocLang y DocTags.
El proyecto admite la ejecución local para entornos aislados (air-gapped), ofrece capacidades extensas de reconocimiento óptico de caracteres (OCR) para archivos escaneados y soporta Modelos de Lenguaje Visual (VLM) opcionales como GraniteDocling. La transcripción de audio utiliza ASR (Reconocimiento Automático del Habla), mientras que el análisis de video produce transcripciones y fotogramas clave.
Docling incluye una interfaz de línea de comandos (CLI) sencilla, un servidor API y un servidor MCP, además de integraciones nativas con frameworks populares como LangChain, LlamaIndex, Crew AI y Haystack. Está licenciado bajo MIT y alojado bajo LF AI & Data. La instalación se realiza mediante pip (requiriendo Python 3.10 o superior), y su documentación muestra cómo convertir una URL de PDF a Markdown en pocas líneas de código.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.