Sobre el proyecto

pdf-inspector es una biblioteca en Rust creada por Firecrawl para la clasificación rápida de PDF y la extracción de texto. Detecta si un PDF está basado en texto, escaneado, basado en imágenes o es mixto, y extrae texto con conciencia de posición, información de fuentes y orden de lectura multicolumna. La biblioteca convierte PDFs a Markdown limpio, incluyendo encabezados, listas, bloques de código, tablas, formato de negrita/cursiva, URLs y saltos de página. Soporta fuentes CID, texto RTL, detección de problemas de codificación y enrutamiento selectivo de OCR para páginas que lo necesiten. Hay bindings disponibles para Python, Node.js y WebAssembly en el navegador, junto con herramientas CLI (pdf2md y detect-pdf). Las compilaciones predeterminadas se mantienen ligeras, con dependencias de OCR cargadas solo cuando se necesitan. Los benchmarks en el corpus opendataloader-bench muestran velocidad y calidad competitivas para PDFs de texto nativo como informes, artículos de investigación, facturas y documentos legales.