Об этом проекте
pdf-inspector — это библиотека на Rust, созданная Firecrawl для быстрой классификации PDF и извлечения текста. Она определяет, является ли PDF текстовым, сканированным, основанным на изображениях или смешанным, и извлекает текст с учётом позиций, информации о шрифтах и порядка чтения в несколько колонок. Библиотека конвертирует PDF в чистый Markdown, включая заголовки, списки, блоки кода, таблицы, жирное и курсивное форматирование, URL-адреса и разрывы страниц. Поддерживаются CID-шрифты, текст с направлением справа налево, обнаружение проблем с кодировкой и выборочная маршрутизация OCR для страниц, которым это необходимо. Доступны привязки для Python, Node.js и браузерного WebAssembly, а также инструменты командной строки (pdf2md и detect-pdf). Стандартные сборки остаются лёгкими, а зависимости OCR загружаются только при необходимости. Бенчмарки на корпусе opendataloader-bench показывают конкурентоспособную скорость и качество для PDF с нативным текстом, таких как отчёты, научные статьи, счета и юридические документы.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.