À propos du projet
pdf-inspector est une bibliothèque Rust développée par Firecrawl pour la classification rapide de PDF et l'extraction de texte. Elle détecte si un PDF est textuel, numérisé, basé sur des images ou mixte, et extrait le texte avec une conscience de la position, des informations sur les polices et un ordre de lecture multi-colonnes. La bibliothèque convertit les PDF en Markdown propre, incluant les titres, les listes, les blocs de code, les tableaux, la mise en forme gras/italique, les URL et les sauts de page. Elle prend en charge les polices CID, le texte RTL, la détection des problèmes d'encodage et le routage OCR sélectif pour les pages qui en ont besoin. Des liaisons sont disponibles pour Python, Node.js et WebAssembly dans le navigateur, ainsi que des outils CLI (pdf2md et detect-pdf). Les builds par défaut restent légers, les dépendances OCR n'étant chargées que lorsque cela est nécessaire. Les benchmarks sur le corpus opendataloader-bench montrent une vitesse et une qualité compétitives pour les PDF à texte natif tels que les rapports, les articles de recherche, les factures et les documents juridiques.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.