このプロジェクトについて

pdf-inspectorは、Firecrawlが開発したRustライブラリで、高速なPDF分類とテキスト抽出を目的としています。PDFがテキストベース、スキャン済み、画像ベース、または混合のいずれであるかを検出し、位置情報、フォント情報、マルチカラムの読み順を考慮したテキスト抽出を行います。このライブラリは、見出し、リスト、コードブロック、テーブル、太字・斜体の書式、URL、ページ区切りを含むクリーンなMarkdownへの変換をサポートします。CIDフォント、RTLテキスト、エンコーディング問題の検出、および必要に応じたページ単位の選択的OCRルーティングにも対応しています。Python、Node.js、ブラウザ用WebAssembly向けのバインディングに加え、CLIツール(pdf2mdおよびdetect-pdf)も提供されます。デフォルトのビルドは軽量で、OCR依存関係は必要な場合のみ読み込まれます。opendataloader-benchコーパスでのベンチマークでは、レポート、研究論文、請求書、法的文書などのネイティブテキストPDFに対して、競争力のある速度と品質を示しています。