프로젝트 소개

pdf-inspector는 Firecrawl이 구축한 Rust 라이브러리로, 빠른 PDF 분류 및 텍스트 추출을 위해 설계되었습니다. PDF가 텍스트 기반인지, 스캔되었는지, 이미지 기반인지, 혼합인지 감지하고, 위치 인식, 글꼴 정보, 다중 열 읽기 순서를 포함한 텍스트를 추출합니다. 이 라이브러리는 제목, 목록, 코드 블록, 표, 굵게/기울임꼴 서식, URL, 페이지 나누기를 포함한 깨끗한 Markdown으로 PDF를 변환합니다. CID 글꼴, RTL 텍스트, 인코딩 문제 감지, 그리고 필요할 때 페이지에 대한 선택적 OCR 라우팅을 지원합니다. Python, Node.js, 브라우저 WebAssembly용 바인딩과 함께 CLI 도구(pdf2md 및 detect-pdf)를 제공합니다. 기본 빌드는 가볍게 유지되며, OCR 종속성은 필요할 때만 로드됩니다. opendataloader-bench 코퍼스의 벤치마크는 보고서, 연구 논문, 인보이스, 법률 문서와 같은 네이티브 텍스트 PDF에 대해 경쟁력 있는 속도와 품질을 보여줍니다.