프로젝트 소개
PDF Craft는 스캔된 책과 학술 또는 기술 문서를 대상으로 하는 Python 라이브러리입니다. 페이지 콘텐츠를 추출하고 본문, 챕터, 목차, 각주, 표, 수식, 이미지를 정리하여 결과물을 더 쉽게 편집하고 읽을 수 있게 합니다.
주요 기능
- PDF를 Markdown으로 변환, 텍스트 및 이미지 자산 파일 포함.
- PDF를 EPUB으로 변환, 책 메타데이터 및 목차 포함.
- 변환 중 번역 또는 기존 EPUB 번역, 번역 전용 및 이중 언어 출력 모드 지원.
- 번역된 PDF 출력: 추출된 텍스트를 번역하여 원본 페이지에 다시 작성.
- 재사용 가능한 추출 파일(.pcex)로 한 번 저장하고 다른 머신에서 렌더링, 번역 또는 처리에 재사용 가능.
사용 경로
- 브라우저에서 워크플로우를 시험해 볼 수 있는 온라인 앱.
- 원격 OCR을 사용하는 Python: 로컬에서 OCR 모델을 실행하고 싶지 않은 개발자용. Python, Poppler, 호환 OCR 서비스 URL 및 자격 증명 필요.
- 로컬 OCR을 사용하는 Python: 자체 NVIDIA GPU를 보유한 개발자용. Python, Poppler, CUDA, 충분한 VRAM 및 모델 파일 필요.
빠른 시작
`python -m pip install pdf-craft`로 설치한 후 OCR 공급업체(예: DeepSeek OCR 호환 서비스)를 구성하고 `convert_pdf_to_markdown` 또는 `convert_pdf_to_epub`을 호출합니다. 비동기 애플리케이션용 `AsyncPDFCraft` 파사드가 제공되며, 동기 파사드는 실행 중인 이벤트 루프에서 호출해서는 안 됩니다. README는 예제 엔드포인트가 자리 표시자이며 작동하는 서비스로 교체해야 한다고 명시합니다.
OCR 및 요구 사항
프로젝트는 DeepSeek OCR, DeepSeek OCR 2 및 Unlimited OCR을 지원하며 각각 로컬 및 원격 구성이 있습니다. 표준 설치 시 원격 OCR을 지원하며, 로컬 OCR은 `pdf-craft[local]` 추가 기능, 호환되는 CUDA 지원 PyTorch 빌드, 충분한 VRAM 및 모델 파일이 필요합니다. 모델 파일은 기본적으로 Hugging Face에서 다운로드되거나 로컬에서 로드할 수 있습니다. 언어 지원은 처리 단계에 따라 다릅니다: 텍스트 인식은 OCR 모델에 의존하고 번역은 번역기 및 텍스트 LLM에 의존합니다. EPUB `lan` 매개변수는 현재 `zh` 및 `en`을 제공합니다.
문서 및 피드백
README는 설치, OCR 백엔드, PDF 변환 및 번역, EPUB 번역, API 참조, .pcex 형식 및 문제 해결에 대한 가이드 링크를 제공합니다. 이슈 및 풀 리퀘스트를 환영하며, 변환 문제의 경우 패키지 버전, OCR 구성 유형, 오류 로그 및 공유 가능한 최소 파일을 요청하며 자격 증명과 개인 콘텐츠는 먼저 제거해야 합니다. 프로젝트는 MIT 라이선스로 배포되며 타사 종속성 및 선택된 OCR 모델은 자체 라이선스를 유지합니다.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.