このプロジェクトについて
PDF Craftは、スキャン済みの書籍や学術・技術文書を対象としたPythonライブラリです。ページ内容を抽出し、本文、章、目次、脚注、表、数式、画像を整理することで、編集や閲覧を容易にします。
主な機能
- PDFからMarkdownへの変換(テキストおよび画像アセットファイル付き)
- PDFからEPUBへの変換(書籍メタデータと目次を含む)
- 変換時の翻訳、または既存EPUBの翻訳。翻訳のみとバイリンガル出力のモードに対応
- 翻訳済みPDF出力:抽出されたテキストを翻訳し、元のページに書き戻す
- 再利用可能な抽出ファイル(`.pcex`)。一度保存すれば、別のマシンでのレンダリング、翻訳、処理に再利用可能
利用方法
- オンラインアプリ:ブラウザでワークフローを試せる
- リモートOCRを使用するPython:OCRモデルをローカルで実行したくない開発者向け。Python、Poppler、互換性のあるOCRサービスURLと認証情報が必要
- ローカルOCRを使用するPython:自前のNVIDIA GPUを持つ開発者向け。Python、Poppler、CUDA、十分なVRAM、モデルファイルが必要
クイックスタート
`python -m pip install pdf-craft`でインストールし、OCRベンダー(例:DeepSeek OCR互換サービス)を設定して、`convert_pdf_to_markdown`または`convert_pdf_to_epub`を呼び出します。非同期アプリケーション向けに`AsyncPDFCraft`ファサードが用意されており、同期ファサードは実行中のイベントループから呼び出さないでください。READMEには、例示のエンドポイントはプレースホルダーであり、動作するサービスに置き換える必要があると記載されています。
OCRと要件
このプロジェクトはDeepSeek OCR、DeepSeek OCR 2、Unlimited OCRをサポートしており、それぞれローカル構成とリモート構成があります。標準インストールではリモートOCRがサポートされ、ローカルOCRには`pdf-craft[local]`エクストラ、対応するCUDA対応PyTorchビルド、十分なVRAM、モデルファイルが必要です。モデルファイルはデフォルトでHugging Faceからダウンロードされるか、ローカルから読み込むことができます。言語サポートは処理段階によって異なります。テキスト認識はOCRモデルに依存し、翻訳は翻訳者とテキストLLMに依存します。EPUBの`lan`パラメータは現在`zh`と`en`を提供しています。
ドキュメントとフィードバック
READMEには、インストール、OCRバックエンド、PDF変換と翻訳、EPUB翻訳、APIリファレンス、`.pcex`形式、トラブルシューティングのガイドへのリンクがあります。Issueやプルリクエストは歓迎されており、変換の問題については、パッケージバージョン、OCR構成タイプ、エラーログ、共有可能な最小ファイルの提供が求められます。その際、認証情報やプライベートな内容は事前に削除してください。このプロジェクトはMITライセンスで公開されており、サードパーティの依存関係や選択されたOCRモデルにはそれぞれのライセンスが適用されます。
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.