このプロジェクトについて

PDF Craftは、スキャン済みの書籍や学術・技術文書を対象としたPythonライブラリです。ページ内容を抽出し、本文、章、目次、脚注、表、数式、画像を整理することで、編集や閲覧を容易にします。 主な機能 - PDFからMarkdownへの変換(テキストおよび画像アセットファイル付き) - PDFからEPUBへの変換(書籍メタデータと目次を含む) - 変換時の翻訳、または既存EPUBの翻訳。翻訳のみとバイリンガル出力のモードに対応 - 翻訳済みPDF出力:抽出されたテキストを翻訳し、元のページに書き戻す - 再利用可能な抽出ファイル(`.pcex`)。一度保存すれば、別のマシンでのレンダリング、翻訳、処理に再利用可能 利用方法 - オンラインアプリ:ブラウザでワークフローを試せる - リモートOCRを使用するPython:OCRモデルをローカルで実行したくない開発者向け。Python、Poppler、互換性のあるOCRサービスURLと認証情報が必要 - ローカルOCRを使用するPython:自前のNVIDIA GPUを持つ開発者向け。Python、Poppler、CUDA、十分なVRAM、モデルファイルが必要 クイックスタート `python -m pip install pdf-craft`でインストールし、OCRベンダー(例:DeepSeek OCR互換サービス)を設定して、`convert_pdf_to_markdown`または`convert_pdf_to_epub`を呼び出します。非同期アプリケーション向けに`AsyncPDFCraft`ファサードが用意されており、同期ファサードは実行中のイベントループから呼び出さないでください。READMEには、例示のエンドポイントはプレースホルダーであり、動作するサービスに置き換える必要があると記載されています。 OCRと要件 このプロジェクトはDeepSeek OCR、DeepSeek OCR 2、Unlimited OCRをサポートしており、それぞれローカル構成とリモート構成があります。標準インストールではリモートOCRがサポートされ、ローカルOCRには`pdf-craft[local]`エクストラ、対応するCUDA対応PyTorchビルド、十分なVRAM、モデルファイルが必要です。モデルファイルはデフォルトでHugging Faceからダウンロードされるか、ローカルから読み込むことができます。言語サポートは処理段階によって異なります。テキスト認識はOCRモデルに依存し、翻訳は翻訳者とテキストLLMに依存します。EPUBの`lan`パラメータは現在`zh`と`en`を提供しています。 ドキュメントとフィードバック READMEには、インストール、OCRバックエンド、PDF変換と翻訳、EPUB翻訳、APIリファレンス、`.pcex`形式、トラブルシューティングのガイドへのリンクがあります。Issueやプルリクエストは歓迎されており、変換の問題については、パッケージバージョン、OCR構成タイプ、エラーログ、共有可能な最小ファイルの提供が求められます。その際、認証情報やプライベートな内容は事前に削除してください。このプロジェクトはMITライセンスで公開されており、サードパーティの依存関係や選択されたOCRモデルにはそれぞれのライセンスが適用されます。