这个项目能做什么
PDF Craft 是一个面向扫描版图书及学术或技术文档的 Python 库。它提取页面内容,并整理正文、章节、目录、脚注、表格、公式和图像,使结果更易于编辑和阅读。
主要能力
- PDF 转 Markdown,包含文本和图像资源文件。
- PDF 转 EPUB,包含图书元数据和目录。
- 转换过程中翻译,或翻译现有 EPUB,支持仅翻译和双语输出模式。
- 翻译后 PDF 输出:提取的文本被翻译后写回源页面。
- 可复用的提取文件(`.pcex`),可保存一次,之后在另一台机器上用于渲染、翻译或处理。
使用路径
- 在线应用,用于在浏览器中试用该工作流。
- 使用远程 OCR 的 Python,适合不想在本地运行 OCR 模型的开发者;需要 Python、Poppler,以及兼容的 OCR 服务 URL 和凭据。
- 使用本地 OCR 的 Python,适合拥有自己的 NVIDIA GPU 的开发者;需要 Python、Poppler、CUDA、足够的显存和模型文件。
快速开始
使用 `python -m pip install pdf-craft` 安装,然后配置 OCR 供应商(例如兼容 DeepSeek OCR 的服务),并调用 `convert_pdf_to_markdown` 或 `convert_pdf_to_epub`。异步应用可使用 `AsyncPDFCraft` 门面;同步门面不应在运行中的事件循环中调用。README 指出,示例端点只是占位符,必须替换为可用的服务。
OCR 与要求
该项目支持 DeepSeek OCR、DeepSeek OCR 2 和 Unlimited OCR,每种都提供本地和远程配置。标准安装支持远程 OCR;本地 OCR 需要 `pdf-craft[local]` 附加项、匹配的启用 CUDA 的 PyTorch 构建、足够的显存和模型文件,模型文件默认从 Hugging Face 下载,也可从本地加载。语言支持取决于处理阶段:文本识别取决于 OCR 模型,翻译取决于翻译器和文本 LLM。EPUB 的 `lan` 参数目前提供 `zh` 和 `en`。
文档与反馈
README 链接了安装、OCR 后端、PDF 转换与翻译、EPUB 翻译、API 参考、`.pcex` 格式和故障排除指南。欢迎提交 issue 和 pull request;对于转换问题,项目要求提供软件包版本、OCR 配置类型、错误日志和可共享的最小文件,并先移除凭据和私密内容。该项目基于 MIT 许可证发布,第三方依赖和所选 OCR 模型保留各自的许可证。
评论
0 人表达喜爱 · 满10人后显示 Deer Point
登录后参与讨论。