这个项目能做什么

PDF Craft 是一个面向扫描版图书及学术或技术文档的 Python 库。它提取页面内容,并整理正文、章节、目录、脚注、表格、公式和图像,使结果更易于编辑和阅读。 主要能力 - PDF 转 Markdown,包含文本和图像资源文件。 - PDF 转 EPUB,包含图书元数据和目录。 - 转换过程中翻译,或翻译现有 EPUB,支持仅翻译和双语输出模式。 - 翻译后 PDF 输出:提取的文本被翻译后写回源页面。 - 可复用的提取文件(`.pcex`),可保存一次,之后在另一台机器上用于渲染、翻译或处理。 使用路径 - 在线应用,用于在浏览器中试用该工作流。 - 使用远程 OCR 的 Python,适合不想在本地运行 OCR 模型的开发者;需要 Python、Poppler,以及兼容的 OCR 服务 URL 和凭据。 - 使用本地 OCR 的 Python,适合拥有自己的 NVIDIA GPU 的开发者;需要 Python、Poppler、CUDA、足够的显存和模型文件。 快速开始 使用 `python -m pip install pdf-craft` 安装,然后配置 OCR 供应商(例如兼容 DeepSeek OCR 的服务),并调用 `convert_pdf_to_markdown` 或 `convert_pdf_to_epub`。异步应用可使用 `AsyncPDFCraft` 门面;同步门面不应在运行中的事件循环中调用。README 指出,示例端点只是占位符,必须替换为可用的服务。 OCR 与要求 该项目支持 DeepSeek OCR、DeepSeek OCR 2 和 Unlimited OCR,每种都提供本地和远程配置。标准安装支持远程 OCR;本地 OCR 需要 `pdf-craft[local]` 附加项、匹配的启用 CUDA 的 PyTorch 构建、足够的显存和模型文件,模型文件默认从 Hugging Face 下载,也可从本地加载。语言支持取决于处理阶段:文本识别取决于 OCR 模型,翻译取决于翻译器和文本 LLM。EPUB 的 `lan` 参数目前提供 `zh` 和 `en`。 文档与反馈 README 链接了安装、OCR 后端、PDF 转换与翻译、EPUB 翻译、API 参考、`.pcex` 格式和故障排除指南。欢迎提交 issue 和 pull request;对于转换问题,项目要求提供软件包版本、OCR 配置类型、错误日志和可共享的最小文件,并先移除凭据和私密内容。该项目基于 MIT 许可证发布,第三方依赖和所选 OCR 模型保留各自的许可证。