Об этом проекте
PDF Craft — это библиотека Python, предназначенная для отсканированных книг и академических или технических документов. Она извлекает содержимое страниц и упорядочивает основной текст, главы, оглавления, сноски, таблицы, формулы и изображения, чтобы результат было легче редактировать и читать.
Основные возможности
- PDF в Markdown, с текстовыми файлами и файлами графических ресурсов.
- PDF в EPUB, включая метаданные книги и оглавление.
- Перевод во время преобразования или перевод существующего EPUB, с режимами вывода только перевода и двуязычного вывода.
- Вывод переведённого PDF: извлечённый текст переводится и записывается обратно на исходные страницы.
- Многоразовые файлы извлечения (`.pcex`), которые можно сохранить один раз и позже повторно использовать для рендеринга, перевода или обработки на другой машине.
Способы использования
- Онлайн-приложение для опробования рабочего процесса в браузере.
- Python с удалённым OCR, для разработчиков, которые не хотят запускать OCR-модели локально; требуются Python, Poppler, а также URL и учётные данные совместимого OCR-сервиса.
- Python с локальным OCR, для разработчиков с собственной видеокартой NVIDIA; требуются Python, Poppler, CUDA, достаточный объём видеопамяти и файлы моделей.
Быстрый старт
Установите с помощью `python -m pip install pdf-craft`, затем настройте OCR-провайдера (например, сервис, совместимый с DeepSeek OCR) и вызовите `convert_pdf_to_markdown` или `convert_pdf_to_epub`. Для асинхронных приложений доступен фасад `AsyncPDFCraft`; синхронный фасад не следует вызывать из работающего цикла событий. В README отмечено, что примеры конечных точек являются заполнителями и должны быть заменены на работающий сервис.
OCR и требования
Проект поддерживает DeepSeek OCR, DeepSeek OCR 2 и Unlimited OCR, каждый с локальной и удалённой конфигурациями. Стандартная установка поддерживает удалённый OCR; локальный OCR требует дополнительного пакета `pdf-craft[local]`, соответствующей сборки PyTorch с поддержкой CUDA, достаточного объёма видеопамяти и файлов моделей, которые по умолчанию загружаются с Hugging Face или могут быть загружены локально. Поддержка языков зависит от этапа обработки: распознавание текста зависит от OCR-модели, а перевод зависит от переводчика и текстовой LLM. Параметр EPUB `lan` в настоящее время предлагает `zh` и `en`.
Документация и обратная связь
В README приведены ссылки на руководства по установке, OCR-бэкендам, преобразованию PDF и переводу, переводу EPUB, справочнику API, формату `.pcex` и устранению неполадок. Приветствуются issues и pull requests; при проблемах с преобразованием проект просит указать версию пакета, тип конфигурации OCR, журналы ошибок и минимальный файл, которым можно поделиться, предварительно удалив учётные данные и приватное содержимое. Проект выпущен под лицензией MIT, а сторонние зависимости и отдельные OCR-модели сохраняют свои собственные лицензии.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.