Sobre o projeto
PDF Craft é uma biblioteca Python voltada para livros digitalizados e documentos acadêmicos ou técnicos. Ela extrai o conteúdo das páginas e organiza o texto principal, capítulos, sumários, notas de rodapé, tabelas, fórmulas e imagens para que o resultado possa ser editado e lido com mais facilidade.
Principais recursos
- PDF para Markdown, com arquivos de texto e de recursos de imagem.
- PDF para EPUB, incluindo metadados do livro e um sumário.
- Tradução durante a conversão, ou tradução de um EPUB existente, com modos de saída somente tradução e bilíngue.
- Saída em PDF traduzido: o texto extraído é traduzido e gravado de volta nas páginas de origem.
- Arquivos de extração reutilizáveis (`.pcex`) que podem ser salvos uma vez e reutilizados depois para renderização, tradução ou processamento em outra máquina.
Formas de uso
- Aplicativo online para experimentar o fluxo de trabalho no navegador.
- Python com OCR remoto, para desenvolvedores que não querem executar modelos de OCR localmente; requer Python, Poppler e uma URL e credenciais de um serviço de OCR compatível.
- Python com OCR local, para desenvolvedores com sua própria GPU NVIDIA; requer Python, Poppler, CUDA, VRAM suficiente e arquivos de modelo.
Início rápido
Instale com `python -m pip install pdf-craft`, depois configure um fornecedor de OCR (por exemplo, um serviço compatível com DeepSeek OCR) e chame `convert_pdf_to_markdown` ou `convert_pdf_to_epub`. Uma fachada `AsyncPDFCraft` está disponível para aplicações assíncronas; a fachada síncrona não deve ser chamada a partir de um event loop em execução. O README observa que os endpoints de exemplo são placeholders e devem ser substituídos por um serviço funcional.
OCR e requisitos
O projeto suporta DeepSeek OCR, DeepSeek OCR 2 e Unlimited OCR, cada um com configurações local e remota. A instalação padrão suporta OCR remoto; o OCR local requer o extra `pdf-craft[local]`, uma build do PyTorch compatível com CUDA, VRAM suficiente e arquivos de modelo, que são baixados do Hugging Face por padrão ou podem ser carregados localmente. O suporte a idiomas depende do estágio de processamento: o reconhecimento de texto depende do modelo de OCR, e a tradução depende do tradutor e do LLM de texto. O parâmetro `lan` do EPUB atualmente oferece `zh` e `en`.
Documentação e feedback
O README traz links para guias de instalação, backends de OCR, conversão e tradução de PDF, tradução de EPUB, referência da API, o formato `.pcex` e solução de problemas. Issues e pull requests são bem-vindos; para problemas de conversão, o projeto pede a versão do pacote, o tipo de configuração de OCR, os logs de erro e um arquivo mínimo compartilhável, com credenciais e conteúdo privado removidos antes. O projeto é distribuído sob a licença MIT, e dependências de terceiros e modelos de OCR selecionados mantêm suas próprias licenças.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.