À propos du projet

PDF Craft est une bibliothèque Python destinée aux livres numérisés et aux documents académiques ou techniques. Elle extrait le contenu des pages et organise le corps du texte, les chapitres, les tables des matières, les notes de bas de page, les tableaux, les formules et les images afin que le résultat puisse être édité et lu plus facilement. Capacités principales - PDF vers Markdown, avec des fichiers d'actifs texte et image. - PDF vers EPUB, incluant les métadonnées du livre et une table des matières. - Traduction pendant la conversion, ou traduction d'un EPUB existant, avec des modes de sortie traduction seule et bilingue. - Sortie PDF traduite : le texte extrait est traduit et réécrit sur les pages source. - Fichiers d'extraction réutilisables (`.pcex`) qui peuvent être enregistrés une fois et réutilisés plus tard pour le rendu, la traduction ou le traitement sur une autre machine. Parcours d'utilisation - Application en ligne pour essayer le flux de travail dans un navigateur. - Python avec OCR distant, pour les développeurs qui ne veulent pas exécuter de modèles OCR localement ; nécessite Python, Poppler, ainsi qu'une URL et des identifiants de service OCR compatibles. - Python avec OCR local, pour les développeurs disposant de leur propre GPU NVIDIA ; nécessite Python, Poppler, CUDA, suffisamment de VRAM et les fichiers de modèle. Démarrage rapide Installez avec `python -m pip install pdf-craft`, puis configurez un fournisseur OCR (par exemple un service compatible DeepSeek OCR) et appelez `convert_pdf_to_markdown` ou `convert_pdf_to_epub`. Une façade `AsyncPDFCraft` est disponible pour les applications asynchrones ; la façade synchrone ne doit pas être appelée depuis une boucle d'événements en cours d'exécution. Le README indique que les points de terminaison d'exemple sont des espaces réservés et doivent être remplacés par un service fonctionnel. OCR et prérequis Le projet prend en charge DeepSeek OCR, DeepSeek OCR 2 et Unlimited OCR, chacun avec des configurations locale et distante. L'installation standard prend en charge l'OCR distant ; l'OCR local nécessite l'extra `pdf-craft[local]`, une version de PyTorch compatible avec CUDA, suffisamment de VRAM et les fichiers de modèle, qui se téléchargent par défaut depuis Hugging Face ou peuvent être chargés localement. La prise en charge des langues dépend de l'étape de traitement : la reconnaissance de texte dépend du modèle OCR, et la traduction dépend du traducteur et du LLM de texte. Le paramètre `lan` de l'EPUB propose actuellement `zh` et `en`. Documentation et retours Le README renvoie à des guides pour l'installation, les backends OCR, la conversion PDF et la traduction, la traduction EPUB, la référence API, le format `.pcex` et le dépannage. Les issues et pull requests sont les bienvenues ; pour les problèmes de conversion, le projet demande la version du paquet, le type de configuration OCR, les journaux d'erreur et un fichier minimal partageable, après avoir retiré au préalable les identifiants et le contenu privé. Le projet est publié sous licence MIT, et les dépendances tierces ainsi que certains modèles OCR conservent leurs propres licences.