À propos du projet

PaddleOCR est une boîte à outils OCR et IA documentaire complète développée par PaddlePaddle. Elle convertit les documents PDF et les images en données structurées prêtes pour les LLM au format JSON ou Markdown. Composants clés : - PP-OCRv6 : Un modèle de reconnaissance textuelle multilingue prenant en charge plus de 50 langues dans un modèle unifié, y compris le chinois, l'anglais, le japonais et 46 langues en écriture latine. Il couvre également le cyrillique, l'arabe, le devanagari et d'autres scripts sur plus de 100 langues au total. Disponible en trois niveaux de taille (tiny 1,5M, small 7,7M, medium 34,5M paramètres) pour les déploiements edge, mobile et serveur. - PaddleOCR-VL : Un modèle vision-language (0,9 milliard de paramètres) pour l'analyse de documents. Il obtient de solides résultats sur des benchmarks comme OmniDocBench et gère texte, formules, tableaux, graphiques, documents anciens, sceaux et caractères rares. Produisit du Markdown et du JSON structurés avec informations de coordonnées. - PP-StructureV3 : Un pipeline de conversion de documents conscient de la structure qui fournit des informations de coordonnées fines pour les cellules de tableau, les régions de texte et autres éléments de mise en page. - HPD-Parsing : Un modèle vision-language léger pour l'analyse de documents à haut débit avec décodage parallèle hiérarchique. La boîte à outils prend en charge plusieurs backends matériels, y compris NVIDIA GPU, Intel CPU, Kunlunxin XPU et divers accélérateurs IA. Elle peut être déployée via ONNX, OpenVINO, TensorRT, ou servie en tant qu'API HTTP. PaddleOCR est intégré à des plateformes d'applications IA telles que Dify, RAGFlow, Pathway et Cherry Studio. Un SDK d'inférence navigateur officiel, PaddleOCR.js, permet d'exécuter les modèles PP-OCR directement dans le navigateur. Le projet prend également en charge la conversion de documents Word, Excel et PowerPoint en Markdown, et l'export des résultats analysés au format DOCX.