À propos du projet

Tesseract est un package complet de reconnaissance optique de caractères (OCR) composé de la bibliothèque `libtesseract` et d'un programme en ligne de commande `tesseract`. Il prend en charge Unicode (UTF-8) et peut reconnaître plus de 100 langues nativement, avec la possibilité d'être entraîné pour des langues supplémentaires. Les capacités techniques clés incluent : - Moteurs OCR : Dispose d'un moteur moderne basé sur les réseaux neuronaux (LSTM) axé sur la reconnaissance de lignes, tout en maintenant la compatibilité avec l'ancien moteur de reconnaissance de motifs de caractères (Tesseract 3). - Support d'entrée : Compatible avec divers formats d'image, notamment PNG, JPEG et TIFF via la bibliothèque Leptonica. - Formats de sortie : Prend en charge plusieurs types de sortie, dont le texte brut, hOCR (HTML), PDF (y compris texte invisible uniquement), TSV, ALTO et PAGE. - Intégration pour les développeurs : Fournit des API C et C++ pour construire des applications personnalisées, avec divers wrappers disponibles pour d'autres langages de programmation. Tesseract est un outil sans interface graphique ; les utilisateurs nécessitant une interface graphique doivent utiliser des applications tierces. Il est publié sous licence Apache License 2.0.