Tesseract est un moteur d'OCR open-source qui propose un outil en ligne de commande et une bibliothèque pour la reconnaissance de texte dans des images pour plus de 100 langues.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONPageLedger est une bibliothèque CLI Python open-source pour le suivi auditable page par page des tâches OCR et d'extraction de documents. Il enregistre la provenance, les signaux de qualité, les coûts et l'état de révision pour chaque page, avec support des reprises, files d'attente de révision et comparaison de résultats.
Tesseract.js est une bibliothèque OCR JavaScript extrayant du texte d'images dans plus de 100 langues. Elle fonctionne dans les navigateurs via WebAssembly et sur Node.js, sans modifier le modèle de reconnaissance.
OCRmyPDF est un outil en ligne de commande qui ajoute une couche de texte OCR recherchable aux fichiers PDF scannés, produisant une sortie PDF/A validée. Il utilise Tesseract pour la reconnaissance dans plus de 100 langues, prend en charge le redressement et la correction de rotation, et fonctionne sous Linux, macOS, Windows et FreeBSD.