À propos du projet

PolyOCR Service est un service indépendant piloté par la communauté, conçu pour fournir un déploiement API pratique pour PaddleOCR 3.x. Ses capacités principales incluent : - **OCR multilingue** : prend en charge 78 langues (couvrant les caractères chinois, japonais, coréen, latin, cyrillique, arabe, etc.), et permet de spécifier la langue via un code de langue, un nom anglais ou un nom chinois. - **Intégration de la traduction** : propose une interface de traduction optionnelle, prenant en charge les services de traduction compatibles OpenAI, avec des limitations sur le nombre d'entrées et le nombre de caractères. - **PaddleOCR-VL** : fournit un service de modèle de langage visuel indépendant, nécessitant une clé API distincte et acceptant uniquement le téléchargement de fichiers. - **Robustesse et validation** : effectue la validation de la langue aux limites de la requête, avec une pré-validation du nombre d'octets de l'image, du nombre de pixels et du seuil de confiance ; l'inférence synchrone est exécutée via un pool de threads et la concurrence est limitée par un sémaphore. - **Benchmarks** : le projet intègre des outils de benchmark détaillés pour la précision, la robustesse (face aux scénarios de dégradation tels que le flou, la compression, la rotation, etc.) et des tests basés sur des photos réelles (jeu de données CORD-v2). Ce service propose une page Web et une API REST, prend en charge le déploiement Docker et utilise la licence Apache License 2.0.