À propos du projet

CrisperWhisper 2.0 est une boîte à outils de reconnaissance vocale construite autour d'un choix explicite, à chaque appel, entre deux styles de transcription. Le mode verbatim écrit ce qui a réellement été dit dans un format cohérent, incluant les remplissages, les répétitions, les interruptions, les faux départs et les événements vocaux tels que les rires. Le mode intention produit la version propre et lisible que le locuteur voulait dire, en formatant les nombres, les dates et les courriels sous forme de texte écrit. Le README présente cela comme la décision de conception centrale du projet : la plupart des systèmes de synthèse vocale héritent d'un style fixe issu des données d'entraînement, tandis que celui-ci l'expose comme un paramètre. Au-delà des deux modes, le README décrit des horodatages au niveau des mots dérivés d'un alignement supervisé par attention croisée, rapportés à environ 30 ms d'erreur moyenne de frontière sur la parole lue et 41 ms sur la parole conversationnelle dans les benchmarks propres au projet. Une capacité « verbatimize » prend l'audio plus une transcription propre existante de confiance et insère uniquement les disfluences et les événements vocaux présents dans l'audio, ce que le README présente comme un moyen de convertir des corpus propres en jeux de données verbatim pour les données de synthèse vocale, l'analyse clinique de la parole et la construction de jeux de données. Les modes verbatim et intention multilingues fonctionnent dans la plupart des langues prises en charge par Whisper. L'audio long format est géré par ce que le README appelle la continuation conditionnelle : chaque fenêtre continue à partir des mots déjà transcrits, ce qui, selon le projet, évite les mots dupliqués ou omis aux frontières des segments et évite la comptabilité des jetons d'horodatage. Un moteur d'exécution CTranslate2 fournit un décodage spéculatif avec un modèle brouillon plus petit, et le README indique que l'atténuation des hallucinations pour le mode de défaillance de répétition en boucle de Whisper est activée par défaut. L'installation propose deux extras : un backend CTranslate2 pour les GPU NVIDIA sous Linux, et un backend PyTorch pur pour macOS, Windows et le CPU. Le premier chargement télécharge les poids depuis HuggingFace et, sur le backend ct2, effectue une conversion unique qui nécessite torch et transformers. Les tailles de modèles vont de small à large, plus turbo, avec une ligne « Pro » distincte décrite comme entraînée sur des données propriétaires supplémentaires et prenant en charge le renforcement par mots-clés. Le README liste également des options telles que la transcription bimode en une seule passe, l'alignement forcé pour les transcriptions existantes, et la quantification float16 ou int8_float16. La licence est divisée : le code d'inférence du dépôt est sous licence MIT, tandis que les poids des modèles sont publiés sous une licence de recherche non commerciale, avec une licence commerciale disponible sur demande ; les modèles Pro sont uniquement sous licence commerciale. Le README renvoie vers un article, une documentation complète, des pages de modèles et plusieurs articles de recherche expliquant le benchmark, le contrôle de style multilingue, l'aligneur, la continuation long format, verbatimize et la pile d'inférence. Les tableaux de benchmark du README sont les résultats rapportés par le projet lui-même et doivent être lus comme tels.