WhisperLiveKit est un pipeline speech-to-text auto-hébergé à ultra-faible latence, offrant transcription en temps réel, diarisation et traduction via WebSocket et API compatibles OpenAI/Deepgram.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONBatchalign3 est un pipeline audio et ML de TalkBank pour produire et enrichir des transcriptions CHAT, couvrant la reconnaissance vocale, l'alignement forcé, le morphotagging neuronal, la traduction et la segmentation des énoncés. Il fournit une CLI, un package Python, un pont PyO3, un tableau de bord React et un shell de bureau Tauri expérimental.
SpeechRecognition est une bibliothèque Python de reconnaissance vocale prenant en charge plusieurs moteurs et API, en ligne et hors ligne, notamment CMU Sphinx, Google, Azure, IBM, Vosk, Whisper et OpenAI.
Premove ITN est une bibliothèque open-source de normalisation inverse de texte sensible au contexte pour les transcriptions d'agents vocaux en anglais. Elle convertit la sortie ASR en formes écrites canoniques via un pipeline générer-scorer-décoder avec DeBERTa.
Hugging Face Transformers est un cadre de définition de modèles pour l'apprentissage automatique couvrant le texte, la vision, l'audio et les tâches multimodales. Il fournit une API unifiée pour l'inférence et l'entraînement avec plus d'un million de points de contrôle pré-entraînés.
SenseVoiceSmall est un modèle de fondation vocal open source pour la reconnaissance vocale, l'identification de langue, la reconnaissance d'émotions et la détection d'événements audio, couvrant le mandarin, le cantonais, l'anglais, le japonais et le coréen avec une inférence non autorégressive rapide.
ESPnet est une boîte à outils de traitement de la parole de bout en bout basée sur PyTorch, couvrant la reconnaissance vocale, la synthèse vocale, la traduction, l'amélioration, la diarisation, etc., avec des recettes reproductibles et des modèles pré-entraînés.