ESPnet est une boîte à outils de traitement de la parole de bout en bout basée sur PyTorch, couvrant la reconnaissance vocale, la synthèse vocale, la traduction, l'amélioration, la diarisation, etc., avec des recettes reproductibles et des modèles pré-entraînés.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONWhisperLiveKit est un pipeline speech-to-text auto-hébergé à ultra-faible latence, offrant transcription en temps réel, diarisation et traduction via WebSocket et API compatibles OpenAI/Deepgram.
Une boîte à outils complète pour la vision par ordinateur offrant des blocs de construction agnostiques vis-à-vis des modèles pour le chargement des données, la visualisation et la gestion des ensembles de données.
Pyro est une bibliothèque de programmation probabiliste profonde flexible et évolutive, construite sur PyTorch, prenant en charge des modèles probabilistes universels et l'inférence automatisée.
Premove ITN est une bibliothèque open-source de normalisation inverse de texte sensible au contexte pour les transcriptions d'agents vocaux en anglais. Elle convertit la sortie ASR en formes écrites canoniques via un pipeline générer-scorer-décoder avec DeBERTa.
InsightFace est un projet open-source de pointe d'analyse faciale 2D et 3D offrant la reconnaissance faciale, la détection, l'alignement, l'échange et la détection de vivacité avec des modèles pré-entraînés, un package Python et un serveur auto-hébergé.
SenseVoiceSmall est un modèle de fondation vocal open source pour la reconnaissance vocale, l'identification de langue, la reconnaissance d'émotions et la détection d'événements audio, couvrant le mandarin, le cantonais, l'anglais, le japonais et le coréen avec une inférence non autorégressive rapide.