OPEN SOURCE, OPEN TO EVERYONE

Code ouvert. Horizons nouveaux.

Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.

Sélection humaine · Découvrez de bons projets open source4109découverts

Un peu de curiosité. Un monde de code ouvert.

THE FIRST COLLECTION
Topic: speech-recognition清除
talkbank-toolsFranklinChen
NOUVEAU

Batchalign3 est un pipeline audio et ML de TalkBank pour produire et enrichir des transcriptions CHAT, couvrant la reconnaissance vocale, l'alignement forcé, le morphotagging neuronal, la traduction et la segmentation des énoncés. Il fournit une CLI, un package Python, un pont PyO3, un tableau de bord React et un shell de bureau Tauri expérimental.

IADéveloppementModel runtime
NOUVEAU

SpeechRecognition est une bibliothèque Python de reconnaissance vocale prenant en charge plusieurs moteurs et API, en ligne et hors ligne, notamment CMU Sphinx, Google, Azure, IBM, Vosk, Whisper et OpenAI.

IADéveloppementMultimodal AI
mimoravikonix
NOUVEAU

Mimora est un entraîneur de prononciation gratuit et entièrement local pour l’anglais et l’espagnol. Il utilise la synthèse vocale sur appareil, la reconnaissance vocale et un modèle d’IA local pour générer des phrases et évaluer les tentatives de l’utilisateur avec un retour par mot, sans nécessiter de cloud ni de clés API.

IAProductivitéAI assistants
whisper.cppggml-org
NOUVEAU

Une implémentation C/C++ haute performance pour l'inférence du modèle de reconnaissance automatique de la parole (ASR) Whisper d'OpenAI, conçue pour un déploiement léger et multiplateforme.

IAModel runtime
premove-itnpremove-ai
NOUVEAU

Premove ITN est une bibliothèque open-source de normalisation inverse de texte sensible au contexte pour les transcriptions d'agents vocaux en anglais. Elle convertit la sortie ASR en formes écrites canoniques via un pipeline générer-scorer-décoder avec DeBERTa.

IADéveloppementModel runtime
NOUVEAU

Une réimplémentation rapide du modèle Whisper d'OpenAI utilisant CTranslate2, offrant une vitesse de transcription accrue et une utilisation réduite de la mémoire.

IAModel runtime
transformershuggingface
NOUVEAU

Hugging Face Transformers est un cadre de définition de modèles pour l'apprentissage automatique couvrant le texte, la vision, l'audio et les tâches multimodales. Il fournit une API unifiée pour l'inférence et l'entraînement avec plus d'un million de points de contrôle pré-entraînés.

IADéveloppementTraining & evaluation
sensevoiceQwenAudio
NOUVEAU

SenseVoiceSmall est un modèle de fondation vocal open source pour la reconnaissance vocale, l'identification de langue, la reconnaissance d'émotions et la détection d'événements audio, couvrant le mandarin, le cantonais, l'anglais, le japonais et le coréen avec une inférence non autorégressive rapide.

IADéveloppementModel runtime
espnetespnet
NOUVEAU

ESPnet est une boîte à outils de traitement de la parole de bout en bout basée sur PyTorch, couvrant la reconnaissance vocale, la synthèse vocale, la traduction, l'amélioration, la diarisation, etc., avec des recettes reproductibles et des modèles pré-entraînés.

IADéveloppementModel runtime
whisperlivekitQuentinFuxa
NOUVEAU

WhisperLiveKit est un pipeline speech-to-text auto-hébergé à ultra-faible latence, offrant transcription en temps réel, diarisation et traduction via WebSocket et API compatibles OpenAI/Deepgram.

IADéveloppementModel runtime