OPEN SOURCE, OPEN TO EVERYONE

Code ouvert. Horizons nouveaux.

Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.

Sélection humaine · Découvrez de bons projets open source4109découverts

Un peu de curiosité. Un monde de code ouvert.

THE FIRST COLLECTION
Topic: speech-recognition清除
whisperlivekitQuentinFuxa
NOUVEAU

WhisperLiveKit est un pipeline speech-to-text auto-hébergé à ultra-faible latence, offrant transcription en temps réel, diarisation et traduction via WebSocket et API compatibles OpenAI/Deepgram.

IADéveloppementModel runtime
talkbank-toolsFranklinChen
NOUVEAU

Batchalign3 est un pipeline audio et ML de TalkBank pour produire et enrichir des transcriptions CHAT, couvrant la reconnaissance vocale, l'alignement forcé, le morphotagging neuronal, la traduction et la segmentation des énoncés. Il fournit une CLI, un package Python, un pont PyO3, un tableau de bord React et un shell de bureau Tauri expérimental.

IADéveloppementModel runtime
NOUVEAU

SpeechRecognition est une bibliothèque Python de reconnaissance vocale prenant en charge plusieurs moteurs et API, en ligne et hors ligne, notamment CMU Sphinx, Google, Azure, IBM, Vosk, Whisper et OpenAI.

IADéveloppementMultimodal AI
premove-itnpremove-ai
NOUVEAU

Premove ITN est une bibliothèque open-source de normalisation inverse de texte sensible au contexte pour les transcriptions d'agents vocaux en anglais. Elle convertit la sortie ASR en formes écrites canoniques via un pipeline générer-scorer-décoder avec DeBERTa.

IADéveloppementModel runtime
transformershuggingface
NOUVEAU

Hugging Face Transformers est un cadre de définition de modèles pour l'apprentissage automatique couvrant le texte, la vision, l'audio et les tâches multimodales. Il fournit une API unifiée pour l'inférence et l'entraînement avec plus d'un million de points de contrôle pré-entraînés.

IADéveloppementTraining & evaluation
sensevoiceQwenAudio
NOUVEAU

SenseVoiceSmall est un modèle de fondation vocal open source pour la reconnaissance vocale, l'identification de langue, la reconnaissance d'émotions et la détection d'événements audio, couvrant le mandarin, le cantonais, l'anglais, le japonais et le coréen avec une inférence non autorégressive rapide.

IADéveloppementModel runtime
espnetespnet
NOUVEAU

ESPnet est une boîte à outils de traitement de la parole de bout en bout basée sur PyTorch, couvrant la reconnaissance vocale, la synthèse vocale, la traduction, l'amélioration, la diarisation, etc., avec des recettes reproductibles et des modèles pré-entraînés.

IADéveloppementModel runtime