OPEN SOURCE, OPEN TO EVERYONE

Code ouvert. Horizons nouveaux.

Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.

Sélection humaine · Découvrez de bons projets open source4092découverts

Un peu de curiosité. Un monde de code ouvert.

THE FIRST COLLECTION
Topic: asr清除
speechNVIDIA-NeMo
NOUVEAU

NVIDIA NeMo Speech est un framework PyTorch Apache-2.0 pour la création, la personnalisation et le déploiement de modèles d'IA vocale, couvrant la reconnaissance vocale automatique, la synthèse vocale à partir de texte et les grands modèles de langage vocaux, avec des points de contrôle pré-entraînés et des chemins d'installation Docker/uv.

IAMusiqueModel runtime
douvorhinoc
NOUVEAU

Douvo est une application macOS légère de saisie vocale pour Apple Silicon, utilisant Doubao ASR avec post-traitement IA optionnel (local ou distant) pour nettoyer, traduire et éditer le texte sélectionné. Elle prend en charge plusieurs moteurs et s'intègre via la barre de menus.

ProductivitéIAUtilities
talkbank-toolsFranklinChen
NOUVEAU

Batchalign3 est un pipeline audio et ML de TalkBank pour produire et enrichir des transcriptions CHAT, couvrant la reconnaissance vocale, l'alignement forcé, le morphotagging neuronal, la traduction et la segmentation des énoncés. Il fournit une CLI, un package Python, un pont PyO3, un tableau de bord React et un shell de bureau Tauri expérimental.

IADéveloppementModel runtime
NOUVEAU

Une bibliothèque Python qui récupère les transcriptions et sous-titres des vidéos YouTube sans nécessiter de clé API ou de navigateur sans interface. Supporte plusieurs langues, traduction et formats de sortie.

DéveloppementBackend & APIs
mimoravikonix
NOUVEAU

Mimora est un entraîneur de prononciation gratuit et entièrement local pour l’anglais et l’espagnol. Il utilise la synthèse vocale sur appareil, la reconnaissance vocale et un modèle d’IA local pour générer des phrases et évaluer les tentatives de l’utilisateur avec un retour par mot, sans nécessiter de cloud ni de clés API.

IAProductivitéAI assistants
premove-itnpremove-ai
NOUVEAU

Premove ITN est une bibliothèque open-source de normalisation inverse de texte sensible au contexte pour les transcriptions d'agents vocaux en anglais. Elle convertit la sortie ASR en formes écrites canoniques via un pipeline générer-scorer-décoder avec DeBERTa.

IADéveloppementModel runtime
sensevoiceQwenAudio
NOUVEAU

SenseVoiceSmall est un modèle de fondation vocal open source pour la reconnaissance vocale, l'identification de langue, la reconnaissance d'émotions et la détection d'événements audio, couvrant le mandarin, le cantonais, l'anglais, le japonais et le coréen avec une inférence non autorégressive rapide.

IADéveloppementModel runtime