NVIDIA NeMo Speech est un framework PyTorch Apache-2.0 pour la création, la personnalisation et le déploiement de modèles d'IA vocale, couvrant la reconnaissance vocale automatique, la synthèse vocale à partir de texte et les grands modèles de langage vocaux, avec des points de contrôle pré-entraînés et des chemins d'installation Docker/uv.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONFunTTS est une bibliothèque de synthèse vocale (TTS) à interface unifiée, permettant une commutation fluide entre divers moteurs open-source, avec des fonctions de génération de sous-titres, de dialogues multi-rôles et de traitement asynchrone.
vtmate est une boîte à outils vocale IA basée sur terminal, à très faible latence, prenant en charge 41 langues et intégrant TTS/STT. Elle permet des conversations vocales en direct, des débats, le clonage vocal, l'export de sessions et un mode démon en arrière-plan avec raccourcis globaux pour une interaction IA fluide.
OpenCreator est un espace de travail IA open-source (ex KrillinAI) qui combine création multimodale et workspace Agent, propulsé par Codex CLI avec runtime local, outils créatifs et hôte Desktop.
Unsloth est une application de bureau et un framework permettant d'exécuter et d'entraîner des modèles de langage (LLM) et des modèles de diffusion localement sur Windows, macOS et Linux.
Verba est une application de bureau prioritairement hors ligne pour l'apprentissage des langues, basée sur des conversations avec un coach IA. Elle fonctionne localement avec Ollama ou votre propre clé de fournisseur, et propose des corrections intégrées, des lectures classées par niveau, la répétition espacée du vocabulaire, ainsi que des fonctionnalités de synthèse vocale et de dictée intégrées.
Une extension de navigateur pour Google Chrome et Mozilla Firefox qui propose la traduction de sous-titres bilingues en temps réel pour les vidéos YouTube.
LocalAI est un moteur d'inférence IA auto-hébergé, open-source, qui exécute localement des modèles LLM, vision, voix, image et vidéo sur tout type de matériel, y compris CPU uniquement. Il offre des API compatibles OpenAI, Anthropic et ElevenLabs, des backends modulaires à la demande, une authentification multi-utilisateur et des agents intégrés avec RAG et MCP.
VoxCPM2 est un système de synthèse vocale texte-parole sans tokeniseur doté d'un modèle autoregressif de diffusion de 2B prenant en charge 30 langues, la conception de voix à partir de descriptions textuelles, le clonage de voix contrôlable et une sortie audio de 48 kHz.
Pixelle-Video est un moteur de vidéos courtes entièrement automatisé par IA : l'utilisateur n'a qu'à saisir un thème pour que le système génère automatiquement le script, les illustrations, la voix off, la musique de fond et assemble la vidéo finale, avec la possibilité de combiner librement de multiples modèles d'IA et workflows.
Un cours de Python pratique basé sur le terminal : écrivez du code réel dans un éditeur modal style Neovim avec un coach TTS local hors ligne. Inclut des exercices, un parcours cloud/DevOps simulé et un suivi de progression.
ChatTTS est un modèle open source de synthèse vocale conçu pour les scénarios de dialogue, prenant en charge l'anglais et le chinois avec une sortie multi-locuteurs et un contrôle fin des rires, pauses et prosodie.
GPT-SoVITS est un système open-source de conversion vocale et de synthèse TTS en few-shot, supportant le zero-shot (5s) et le few-shot (1min) pour le clonage vocal en chinois, japonais, coréen, cantonais et anglais. Inclut des outils WebUI pour la séparation audio, la RSA et la préparation de jeux de données.
pyVideoTrans est un outil open-source de traduction vidéo, transcription audio, doublage IA et traduction de sous-titres, avec prise en charge du déploiement local et des APIs en ligne.