pyVideoTrans est un outil open-source de traduction vidéo, transcription audio, doublage IA et traduction de sous-titres, avec prise en charge du déploiement local et des APIs en ligne.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONESPnet est une boîte à outils de traitement de la parole de bout en bout basée sur PyTorch, couvrant la reconnaissance vocale, la synthèse vocale, la traduction, l'amélioration, la diarisation, etc., avec des recettes reproductibles et des modèles pré-entraînés.
Un plugin LLM multimodal local pour Unreal Engine 5 offrant l'inférence hors ligne pour le texte, la reconnaissance vocale et la synthèse vocale.
FunTTS est une bibliothèque de synthèse vocale (TTS) à interface unifiée, permettant une commutation fluide entre divers moteurs open-source, avec des fonctions de génération de sous-titres, de dialogues multi-rôles et de traitement asynchrone.
MoneyPrinterTurbo est un outil open source tout-en-un de génération de vidéos courtes par IA : il suffit de saisir un thème ou des mots-clés pour produire automatiquement script, voix off, médias, sous-titres, musique et montage, en 9:16, 16:9 ou 1:1, avec quatre modes d'utilisation : WebUI, API, CLI et AI Agent.
Mimora est un entraîneur de prononciation gratuit et entièrement local pour l’anglais et l’espagnol. Il utilise la synthèse vocale sur appareil, la reconnaissance vocale et un modèle d’IA local pour générer des phrases et évaluer les tentatives de l’utilisateur avec un retour par mot, sans nécessiter de cloud ni de clés API.
Unsloth est une application de bureau et un framework permettant d'exécuter et d'entraîner des modèles de langage (LLM) et des modèles de diffusion localement sur Windows, macOS et Linux.
Zara est un assistant IA expérimental local-first et un copilote pour bureau Linux qui combine la logique symbolique (Prolog) avec des LLM pour la gestion des intentions et le raisonnement.
VoxCPM2 est un système de synthèse vocale texte-parole sans tokeniseur doté d'un modèle autoregressif de diffusion de 2B prenant en charge 30 langues, la conception de voix à partir de descriptions textuelles, le clonage de voix contrôlable et une sortie audio de 48 kHz.
Un serveur MCP conçu pour enseigner la musicalité à l'IA via le piano et la guitare. Il propose 120 chansons annotées, six moteurs sonores, un cockpit de composition via navigateur et un jeu de données public de traces d'utilisation d'outils.
Velo AI Studio est un outil de création vidéo open-source basé sur le navigateur, conçu pour assembler des vidéos narrées à partir de scripts, d'audio et de ressources visuelles générées par IA.
TaleWeaver est un moteur d'aventure textuelle basé sur navigateur, auto-hébergé, avec un maître de jeu IA, un éditeur d'aventure, des mécaniques de RPG, une narration vocale/saisie vocale, et un déploiement Docker/SQLite.
OpenMontage est un système de production vidéo agentique open-source qui transforme les assistants de codage IA en studios vidéo complets, prenant en charge des pipelines de bout en bout, de la recherche au rendu final.
ChatTTS est un modèle open source de synthèse vocale conçu pour les scénarios de dialogue, prenant en charge l'anglais et le chinois avec une sortie multi-locuteurs et un contrôle fin des rires, pauses et prosodie.
GPT-SoVITS est un système open-source de conversion vocale et de synthèse TTS en few-shot, supportant le zero-shot (5s) et le few-shot (1min) pour le clonage vocal en chinois, japonais, coréen, cantonais et anglais. Inclut des outils WebUI pour la séparation audio, la RSA et la préparation de jeux de données.