À propos du projet

VideoLingo est un outil complet de traduction et de doublage vidéo conçu pour produire des sous-titres de qualité Netflix. Il résout les problèmes courants de la traduction automatique en fournissant uniquement des sous-titres monolignes, en éliminant les traductions rigides et en ajoutant un doublage de haute qualité. Ses principales fonctionnalités incluent : - Téléchargement de vidéos YouTube via yt-dlp - Reconnaissance de sous-titres au niveau du mot avec WhisperX (large-v3), exécutable localement ou via API - Segmentation des sous-titres basée sur le NLP et l'IA - Terminologie personnalisée et générée par l'IA pour une traduction cohérente - Un processus en trois étapes Traduire-Reflect-Adaptation pour une traduction de qualité cinématographique - Sortie de sous-titres monolignes conformes aux standards Netflix - Support du doublage via GPT-SoVITS, Azure, OpenAI, Fish-TTS, Edge-TTS et des options TTS personnalisées - Démarrage et traitement en un clic via une interface web Streamlit multilingue - Contrôle des tâches permettant de suspendre, reprendre ou arrêter le traitement à toute étape - Journaux détaillés avec reprise de la progression - Une boîte de recherche de modèles avec récupération automatique via API pour filtrer les modèles de la liste complète d'un fournisseur Les langues d'entrée prises en charge incluent l'anglais, le russe, le français, l'allemand, l'italien, l'espagnol, le japonais et le chinois. La traduction prend en charge toutes les langues, tandis que la langue de doublage dépend de la méthode TTS choisie. Les options d'installation incluent l'utilisation de uv (recommandé) pour la configuration automatique de l'environnement Python, Conda ou Docker. Le projet prend en charge les formats d'API compatibles OpenAI pour l'intégration LLM et diverses interfaces TTS. Il peut fonctionner entièrement en local avec Ollama et Edge-TTS sans nécessiter d'API payantes. Les limitations actuelles incluent d'éventuels problèmes de transcription avec WhisperX en présence de bruit de fond, des erreurs provenant de LLM plus faibles face aux exigences de format JSON strictes, un doublage imparfait dû aux différences de débit de parole, la conservation uniquement de la langue principale dans les vidéos multilingues et l'impossibilité de doubler plusieurs personnages séparément.