Sobre el proyecto

VideoLingo es una herramienta integral de traducción y doblaje de videos diseñada para producir subtítulos de calidad Netflix. Aborda los problemas comunes de la traducción automática ofreciendo subtítulos de una sola línea, eliminando traducciones rígidas y añadiendo doblaje de alta calidad. Sus capacidades principales incluyen: - Descarga de videos de YouTube mediante yt-dlp - Reconocimiento de subtítulos a nivel de palabra con WhisperX (large-v3), ejecutable localmente o mediante API - Segmentación de subtítulos con NLP e IA - Terminología personalizada y generada por IA para una traducción coherente - Un proceso de tres pasos Translate-Reflect-Adaptation para traducciones de calidad cinematográfica - Salida de subtítulos de una sola línea según estándares Netflix - Soporte de doblaje mediante GPT-SoVITS, Azure, OpenAI, Fish-TTS, Edge-TTS y opciones de TTS personalizadas - Inicio y procesamiento con un solo clic a través de una interfaz web Streamlit con soporte multilingüe - Control de tareas que permite pausar, reanudar o detener el procesamiento en cualquier paso - Registro detallado con reanudación de progreso - Cuadro de búsqueda de modelos con obtención automática de API para filtrar modelos de la lista completa de un proveedor Los idiomas de entrada admitidos incluyen inglés, ruso, francés, alemán, italiano, español, japonés y chino. La traducción admite todos los idiomas, mientras que el idioma de doblaje depende del método TTS elegido. Las opciones de instalación incluyen el uso de uv (recomendado) para la configuración automatizada del entorno Python, Conda o Docker. El proyecto admite formatos de API compatibles con OpenAI para la integración de LLM y diversas interfaces de TTS. Puede ejecutarse completamente en local con Ollama y Edge-TTS sin necesidad de APIs de pago. Las limitaciones actuales incluyen posibles problemas de transcripción con WhisperX en presencia de ruido de fondo, errores de LLMs más débiles con requisitos estrictos de formato JSON, doblaje imperfecto debido a diferencias en la velocidad del habla, la retención solo del idioma principal en videos multilingües y la imposibilidad de doblar varios personajes por separado.