Sobre el proyecto

VideoCaptioner es una herramienta de procesamiento de subtítulos de video basada en grandes modelos de lenguaje (LLM), que cubre todo el flujo de trabajo: reconocimiento de voz, optimización de subtítulos, traducción y composición de video. Se instala con pip install videocaptioner y ofrece dos modos de uso: línea de comandos (CLI) y aplicación de escritorio (GUI). Las funciones principales incluyen: - Transcripción de voz: admite varios motores como faster-whisper, whisper-api, bijian (gratuito), jianying (gratuito) y whisper-cpp, utilizando marcas de tiempo a nivel de palabra y detección de actividad de voz (VAD) para mejorar la precisión del reconocimiento. - Optimización y traducción de subtítulos: utiliza LLM para realizar segmentación semántica y lograr una experiencia de lectura más natural; la traducción es compatible con LLM, bing (gratuito), google (gratuito) y otros servicios, con traducción contextual y mecanismo de reflexión y optimización. - Composición de video: permite incrustar subtítulos de forma suave o dura en el video. - Generación de doblaje: puede generar pistas de audio o videos doblados a partir de los subtítulos. - Descarga de videos en línea: compatible con plataformas como YouTube y Bilibili. - Procesamiento de flujo completo: un solo comando para completar transcripción → optimización → traducción → composición. Las funciones gratuitas (reconocimiento de voz de Bijian, traducción de Bing/Google) están disponibles sin necesidad de configuración. Las funciones de LLM (optimización de subtítulos, traducción con modelos grandes) requieren configurar una API Key y son compatibles con todas las interfaces compatibles con OpenAI, incluyendo el proxy de VideoCaptioner, SiliconCloud, DeepSeek, entre otros. La prioridad de configuración es: parámetros de línea de comandos > variables de entorno > archivo de configuración > valores predeterminados. Además, el proyecto proporciona Claude Code Skill, que permite a los asistentes de programación con IA invocar directamente a VideoCaptioner para procesar videos. En cuanto al desarrollo, utiliza uv para gestionar dependencias, y es compatible con pyright para verificación de tipos y pytest para pruebas. El proyecto se distribuye bajo la licencia GPL-3.0.