Sobre el proyecto
OpenClip es una herramienta automatizada de procesamiento de video basada en Python, FFmpeg y uv, que se utiliza principalmente para identificar y exportar fragmentos destacados de videos largos, como videos hablados, repeticiones de transmisiones en vivo, entrevistas y pódcasts. Cuando el usuario introduce una URL de video o un archivo local, el flujo incluye descargar o validar el video, obtener subtítulos de la plataforma o realizar una transcripción de voz local, dividir el video largo, analizarlo con IA y recopilar fragmentos candidatos, generar la edición, crear archivos de subtítulos, generar imágenes de portada y, de forma opcional, añadir títulos e incrustar subtítulos.
Sus capacidades principales son:
- Admite enlaces de videos de Bilibili y YouTube, así como archivos de video locales; Streamlit también permite cargar archivos desde el navegador.
- Durante la transcripción se priorizan los subtítulos de la plataforma. El ASR local puede enrutarse según el idioma: en inglés se usa Whisper, en chino puede usarse Paraformer y, si no está disponible, se recurre a Whisper.
- La IA selecciona momentos destacados según dimensiones como contenido, interactividad y valor de entretenimiento. Mediante --user-intent puede especificarse un tema de interés en lenguaje natural; también es posible añadir información de contexto del presentador y plantillas de prompts personalizadas.
- Admite parámetros como cantidad de fragmentos, valores predefinidos de duración, estilo de título, tamaño de fuente, y posición y color del texto de la portada.
- Genera automáticamente clips de video independientes, subtítulos SRT, un resumen en Markdown e imágenes de portada.
- Ofrece un modo opcional de optimización profunda que, después de recopilar los candidatos, añade una revisión de IA, reparación de límites y una nueva revisión para mejorar la independencia de cada fragmento.
- Permite la incrustación opcional de subtítulos, para lo cual se necesita FFmpeg compilado con libass; también puede traducir con el LLM seleccionado e incrustar subtítulos bilingües.
- La versión preliminar de reconocimiento de hablantes puede etiquetar sus nombres a partir de audios de referencia y es útil en escenarios de conversación con varias personas. Requiere instalar adicionalmente la dependencia speakers y configurar un HuggingFace Token.
- El posprocesamiento con Clip Editor permite ajustar los límites de cada fragmento, los subtítulos y el título de la portada, así como volver a renderizar con cambio de velocidad.
La herramienta proporciona tres interfaces: la interfaz web de Streamlit admite tareas en segundo plano, ejecución simultánea de varias tareas, persistencia de tareas, seguimiento del progreso, configuración del modo de cookies y acceso a través de la red local; la CLI es adecuada para procesamiento mediante scripts; y Agent Skills puede ser invocada por agentes compatibles con skills como Claude Code, TRAE y Cursor para iniciar tareas de procesamiento de video en lenguaje natural.
Las interfaces de IA admiten Qwen, OpenRouter, 智谱 GLM, MiniMax e interfaces personalizadas compatibles con OpenAI, por lo que puede conectarse a servicios como LM Studio, vLLM, One API y New API. La descarga remota admite tres modos: sin cookies, cookies del navegador y un archivo cookies.txt en formato Netscape. En algunos escenarios de YouTube se recomienda instalar Deno o Node. Los resultados se guardan por defecto en processed_videos y se organizan en directorios como downloads, splits, clips y clips_post_processed. El proyecto utiliza la licencia MIT.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.