Sobre el proyecto
FunClip es una aplicación automatizada de transcripción de video, generación de subtítulos y recorte. Se ejecuta localmente a través de una interfaz web Gradio y también puede operarse desde la línea de comandos. El flujo de trabajo consiste en cargar un video, ejecutar el reconocimiento de voz, inspeccionar la transcripción y las etiquetas de los hablantes, seleccionar uno o más segmentos de texto y exportar el clip de video correspondiente con subtítulos opcionales.
Capacidades principales
- Reconocimiento de voz en video utilizando modelos Paraformer basados en FunASR, incluida la predicción de marcas de tiempo para el recorte basado en texto.
- Soporte de palabras clave mediante SeACo-Paraformer para mejorar el reconocimiento de nombres, entidades u otros términos específicos.
- Reconocimiento de hablantes con CAM++, lo que permite seleccionar clips por un ID de hablante asignado automáticamente.
- Recorte de múltiples segmentos a partir de la transcripción reconocida.
- Generación de subtítulos SRT para el video completo y subtítulos para los segmentos objetivo seleccionados.
- Renderizado de subtítulos integrado con Pillow y una fuente incluida; ImageMagick solo es necesario para flujos de trabajo heredados de MoviePy TextClip.
Rutas de modelo disponibles
- Configuración predeterminada de Paraformer para recorte de video en chino.
- Reconocimiento Paraformer en inglés utilizando la opción de idioma inglés.
- Fun-ASR-Nano como una opción de punto de control de mayor precisión.
- SenseVoice para ASR multilingüe con etiquetas de emoción y eventos de audio.
- MOSS-Transcribe-Diarize opcional a través de un servicio local vLLM para transcripción de formato largo, marcas de tiempo a nivel de segmento y etiquetas de hablante anónimas. MOSS realiza segmentación y diarización de extremo a extremo; la documentación señala que el recorte preciso de texto arbitrario aún requiere marcas de tiempo de tokens de Paraformer.
Selección asistida por IA y consciente del contenido
FunClip puede usar un LLM para analizar la transcripción y proponer segmentos de clip, que luego se pasan al flujo de trabajo existente de AI Clip. OrcaRouter se puede configurar como una puerta de enlace opcional compatible con OpenAI utilizando una clave API y variables de entorno. Para la selección basada en imágenes y audio en lugar de solo texto de transcripción, TwelveLabs Pegasus se puede habilitar opcionalmente; requiere el paquete twelvelabs y una clave API.
Opciones de uso
El servicio local Gradio se inicia con Python y normalmente se accede en localhost:7860. Admite opciones de lanzamiento de puerto y acceso público. Los usuarios también pueden probar el proyecto a través de sus espacios ModelScope o Hugging Face Spaces. Para uso en línea de comandos, FunClip proporciona un proceso de dos etapas: primero reconocer el video y escribir las salidas de transcripción/SRT, luego ejecutar la etapa de recorte con texto de destino, desplazamientos y un archivo de salida.
Instalación y licencias
La configuración documentada utiliza un entorno virtual Python 3.12, una instalación de PyTorch/torchaudio compatible con la plataforma y los requisitos del proyecto. FunClip actualmente requiere funasr>=1.4.9 para sus rutas de compatibilidad de modelos y subtítulos. Los pesos del modelo se descargan por separado en el primer uso y se rigen por sus respectivas licencias de modelo. El código fuente de FunClip se publica bajo la Licencia MIT.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.