Sobre el proyecto

Open-Sora es un proyecto de código abierto dedicado a democratizar la producción eficiente de vídeo mediante la oferta de modelos accesibles, herramientas y detalles de implementación. El proyecto proporciona un pipeline completo para la generación de vídeo, incluido el preprocesamiento de datos, la aceleración del entrenamiento (utilizando ColossalAI) y la inferencia. La última versión, Open-Sora 2.0, cuenta con un modelo de 11B parámetros. Según el informe técnico del proyecto, este modelo se entrenó con un presupuesto de aproximadamente 200.000 dólares y alcanza un rendimiento similar al de otros modelos de código abierto como HunyuanVideo (11B) y Step-Video (30B) en la plataforma VBench y en evaluaciones de preferencia humana. El proyecto también mantiene versiones anteriores (de la 1.0 a la 1.3) en ramas separadas, documentando una progresión iterativa de capacidades como 3D-VAE, rectified flow y diversas arquitecturas espaciotemporales. Las principales capacidades e características incluyen: - Generación de texto a imagen, texto a vídeo, imagen a vídeo y vídeo a vídeo. - Soporte para duraciones de vídeo variables (desde 2 segundos hasta 16 segundos o tiempo ilimitado) y resoluciones que van desde 144p hasta 720p, con proporciones de aspecto flexibles. - Checkpoints y scripts de entrenamiento completamente de código abierto, lo que permite a los usuarios entrenar o ajustar sus propios modelos. - Informes técnicos detallados que documentan la arquitectura, los procesos de entrenamiento y las métricas de evaluación para cada versión. - Una demostración basada en Gradio alojada en Hugging Face Spaces para pruebas interactivas. El proyecto ofrece documentación integral para entrenar, evaluar autoencoders de vídeo e implementar los modelos, con el objetivo de simplificar las complejidades de la generación de vídeo para creadores de contenido e investigadores.