À propos du projet
Open-Sora est un projet open-source dédié à la démocratisation de la production vidéo efficiente en fournissant des modèles accessibles, des outils et des détails d'implémentation. Le projet offre un pipeline complet pour la génération vidéo, incluant le préprocessing des données, l'accélération de l'entraînement (utilisant ColossalAI) et l'inférence.
La dernière version, Open-Sora 2.0, propose un modèle de 11 milliards de paramètres. Selon le rapport technique du projet, ce modèle a été entraîné avec un budget d'environ 200 000 dollars et atteint des performances équivalentes à celles d'autres modèles open-source comme HunyuanVideo (11B) et Step-Video (30B) sur le benchmark VBench et dans les évaluations de préférence humaine. Le projet conserve également les versions précédentes (1.0 à 1.3) sur des branches séparées, documentant une progression itérative des capacités telles que 3D-VAE, rectified flow et diverses architectures spatio-temporelles.
Les principales capacités et fonctionnalités incluent :
- Génération text-to-image, text-to-video, image-to-video et video-to-video.
- Prise en charge de durées vidéo variables (de 2 secondes jusqu'à 16 secondes ou durée illimitée) et de résolutions allant de 144p à 720p, avec des formats d'aspect flexibles.
- Checkpoints et scripts d'entraînement entièrement open-source, permettant aux utilisateurs d'entraîner ou de faire du fine-tuning de leurs propres modèles.
- Rapports techniques détaillés documentant l'architecture, les processus d'entraînement et les métriques d'évaluation pour chaque version.
- Une démo basée sur Gradio hébergée sur Hugging Face Spaces pour des tests interactifs.
Le projet fournit une documentation complète pour l'entraînement, l'évaluation des autoencodeurs vidéo et le déploiement des modèles, visant à simplifier les complexités de la génération vidéo pour les créateurs de contenu et les chercheurs.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.