Об этом проекте
Open-Sora — это open-source проект, посвящённый демократизации эффективного производства видео за счёт предоставления доступных моделей, инструментов и деталей реализации. Проект предлагает полный конвейер для генерации видео, включая предобработку данных, ускорение обучения (с использованием ColossalAI) и инференс.
Последний релиз, Open-Sora 2.0, представляет собой модель с 11 миллиардами параметров. Согласно техническому отчёту проекта, эта модель была обучена при бюджете около $200K и демонстрирует производительность на уровне других open-source моделей, таких как HunyuanVideo (11B) и Step-Video (30B), по результатам бенчмарка VBench и оценок человеческих предпочтений. Проект также сохраняет предыдущие версии (от 1.0 до 1.3) в отдельных ветках, документируя итеративный прогресс в таких возможностях, как 3D-VAE, rectified flow и различные пространственно-временные архитектуры.
Ключевые возможности и особенности:
- Генерация: текст в изображение, текст в видео, изображение в видео и видео в видео.
- Поддержка переменной длины видео (от 2 до 16 секунд или бесконечное время) и разрешений от 144p до 720p с гибкими соотношениями сторон.
- Полностью открытые чекпоинты и скрипты обучения, позволяющие пользователям тренировать или дообучать собственные модели.
- Подробные технические отчёты, документирующие архитектуру, процессы обучения и метрики оценки для каждой версии.
- Gradio-демо, размещённое на Hugging Face Spaces, для интерактивного тестирования.
Проект предоставляет обширную документацию по обучению, оценке видеоавтоэнкодеров и развёртыванию моделей, стремясь упростить сложные аспекты видеогенерирования для создателей контента и исследователей.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.