Об этом проекте
FramePack — официальная реализация и десктопное приложение для статьи "Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models". Это архитектура нейронной сети для предсказания следующего кадра (следующей секции кадров), которая генерирует видео постепенно.
Ключевой технический подход: FramePack сжимает входные контексты до постоянной длины, чтобы объём вычислений не зависел от длины видео. Это позволяет обрабатывать очень большое количество кадров с помощью 13B моделей даже на ноутбучных GPU. Авторы описывают это как "video diffusion, but feels like image diffusion". Он также может обучаться с большими размерами батча, аналогично обучению image diffusion.
Требования к оборудованию: GPU Nvidia RTX 30XX, 40XX или 50XX серии с поддержкой fp16 и bf16 (GTX 10XX/20XX не тестировались), Linux или Windows, минимум 6 ГБ видеопамяти. Для генерации одноминутного видео при 30 fps (1800 кадров) с использованием 13B модели минимально требуемый объём видеопамяти составляет 6 ГБ. Приложение предоставляет GUI на базе Gradio, где пользователи загружают изображение и пишут промпт слева, а справа просматривают сгенерированные видео и latent previews. Видео генерируется секция за секцией, с визуальной обратной связью на каждом этапе.
Варианты установки включают Windows one-click package (CUDA 12.6 + PyTorch 2.6) и установку на Linux через pip с Python 3.10. Программное обеспечение поддерживает ядра внимания PyTorch, xformers, flash-attn и sage-attention. Доступно ускорение TeaCache, но отмечено, что оно не является lossless и может влиять на результаты. Репозиторий включает sanity check examples и рекомендации по промптингу, советуя использовать короткие промпты, ориентированные на движение.
Репозиторий явно предупреждает, что является единственным официальным сайтом FramePack, а многочисленные другие домены (framepack.co, framepack.ai и др.) являются фейковыми и не должны использоваться.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.