这个项目能做什么

FramePack 是论文《Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models》的官方实现及桌面软件。它是一种逐段预测下一帧的视频扩散神经网络结构,可渐进式生成视频。 核心技术思路:FramePack 将输入上下文压缩为固定长度,使生成工作量与视频长度无关。这让它即使在笔记本 GPU 上也能用 13B 模型处理大量帧。作者将其描述为“像图像扩散一样的视频扩散”,并且可以采用类似图像扩散训练的更大批量进行训练。 硬件要求:支持 fp16 和 bf16 的 Nvidia RTX 30XX、40XX 或 50XX 系列 GPU(GTX 10XX/20XX 未测试),Linux 或 Windows 系统,至少 6GB GPU 显存。使用 13B 模型生成 1 分钟 30fps(共 1800 帧)视频,最低仅需 6GB 显存。软件提供基于 Gradio 的图形界面:左侧上传图片并输入提示词,右侧查看生成视频与潜在预览。视频逐段生成,并实时提供视觉反馈。 安装方式包括 Windows 一键包(CUDA 12.6 + PyTorch 2.6),以及使用 Python 3.10 通过 pip 在 Linux 上安装。软件支持 PyTorch attention、xformers、flash-attn 和 sage-attention 内核。TeaCache 加速功能可用,但标注为非无损,可能影响结果。仓库中提供了 sanity check 示例与提示词指南,建议使用简洁、侧重运动的提示词。 仓库明确声明其为 FramePack 唯一官方网站,并提醒 framepack.co、framepack.ai 等众多域名均为假冒,请勿使用。