Sobre o projeto

FramePack é a implementação oficial e o software desktop para o artigo "Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models". É uma estrutura de rede neural de previsão de próximo quadro (próxima seção de quadros) que gera vídeos progressivamente. Abordagem técnica principal: o FramePack comprime os contextos de entrada para um comprimento constante, de modo que a carga de trabalho de geração é independente do comprimento do vídeo. Isso permite processar um grande número de quadros com modelos de 13B, mesmo em GPUs de laptop. Os autores o descrevem como "difusão de vídeo, mas com sensação de difusão de imagem". Também pode ser treinado com tamanhos de lote maiores, semelhante ao treinamento de difusão de imagens. Requisitos de hardware: GPUs Nvidia RTX 30XX, 40XX ou 50XX que suportem fp16 e bf16 (GTX 10XX/20XX não testadas), Linux ou Windows, pelo menos 6GB de memória GPU. Para gerar um vídeo de 1 minuto a 30fps (1800 quadros) usando um modelo de 13B, a memória GPU mínima necessária é de 6GB. O software fornece uma GUI baseada em Gradio, onde os usuários fazem upload de uma imagem e escrevem um prompt à esquerda, e visualizam os vídeos gerados e as prévias latentes à direita. Os vídeos são gerados seção por seção, com feedback visual fornecido durante todo o processo. As opções de instalação incluem um pacote Windows de um clique (CUDA 12.6 + PyTorch 2.6) e instalação Linux via pip com Python 3.10. O software suporta kernels de atenção PyTorch, xformers, flash-attn e sage-attention. A aceleração TeaCache está disponível, mas observada como não sem perdas, podendo influenciar os resultados. O repositório inclui exemplos de verificação e diretrizes de criação de prompts, recomendando prompts concisos focados em movimento. O repositório avisa explicitamente que é o único site oficial do FramePack e que vários outros domínios (framepack.co, framepack.ai, etc.) são falsos e não devem ser usados.