Sobre o projeto

O Open-Sora é um projeto de código aberto dedicado a democratizar a produção eficiente de vídeo, fornecendo modelos acessíveis, ferramentas e detalhes de implementação. O projeto oferece um pipeline completo para geração de vídeo, incluindo pré-processamento de dados, aceleração de treinamento (utilizando ColossalAI) e inferência. A versão mais recente, Open-Sora 2.0, apresenta um modelo de 11 bilhões de parâmetros. De acordo com o relatório técnico do projeto, este modelo foi treinado com um orçamento de aproximadamente US$ 200 mil e alcança desempenho equivalente a outros modelos de código aberto como HunyuanVideo (11B) e Step-Video (30B) no benchmark VBench e em avaliações de preferência humana. O projeto também mantém versões anteriores (1.0 a 1.3) em branches separados, documentando uma progressão iterativa em capacidades como 3D-VAE, fluxo retificado e várias arquiteturas espaço-temporais. Principais capacidades e funcionalidades incluem: - Geração de texto para imagem, texto para vídeo, imagem para vídeo e vídeo para vídeo. - Suporte para durações variadas de vídeo (de 2 segundos até 16 segundos ou tempo infinito) e resoluções que vão de 144p a 720p, com proporções de tela flexíveis. - Checkpoints e scripts de treinamento totalmente abertos, permitindo que os usuários treinem ou ajustem seus próprios modelos. - Relatórios técnicos detalhados documentando a arquitetura, processos de treinamento e métricas de avaliação para cada versão. - Um demo baseado em Gradio hospedado no Hugging Face Spaces para testes interativos. O projeto oferece documentação abrangente para treinamento, avaliação de autoencoders de vídeo e implantação dos modelos, com o objetivo de simplificar as complexidades da geração de vídeo para criadores de conteúdo e pesquisadores.