Sobre o projeto
LivePortrait é a implementação oficial em PyTorch do artigo "LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control" (arXiv 2407.03168), desenvolvido por pesquisadores da Kuaishou Technology, USTC e Universidade de Fudan. O projeto anima retratos estáticos ou vídeos de retratos transferindo movimento a partir de um vídeo de condução ou modelo de movimento.
Principais recursos descritos no README:
- Animação de retratos para humanos, além de um modo Animais para gatos e cães (o modo Animais requer X-Pose e é testado apenas em Linux/Windows com GPU NVIDIA).
- Modo baseado em imagem e modo baseado em vídeo (edição de vídeo de retratos, v2v).
- Controle de costura e reorientação, controle regional e edição precisa de retratos na interface Gradio.
- Arquivos de modelo de movimento (.pkl) que podem acelerar a inferência e ajudar a proteger a privacidade evitando a distribuição de vídeos de condução.
- Corte automático de vídeo de condução com opções ajustáveis de escala e deslocamento.
- Suporte a concatenação de áudio e vídeo.
- Uma interface web Gradio para humanos e outra separada para animais, com opções como porta do servidor, compartilhamento e aceleração torch.compile (não suportado em Windows/macOS).
- Um script de avaliação de velocidade para medir o desempenho de inferência por módulo.
Instalação e uso:
- Requer git, conda e FFmpeg; um ambiente conda com Python 3.10 é criado e as dependências são instaladas a partir de requirements.txt (ou requirements_macOS.txt para Apple Silicon).
- Os pesos pré-treinados são baixados do HuggingFace (com alternativa hf-mirror) ou do Google Drive/Baidu Yun e colocados em ./pretrained_weights.
- A inferência é executada via inference.py para humanos e inference_animals.py para animais; as entradas de origem e condução são especificadas com -s e -d.
- macOS com Apple Silicon é suportado para o modo Humanos, sendo potencialmente muito mais lento que um RTX 4090.
O README também lista numerosos projetos e integrações desenvolvidos pela comunidade, incluindo nós ComfyUI, extensões Stable Diffusion WebUI, FaceFusion, versões mais rápidas baseadas em TensorRT e vários HuggingFace Spaces e playgrounds. Ele reconhece trabalhos anteriores como FOMM, Open Facevid2vid, SPADE, InsightFace e X-Pose, e inclui uma nota de ética sobre riscos de deepfake e uso responsável.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.