Sobre el proyecto
LivePortrait es la implementación oficial en PyTorch del artículo "LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control" (arXiv 2407.03168), desarrollado por investigadores de Kuaishou Technology, USTC y la Universidad de Fudan. El proyecto anima retratos estáticos o videos de retratos transfiriendo movimiento desde un video impulsor o una plantilla de movimiento.
Capacidades clave descritas en el README:
- Animación de retratos para humanos, más un modo Animales para gatos y perros (el modo Animales requiere X-Pose y solo se ha probado en Linux/Windows con GPU NVIDIA).
- Modo impulsado por imagen y modo impulsado por video (edición de video de retratos, v2v).
- Control de costura y reorientación, control regional y edición precisa de retratos en la interfaz Gradio.
- Archivos de plantilla de movimiento (.pkl) que pueden acelerar la inferencia y ayudar a proteger la privacidad al evitar la distribución de videos impulsores.
- Recorte automático del video impulsor con opciones ajustables de escala y desplazamiento.
- Soporte de concatenación de audio y video.
- Una interfaz web Gradio para humanos y otra separada para animales, con opciones como puerto del servidor, uso compartido y aceleración torch.compile (no compatible con Windows/macOS).
- Un script de evaluación de velocidad para medir el rendimiento de inferencia por módulo.
Instalación y uso:
- Requiere git, conda y FFmpeg; se crea un entorno conda con Python 3.10 y luego se instalan las dependencias desde requirements.txt (o requirements_macOS.txt para Apple Silicon).
- Los pesos preentrenados se descargan de HuggingFace (con una alternativa hf-mirror) o de Google Drive/Baidu Yun, y se colocan en ./pretrained_weights.
- La inferencia se ejecuta mediante inference.py para humanos e inference_animals.py para animales; las entradas de origen e impulsor se especifican con -s y -d.
- macOS con Apple Silicon es compatible con el modo Humanos, aunque se indica que puede ser mucho más lento que una RTX 4090.
El README también enumera numerosos proyectos e integraciones desarrollados por la comunidad, incluidos nodos de ComfyUI, extensiones de Stable Diffusion WebUI, FaceFusion, versiones más rápidas basadas en TensorRT y varios HuggingFace Spaces y playgrounds. Reconoce trabajos previos como FOMM, Open Facevid2vid, SPADE, InsightFace y X-Pose, e incluye una nota ética sobre los riesgos de los deepfakes y el uso responsable.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.