À propos du projet

LivePortrait est l'implémentation officielle en PyTorch de l'article « LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control » (arXiv 2407.03168), développée par des chercheurs de Kuaishou Technology, de l'USTC et de l'Université Fudan. Le projet anime des portraits fixes ou des vidéos de portraits en transférant le mouvement d'une vidéo de conduite ou d'un modèle de mouvement. Les capacités clés décrites dans le README : - Animation de portraits pour les humains, plus un mode Animaux pour les chats et les chiens (le mode Animaux nécessite X-Pose et n'est testé que sur Linux/Windows avec GPU NVIDIA). - Mode piloté par image et mode piloté par vidéo (édition vidéo de portrait, v2v). - Contrôle du stitching et du retargeting, contrôle régional et édition précise du portrait dans l'interface Gradio. - Fichiers de modèles de mouvement (.pkl) qui peuvent accélérer l'inférence et aider à protéger la vie privée en évitant la distribution de vidéos de conduite. - Recadrage automatique de la vidéo de conduite avec des options d'échelle et de décalage réglables. - Prise en charge de la concaténation audio et vidéo. - Une interface web Gradio pour les humains et une autre pour les animaux, avec des options telles que le port serveur, le partage et l'accélération torch.compile (non pris en charge sur Windows/macOS). - Un script d'évaluation de la vitesse pour mesurer les performances d'inférence par module. Installation et utilisation : - Nécessite git, conda et FFmpeg ; un environnement conda avec Python 3.10 est créé, puis les dépendances sont installées à partir de requirements.txt (ou requirements_macOS.txt pour Apple Silicon). - Les poids pré-entraînés sont téléchargés depuis HuggingFace (avec une alternative hf-mirror) ou depuis Google Drive/Baidu Yun, et placés dans ./pretrained_weights. - L'inférence est exécutée via inference.py pour les humains et inference_animals.py pour les animaux ; les entrées source et de conduite sont spécifiées avec -s et -d. - macOS avec Apple Silicon est pris en charge pour le mode Humains, noté comme potentiellement beaucoup plus lent qu'un RTX 4090. Le README répertorie également de nombreux projets et intégrations développés par la communauté, notamment les nœuds ComfyUI, les extensions Stable Diffusion WebUI, FaceFusion, les versions plus rapides basées sur TensorRT, et divers HuggingFace Spaces et playgrounds. Il reconnaît les travaux antérieurs tels que FOMM, Open Facevid2vid, SPADE, InsightFace et X-Pose, et inclut une note d'éthique sur les risques de deepfake et l'utilisation responsable.