Об этом проекте

LivePortrait — это официальная реализация PyTorch для статьи «LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control» (arXiv 2407.03168), разработанная исследователями из Kuaishou Technology, USTC и Fudan University. Проект оживляет статичные портреты или портретные видео, перенося движения из управляющего видео или шаблона движения. Ключевые возможности, описанные в README: - Анимация портретов для людей, а также режим Animals для кошек и собак (режим Animals требует X-Pose и протестирован только на Linux/Windows с NVIDIA GPU). - Режим на основе изображения и режим на основе видео (редактирование портретного видео, v2v). - Управление сшиванием и ретаргетингом, региональное управление и точное редактирование портретов в интерфейсе Gradio. - Файлы шаблонов движения (.pkl), которые ускоряют вывод и помогают защитить конфиденциальность, избегая распространения управляющих видео. - Автоматическое кадрирование управляющего видео с настраиваемыми параметрами масштаба и смещения. - Поддержка объединения аудио и видео. - Веб-интерфейс Gradio для людей и отдельный для животных, с такими опциями, как порт сервера, общий доступ и ускорение torch.compile (не поддерживается на Windows/macOS). - Скрипт оценки скорости для измерения производительности вывода по модулям. Установка и использование: - Требуются git, conda и FFmpeg; создаётся окружение conda с Python 3.10, затем устанавливаются зависимости из requirements.txt (или requirements_macOS.txt для Apple Silicon). - Предварительно обученные веса загружаются с HuggingFace (альтернатива hf-mirror) или с Google Drive/Baidu Yun и размещаются в ./pretrained_weights. - Вывод запускается через inference.py для людей и inference_animals.py для животных; исходные и управляющие входные данные указываются с помощью -s и -d. - macOS с Apple Silicon поддерживается для режима Humans, но отмечается, что он может быть значительно медленнее, чем RTX 4090. В README также перечислены многочисленные проекты и интеграции, разработанные сообществом, включая узлы ComfyUI, расширения Stable Diffusion WebUI, FaceFusion, более быстрые версии на основе TensorRT и различные HuggingFace Spaces и песочницы. В нём упоминаются предыдущие работы, такие как FOMM, Open Facevid2vid, SPADE, InsightFace и X-Pose, а также содержится примечание по этике о рисках дипфейков и ответственном использовании.