Об этом проекте
LivePortrait — это официальная реализация PyTorch для статьи «LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control» (arXiv 2407.03168), разработанная исследователями из Kuaishou Technology, USTC и Fudan University. Проект оживляет статичные портреты или портретные видео, перенося движения из управляющего видео или шаблона движения.
Ключевые возможности, описанные в README:
- Анимация портретов для людей, а также режим Animals для кошек и собак (режим Animals требует X-Pose и протестирован только на Linux/Windows с NVIDIA GPU).
- Режим на основе изображения и режим на основе видео (редактирование портретного видео, v2v).
- Управление сшиванием и ретаргетингом, региональное управление и точное редактирование портретов в интерфейсе Gradio.
- Файлы шаблонов движения (.pkl), которые ускоряют вывод и помогают защитить конфиденциальность, избегая распространения управляющих видео.
- Автоматическое кадрирование управляющего видео с настраиваемыми параметрами масштаба и смещения.
- Поддержка объединения аудио и видео.
- Веб-интерфейс Gradio для людей и отдельный для животных, с такими опциями, как порт сервера, общий доступ и ускорение torch.compile (не поддерживается на Windows/macOS).
- Скрипт оценки скорости для измерения производительности вывода по модулям.
Установка и использование:
- Требуются git, conda и FFmpeg; создаётся окружение conda с Python 3.10, затем устанавливаются зависимости из requirements.txt (или requirements_macOS.txt для Apple Silicon).
- Предварительно обученные веса загружаются с HuggingFace (альтернатива hf-mirror) или с Google Drive/Baidu Yun и размещаются в ./pretrained_weights.
- Вывод запускается через inference.py для людей и inference_animals.py для животных; исходные и управляющие входные данные указываются с помощью -s и -d.
- macOS с Apple Silicon поддерживается для режима Humans, но отмечается, что он может быть значительно медленнее, чем RTX 4090.
В README также перечислены многочисленные проекты и интеграции, разработанные сообществом, включая узлы ComfyUI, расширения Stable Diffusion WebUI, FaceFusion, более быстрые версии на основе TensorRT и различные HuggingFace Spaces и песочницы. В нём упоминаются предыдущие работы, такие как FOMM, Open Facevid2vid, SPADE, InsightFace и X-Pose, а также содержится примечание по этике о рисках дипфейков и ответственном использовании.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.