このプロジェクトについて

LivePortraitは、論文「LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control」(arXiv 2407.03168)の公式PyTorch実装であり、快手科技、中国科学技术大学、復旦大学の研究者らによって開発されました。このプロジェクトは、駆動ビデオまたはモーションテンプレートからモーションを転送することで、静止肖像画や肖像ビデオをアニメーション化します。 READMEに記載されている主な機能: - 人間の肖像アニメーションに加え、猫と犬向けのAnimalsモード(AnimalsモードにはX-Poseが必要で、NVIDIA GPUを搭載したLinux/Windowsでのみテスト済み)。 - 画像駆動モードとビデオ駆動モード(肖像ビデオ編集、v2v)。 - Gradioインターフェースでのステッチングとリターゲティング制御、リージョナル制御、精密な肖像編集。 - 推論を高速化し、駆動ビデオの配布を避けることでプライバシー保護に役立つモーションテンプレートファイル(.pkl)。 - スケールとオフセットを調整可能な駆動ビデオの自動クロッピング。 - オーディオとビデオの連結サポート。 - 人間用と動物用に分かれたGradioウェブインターフェース。サーバーポート、共有、torch.compileアクセラレーション(Windows/macOSでは非対応)などのオプションを提供。 - モジュールごとの推論パフォーマンスを測定するための速度評価スクリプト。 インストールと使用方法: - git、conda、FFmpegが必要。Python 3.10のconda環境を作成し、requirements.txt(Apple Siliconの場合はrequirements_macOS.txt)から依存関係をインストール。 - 事前学習済みウェイトはHuggingFace(hf-mirrorの代替あり)またはGoogle Drive/Baidu Yunからダウンロードし、./pretrained_weightsに配置。 - 推論は、人間用はinference.py、動物用はinference_animals.pyで実行。ソースと駆動入力は-sと-dで指定。 - Apple Silicon搭載のmacOSはHumansモードでサポートされているが、RTX 4090よりも大幅に遅い可能性があると記載。 READMEには、ComfyUIノード、Stable Diffusion WebUI拡張機能、FaceFusion、TensorRTベースの高速バージョン、さまざまなHuggingFace Spacesやプレイグラウンドなど、コミュニティ開発のプロジェクトや統合も多数記載されています。また、FOMM、Open Facevid2vid、SPADE、InsightFace、X-Poseなどの先行研究を認め、ディープフェイクのリスクと責任ある使用に関する倫理上の注意事項も含まれています。