このプロジェクトについて

LiveTalkingは、テキストまたは音声によって仮想アバターを駆動し、音声と映像を同期させたリアルタイム対話を行うためのオープンソースのストリーミング型デジタルヒューマンエンジンである。複数のデジタルヒューマンモデルをサポートしており、ernerf、musetalk、wav2lip、Ultralight-Digital-Humanなどを利用できる。音声クローン、話している最中に割り込まれる処理、全身映像の合成、モーションの編成、カスタムデジタルヒューマン形象にも対応している。システムはLLMと連携して応答文を生成し、TTSで音声を合成し、デジタルヒューマンをリアルタイムにリップシンク駆動し、最終的にWebRTC、RTMP、または仮想カメラを通じて出力できる。プロジェクトは、ブラウザページ、HTTP API、デスクトップクライアントなどの接続方法を提供し、アバター生成ページや管理画面も備えている。これにより、動画のアップロードによるデジタルヒューマン生成、セッション状態の監視、全体設定の調整が容易になる。モジュール化されたアーキテクチャは、API層、ロジック層、レンダリング層、配信層、プラグインシステムをカバーし、EdgeTTS、GPT-SoVITS、CosyVoice、Tencent CloudなどのTTS方式をサポートする。Qwenなどの大規模モデルやOpenAI互換ゲートウェイとの接続も可能である。想定される利用場面は、仮想配信者やライブコマース、AIデジタルヒューマンカスタマーサービス、オンライン教育、スマート音声アシスタント、大画面での解説、短動画の一括制作などである。プロジェクトはインストール手順、Dockerイメージ、APIドキュメント、性能参考情報を提供しており、リアルタイムなデジタルヒューマン対話やライブ配信が必要な開発者に適している。