このプロジェクトについて
YuE2は、マルチモーダル・アート・プロジェクション・グループ(HKUST、M·A·P、Tokenwave.AI、NYU、Stanford、MBZUAI、NOIZ、ACE Studio)による音楽生成プロジェクトです。その目標は、記号的音楽生成と音声音楽生成を統合することです。歌詞とスタイルプロンプトが与えられると、まずメロディとコードの計画を書き、次にその計画をボーカルと伴奏を備えた完全な楽曲として実現します。
READMEに記載されている主な機能:
- ホワイトボックス・インターフェースとしての記号的計画。生成された楽曲は編集可能な譜面(ABC記譜法)であり、人間またはエージェントがレンダリング前に読み、演奏し、検査し、修正できます。メロディとコードが明示的なコントロールとなります。
- ゼロショットカバー。ソース録音は companion の SheetSage2 モデルで採譜でき、得られたメロディ譜を新しいスタイルで再レンダリングできます。READMEでは、伴奏が新しいスタイルに適応するよう、コード記号のない譜面で cot="melody" を推しています。
- エージェントによる音楽編集。計画をエクスポートし、修正し(和声、メロディ、テンポ、形式、歌詞)、新しい完全な録音として再レンダリングできます。READMEは、編集が新しい録音を生成し、編集以外では元の波形を保持しないと述べています。
- エージェント・スキル・パッケージ(skills/yue2-music/SKILL.md)。エージェントが楽曲を生成し、録音を採譜してカバーし、ABC譜面を編集し、音楽的不変条件を確認し、聴取比較を整理する方法を文書化しています。
アーキテクチャとパイプライン:単一のAR–NAR Mixture-of-Transformersバックボーンが譜面とセマンティックトークンを自己回帰的に予測し、次にフローマッチングで音響潜在変数を生成します。VAEが潜在変数を48 kHzステレオ音声にデコードします。段階的なPython APIは plan() → generate_semantic() → synthesize() → decode() を公開しています。生成モードには cot="full"(編集可能なメロディ・コード計画、デフォルト)、cot="melody"(自由な伴奏を伴うメロディ計画、カバーに推奨)、cot="off"(歌詞とスタイルから直接)、abc=...(自分の譜面を提供)があります。
要件とクイックスタート:Linux、Python 3.12、BF16サポートと24 GB VRAMを備えたNVIDIA GPU。インストールはリポジトリのクローンから pip install . を実行し、続いて examples/generate.py を実行します。モデルファイルは初回使用時にHugging Faceからダウンロードされます。出力は音声とともに、譜面、セマンティックトークン、音響潜在変数、生成設定、モデル識別情報を保持します。
コンパニオンモデルとリソース:YuE2-3B(生成、計画、カバー、編集)、YuE2-Vae と YuE2-Vae-legacy(デコーダ)、SheetSage2(音声から譜面への採譜)、MERT-v2-FullSong と MERT-v2-30s(音楽表現)、WildSongBench評価データセット。MERT2特徴抽出は生成にはオプションです。
READMEは、YuE2をいくつかのプロプライエタリおよびオープンシステムと比較したWildSongBench(192プロンプト、自動評価)のベンチマーク結果、および948作品でのゼロショットカバー結果を報告しています。また、MARBLEとGTZANでのMERT2結果、および採譜ベンチマークでのSheetSage2結果も報告しています。これらはプロジェクト自身が報告した数値です。README自体が、順位は指標によって異なり、上位平均間の小さな差は統計的有意性を確立しないと述べています。
ライセンス:ファーストパーティのコード、エージェントスキル、ドキュメントはApache 2.0、モデル重みは別途CC BY-NC 4.0、サードパーティコンポーネントは元のライセンスを保持します。以前のYuE-v1のコード、ドキュメント、ライセンスは別ブランチに保存されています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.