这个项目能做什么

YuE2 是一个来自多模态艺术投影团队(香港科技大学、M·A·P、Tokenwave.AI、纽约大学、斯坦福大学、MBZUAI、NOIZ、ACE Studio)的音乐生成项目。其既定目标是统一符号音乐生成和音频音乐生成:给定歌词和风格提示,它首先编写旋律与和弦计划,然后将该计划实现为包含人声和伴奏的完整歌曲。 README 中描述的关键能力: - 符号规划作为白盒接口。生成的作曲是一个可编辑的乐谱(ABC 记谱法),个人或智能体可以在渲染前阅读、播放、检查和修改。旋律和和弦成为显式控制。 - 零样本翻唱。源录音可以使用配套的 SheetSage2 模型进行转写,生成的旋律乐谱可以以新风格重新渲染。README 建议使用 cot="melody",并搭配不含和弦符号的乐谱,以便伴奏适应新风格。 - 智能体音乐编辑。计划可以导出、修订(和声、旋律、节奏、结构、歌词),并重新渲染为新的完整录音。README 指出,编辑会生成新录音,不会保留编辑外的原始波形。 - 一个智能体技能包(skills/yue2-music/SKILL.md),记录了智能体如何生成歌曲、转写和翻唱录音、编辑 ABC 乐谱、检查音乐不变量以及组织试听比较。 架构和流程:一个单一的 AR–NAR 混合 Transformer 主干自回归地预测乐谱和语义标记,然后通过流匹配生成声学潜变量;VAE 将潜变量解码为 48 kHz 立体声音频。分阶段 Python API 暴露了 plan() → generate_semantic() → synthesize() → decode()。生成模式包括 cot="full"(可编辑的旋律与和弦计划,默认)、cot="melody"(旋律计划,伴奏自由,推荐用于翻唱)、cot="off"(直接从歌词和风格生成),以及 abc=... 以提供自定义乐谱。 要求和快速开始:Linux、Python 3.12、支持 BF16 且具有 24 GB 显存的 NVIDIA GPU。安装通过从仓库克隆后执行 pip install . 完成,然后运行 examples/generate.py。模型文件在首次使用时从 Hugging Face 下载。输出保留乐谱、语义标记、声学潜变量、生成设置和模型标识,以及音频。 配套模型和资源:YuE2-3B(生成、规划、翻唱、编辑)、YuE2-Vae 和 YuE2-Vae-legacy(解码器)、SheetSage2(音频到乐谱转写)、MERT-v2-FullSong 和 MERT-v2-30s(音乐表示),以及 WildSongBench 评估数据集。MERT2 特征提取对于生成是可选的。 README 报告了在 WildSongBench(192 个提示,自动评估)上的基准结果,将 YuE2 与多个专有和开源系统进行比较,并报告了在 948 部作品上的零样本翻唱结果。它还报告了 MERT2 在 MARBLE 和 GTZAN 上的结果,以及 SheetSage2 在转写基准上的结果。这些是项目自己报告的数字;README 本身指出,排名因指标而异,顶级均值之间的微小差距不构成统计显著性。 许可:第一方代码、智能体技能和文档采用 Apache 2.0;模型权重单独采用 CC BY-NC 4.0 许可;第三方组件保留其原始许可。早期 YuE-v1 代码、文档和许可保存在单独的分支上。