YuE2 团队 投稿
量子位 | 公众号 QbitAI
近期,香港科技大学联合M-A-P、NOIZ AI、斯坦福等机构发布并开源了一个统一符号与音频音乐生成的模型YuE2,将开源音乐生成的质量推向与前沿闭源模型正面竞争的位置。
在WildSongBench的192个prompts评测中,YuE2已逼近Suno v5、Mureka 9,同时超过Suno最新一代闭源模型v6及v6 Wild;八选一后更以6.9632拿下17组参评系统最高分,遥遥领先多款前沿闭源模型。

△YuE2登顶GitHub Trending榜

△AI垂直领域博主AI Search发帖介绍YuE2
但YuE2的野心远不止把开源音乐生成推到frontier水平。它还试图解决AI音乐创作长期存在的另一个难题:如何让一次性的生成结果,变成一个可以被理解、定位、修改,并持续迭代的创作过程。
如果说过去用户更多是在一次次“抽卡”中寻找满意的结果;那么YuE2希望把一首生成出来的歌,真正变成可以继续打磨的作品。
开源SOTA,逼近闭源Suno v5,超越最新Suno v6
采用WildSongBench进行评测,在192个prompts上,YuE2的SongBench平均分达到6.7316,逼近Suno v5的6.8721和Mureka 9的6.9377;同时超过Suno最新一代模型v6(6.5562)及v6 Wild(6.4195)。在八选一设置下,YuE2得分进一步提升至6.9632,超过包括Suno v5、v6、MiniMax Music 2.6、Mureka 9在内的多款前沿闭源音乐模型。

△歌曲质量综合了SongBench和SongEval的评估结果;文本对齐综合了MuLan、AllMusicCaps以及Qwen3-Omni Judger的结果。两个坐标轴均显示归一化的比较指数。气泡面积代表AudioBox的生成质量。
Agentic Music Editing:用一句话,精细修改已经生成的音乐
不只是生成一首歌,YuE2把音乐变成一份可以继续被修改的“工程文件”。在生成音频之前,模型会先规划一份包含人声旋律、器乐旋律、和弦和段落结构的双轨曲稿,并以ABC文本记谱形式保存。这种“先写下作曲安排,再生成最终声音”的方式,就是YuE2引入的核心机制创新——symbolic planning(乐谱规划)。音频中的旋律和和声不再是黑盒结果,而是能够被创作者定位、修改,再重新演绎。
这也使得YuE2能够支持Agentic Music Editing。比如,用户可以直接说:“保留副歌的人声旋律,但插入一段《小星星》萨克斯solo,和声变得更现代一些。”接入YuE2的Agent可以读取原曲的旋律与和弦,结合乐理提出修改方案,定位并改写对应的和弦或音符,再调用YuE2生成新的完整版本。用户不需要自己理解乐谱,也可以通过自然语言持续调整已有的歌曲。
对于专业音乐人,同一套机制则提供更直接的控制。例如,一首副歌原本采用4–5–3–6–2–5–1的和声进行,音乐人可以保留原有Vocal与Ins两条旋律,只将其中一个和弦修改为减七和弦,再让YuE2重新演绎。改动进入声音的同时,没有修改的旋律与和声可以被尽量保留。
实验也验证了这种编辑能力。研究者对完整作品中的旋律与和弦进行定向修改后,目标音高匹配率由0.83%提升至93.75%,目标和弦一致率由0提升至83.13%;未修改部分的旋律和和弦相似度分别保持在0.96和0.93以上。重新生成整曲时,改动能够进入声音,其他部分的主要旋律与和弦内容也能得到较好保留。
YuE2的symbolic planning创新,使歌曲先以可读、可编辑的曲稿表示,再由模型将修改后的作曲安排重新演绎为完整音频,从而把过去偏“黑盒”的音乐生成,变成可以定位、修改、验证并持续迭代的创作过程。
Cover Song:让一首歌重新长成另一种样子
一首已经完成的歌,也可以成为下一轮创作的起点。与直接基于音频模仿的翻唱方式不同,YuE2首先理解歌曲中的旋律、和声和结构,再重新组织声音表达。借助SheetSage2,已有录音被还原成包含旋律、和弦、节拍等信息的可编辑曲稿,再基于这份曲稿重新生成新的演绎版本。
这意味着,创作者可以保留原曲最有辨识度的人声主题或旋律框架,同时按照创作意愿重新安排器乐、和声、唱法和整体风格。比如,同一段旋律可以从原本的编配切换成另一种曲风,也可以保留主旋律,只重做伴奏和演唱方式。Cover不再只是“照着原曲再唱一遍”,而是可以在保留作品核心辨识度的同时,做新的编排和再创作。
团队在948首作品上进行了零样本Cover Song评测,每种方法共生成3792个结果,且不进行候选筛选,YuE2也没有针对翻唱任务进行专项微调。在完整曲谱条件下,生成结果在CLEWS检索系统中的首位命中率达到71.3%;去掉曲谱后仅为0.3%。在两套检索系统的八项指标中,完整曲谱条件下的YuE2均高于SongEcho和ACE-Step 1.5。
更关键的是,Cover Song和前面的编辑能力并不是两套割裂的流程。已有歌曲被转成曲稿后,创作者还可以继续修改旋律、和弦或编配,再交给YuE2重新演绎。从翻唱到改编,再到生成新的版本,可以发生在同一套创作流程里。音乐不再是一次生成、一次抽卡的结果,而是一首可以被创作者持续修改和打磨的作品。
从曲稿到声音:YuE2背后的一套完整音乐技术栈
为了让一首歌既能被理解和修改,又能最终生成完整音频,YuE2同时开源了MERT2、SheetSage2以及配套的tokenizer/codec。
MERT2是整个系统底层的音乐理解模型。它把连续音频编码到一个有结构的向量空间中,让旋律、和弦、节奏等具有相似音乐属性的内容在表示空间里彼此更接近,为后续的音乐理解、检索和生成提供基础。在MARBLE的10项任务、15个指标中,MERT2系列有14项领先报告中的对照模型;基于MERT2构建的低码率音乐token,在与MuCodec和EnCodec的六项对比指标中也有五项取得最高分。
在MERT2的基础上进一步微调得到的SheetSage2,则负责把已有录音还原成旋律、和弦、节拍和结构等可编辑的曲稿信息,为Cover Song和后续编辑提供入口。在技术报告列出的13组转谱评测中,SheetSage2有10组取得最高分,覆盖旋律、和弦、调性、节拍与结构等任务。
这些能力最终汇入YuE2约36亿参数的Mixture-of-Transformers架构:模型先生成ABC曲稿和音乐语义表示,再进一步生成声学信息并解码为48kHz立体声音频。
在训练数据方面,YuE2使用了由TokenWave.AI提供的CC0授权数据与合成数据。
从写一首新歌,到修改已有作品,再到重新演绎,YuE2用一个模型串起了从生成到编辑的完整音乐创作流程。

YuE2模型现已开放下载,并支持在消费级游戏显卡(4090)上一分钟出歌。欢迎音乐人和开发者亲自体验、微调和探索。
这仅仅是一个开始。团队期待来自社区的真实使用和反馈,并将持续迭代模型能力与创作体验,让YuE2在更多音乐场景中变得更好用、更可控。
体验YuE2:
Demo:https://map-yue2.github.io/
GitHub:https://github.com/multimodal-art-projection/YuE
Hugging Face:https://huggingface.co/m-a-p/YuE2-3B