Suno最强开源对手来了:4090一分钟出歌,把AI音乐从抽卡变成可编辑工程

量子位 2026-09-20 17:39
YuE2 团队 投稿 
量子位 | 公众号 QbitAI

近期,香港科技大学联合M-A-P、NOIZ AI、斯坦福等机构发布并开源了一个统一符号与音频音乐生成的模型YuE2,将开源音乐生成的质量推向与前沿闭源模型正面竞争的位置。

在WildSongBench的192个prompts评测中,YuE2已逼近Suno v5、Mureka 9,同时超过Suno最新一代闭源模型v6及v6 Wild;八选一后更以6.9632拿下17组参评系统最高分,遥遥领先多款前沿闭源模型。

Suno最强开源对手来了:4090一分钟出歌,把AI音乐从抽卡变成可编辑工程图1

YuE2登顶GitHub Trending榜

Suno最强开源对手来了:4090一分钟出歌,把AI音乐从抽卡变成可编辑工程图2

AI垂直领域博主AI Search发帖介绍YuE2

但YuE2的野心远不止把开源音乐生成推到frontier水平。它还试图解决AI音乐创作长期存在的另一个难题:如何让一次性的生成结果,变成一个可以被理解、定位、修改,并持续迭代的创作过程。

如果说过去用户更多是在一次次“抽卡”中寻找满意的结果;那么YuE2希望把一首生成出来的歌,真正变成可以继续打磨的作品。

开源SOTA,逼近闭源Suno v5,超越最新Suno v6

采用WildSongBench进行评测,在192个prompts上,YuE2的SongBench平均分达到6.7316,逼近Suno v5的6.8721和Mureka 9的6.9377;同时超过Suno最新一代模型v6(6.5562)及v6 Wild(6.4195)。在八选一设置下,YuE2得分进一步提升至6.9632,超过包括Suno v5、v6、MiniMax Music 2.6、Mureka 9在内的多款前沿闭源音乐模型。

Suno最强开源对手来了:4090一分钟出歌,把AI音乐从抽卡变成可编辑工程图3
歌曲质量综合了SongBench和SongEval的评估结果;文本对齐综合了MuLan、AllMusicCaps以及Qwen3-Omni Judger的结果。两个坐标轴均显示归一化的比较指数。气泡面积代表AudioBox的生成质量。

Agentic Music Editing:用一句话,精细修改已经生成的音乐

不只是生成一首歌,YuE2把音乐变成一份可以继续被修改的“工程文件”。在生成音频之前,模型会先规划一份包含人声旋律、器乐旋律、和弦和段落结构的双轨曲稿,并以ABC文本记谱形式保存。这种“先写下作曲安排,再生成最终声音”的方式,就是YuE2引入的核心机制创新——symbolic planning(乐谱规划)。音频中的旋律和和声不再是黑盒结果,而是能够被创作者定位、修改,再重新演绎。

这也使得YuE2能够支持Agentic Music Editing。比如,用户可以直接说:“保留副歌的人声旋律,但插入一段《小星星》萨克斯solo,和声变得更现代一些。”接入YuE2的Agent可以读取原曲的旋律与和弦,结合乐理提出修改方案,定位并改写对应的和弦或音符,再调用YuE2生成新的完整版本。用户不需要自己理解乐谱,也可以通过自然语言持续调整已有的歌曲。

对于专业音乐人,同一套机制则提供更直接的控制。例如,一首副歌原本采用4–5–3–6–2–5–1的和声进行,音乐人可以保留原有Vocal与Ins两条旋律,只将其中一个和弦修改为减七和弦,再让YuE2重新演绎。改动进入声音的同时,没有修改的旋律与和声可以被尽量保留。

实验也验证了这种编辑能力。研究者对完整作品中的旋律与和弦进行定向修改后,目标音高匹配率由0.83%提升至93.75%,目标和弦一致率由0提升至83.13%;未修改部分的旋律和和弦相似度分别保持在0.96和0.93以上。重新生成整曲时,改动能够进入声音,其他部分的主要旋律与和弦内容也能得到较好保留。

YuE2的symbolic planning创新,使歌曲先以可读、可编辑的曲稿表示,再由模型将修改后的作曲安排重新演绎为完整音频,从而把过去偏“黑盒”的音乐生成,变成可以定位、修改、验证并持续迭代的创作过程。

Cover Song:让一首歌重新长成另一种样子

一首已经完成的歌,也可以成为下一轮创作的起点。与直接基于音频模仿的翻唱方式不同,YuE2首先理解歌曲中的旋律、和声和结构,再重新组织声音表达。借助SheetSage2,已有录音被还原成包含旋律、和弦、节拍等信息的可编辑曲稿,再基于这份曲稿重新生成新的演绎版本。

这意味着,创作者可以保留原曲最有辨识度的人声主题或旋律框架,同时按照创作意愿重新安排器乐、和声、唱法和整体风格。比如,同一段旋律可以从原本的编配切换成另一种曲风,也可以保留主旋律,只重做伴奏和演唱方式。Cover不再只是“照着原曲再唱一遍”,而是可以在保留作品核心辨识度的同时,做新的编排和再创作。

团队在948首作品上进行了零样本Cover Song评测,每种方法共生成3792个结果,且不进行候选筛选,YuE2也没有针对翻唱任务进行专项微调。在完整曲谱条件下,生成结果在CLEWS检索系统中的首位命中率达到71.3%;去掉曲谱后仅为0.3%。在两套检索系统的八项指标中,完整曲谱条件下的YuE2均高于SongEcho和ACE-Step 1.5。

更关键的是,Cover Song和前面的编辑能力并不是两套割裂的流程。已有歌曲被转成曲稿后,创作者还可以继续修改旋律、和弦或编配,再交给YuE2重新演绎。从翻唱到改编,再到生成新的版本,可以发生在同一套创作流程里。音乐不再是一次生成、一次抽卡的结果,而是一首可以被创作者持续修改和打磨的作品。

从曲稿到声音:YuE2背后的一套完整音乐技术栈

为了让一首歌既能被理解和修改,又能最终生成完整音频,YuE2同时开源了MERT2、SheetSage2以及配套的tokenizer/codec。

MERT2是整个系统底层的音乐理解模型。它把连续音频编码到一个有结构的向量空间中,让旋律、和弦、节奏等具有相似音乐属性的内容在表示空间里彼此更接近,为后续的音乐理解、检索和生成提供基础。在MARBLE的10项任务、15个指标中,MERT2系列有14项领先报告中的对照模型;基于MERT2构建的低码率音乐token,在与MuCodec和EnCodec的六项对比指标中也有五项取得最高分。

在MERT2的基础上进一步微调得到的SheetSage2,则负责把已有录音还原成旋律、和弦、节拍和结构等可编辑的曲稿信息,为Cover Song和后续编辑提供入口。在技术报告列出的13组转谱评测中,SheetSage2有10组取得最高分,覆盖旋律、和弦、调性、节拍与结构等任务。

这些能力最终汇入YuE2约36亿参数的Mixture-of-Transformers架构:模型先生成ABC曲稿和音乐语义表示,再进一步生成声学信息并解码为48kHz立体声音频。

在训练数据方面,YuE2使用了由TokenWave.AI提供的CC0授权数据与合成数据。

从写一首新歌,到修改已有作品,再到重新演绎,YuE2用一个模型串起了从生成到编辑的完整音乐创作流程。

Suno最强开源对手来了:4090一分钟出歌,把AI音乐从抽卡变成可编辑工程图4

YuE2模型现已开放下载,并支持在消费级游戏显卡(4090)上一分钟出歌。欢迎音乐人和开发者亲自体验、微调和探索。

这仅仅是一个开始。团队期待来自社区的真实使用和反馈,并将持续迭代模型能力与创作体验,让YuE2在更多音乐场景中变得更好用、更可控。

体验YuE2:
Demo:https://map-yue2.github.io/
GitHub:https://github.com/multimodal-art-projection/YuE
Hugging Face:https://huggingface.co/m-a-p/YuE2-3B

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 开源
more
手机背面成AI硬件新战场:从录音卡到电子纸,巨头与初创的贴身肉搏
B站上线AI大模型实测榜,GPT-6 Astra夺魁国产模型占三席
B站推出“AI无限竞技场”大模型实测榜,GPT-6 Astra首轮夺魁
AIDC 板式换热器: [液冷核心枢纽,国产替代迎机会
当AI在思过崖刻下剑谱:数学家的“才华”该葬于何处?
机器人领域的OpenAI,竟然是OpenAI自己?
腾讯研究院AI速递 20260921
圆桌观点 | AI重构光学行业!深度拆解:范式变革、产业破局与人才新生
本周 AI 项目推荐:Raindrop、AIUC、AIR Security……谁在做 Agent 的安全生意?
边缘算力升级,工控机站上AI风口
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号