project
YuE2 - 港科技大联合 M-A-P 团队开源的音乐生成模型
YuE2是香港科技大学与M-A-P团队开源的音乐生成模型。模型能根据歌词和风格生成可编辑的ABC乐谱(旋律+和弦),再渲染为48kHz完整歌曲,让创作过程白盒可控。
YuE2是什么
YuE2是香港科技大学与M-A-P团队开源的音乐生成模型。模型能根据歌词和风格生成可编辑的ABC乐谱(旋律+和弦),再渲染为48kHz完整歌曲,让创作过程白盒可控。模型支持从零创作、零样本翻唱、Agent对话式编辑乐谱。在WildSongBench基准上SongBench Avg达6.9632,超越Suno v5等商业模型。
YuE2的主要功能
- 符号规划创作:输入歌词与风格提示,先生成可编辑的旋律+和弦 ABC 乐谱,再渲染为带人声与伴奏的完整歌曲。
- 零样本翻唱:用 SheetSage2 将原曲录音转录为乐谱,再以新风格或新歌词重新演绎,无需针对翻唱任务微调。
- Agent 对话式编辑:围绕乐谱与 Agent 对话,修改和声、旋律、速度或曲式后重新渲染出新版本。
- 音频转谱(SheetSage2):将任意录音转录为可检视、可修改的乐谱,是翻唱与编辑功能的入口。
- 音乐理解(MERT2):提供全曲级音乐表征,支撑转谱等下游任务,本身也在 MARBLE 基准 15 项中拿下 14 项 SOTA。
YuE2的技术原理
- 符号规划中间层:YuE2 的核心设计是在文本/音频条件与最终波形之间插入一层显式的符号乐谱(ABC 记谱,含旋律与和弦)。乐谱作为”白盒”接口,既可被人或 Agent 读取、修改,又决定了后续声学生成的结构,使创作从黑盒”抽卡”变为可控的作曲过程。
- AR–NAR 混合专家架构:模型采用单一的 Mixture-of-Transformers 骨干:AR 专家以因果注意力自回归预测乐谱 token 与语义 token,保证音乐的结构与歌词对齐;NAR 专家以双向注意力对声学 latent 做 flow matching 预测(25 Hz × 64),保证音频质量。两类专家共享混合自注意力层与 FFN,在一个 checkpoint 内统一处理规划与渲染。
- VAE 声学生成管线:NAR 专家输出的声学 latent 经 VAE 解码器还原为 48 kHz 立体声音频,全程无量化损失。训练时由离线模块构建目标:SheetSage2 从音频提取乐谱目标,MERT2+CVQ 生成语义 token 目标,VAE 编码器生成 latent 目标。
- 三模式统一于同一权重:创作、翻唱、编辑共用同一生成 checkpoint,唯一区别在于乐谱的来源不同,分别由模型自生成、SheetSage2 转录、或人工/Agent 修改后提供;翻唱时改用”仅旋律”模式,让伴奏自由适配新风格。
- 分阶段推理 API:推理被拆为
plan()→generate_semantic()→synthesize()→decode()四个阶段,乐谱、语义 token、声学 latent 及生成参数都会落盘保留。用户可在任意阶段介入:导出乐谱编辑后重渲染,或复用已生成的 plan 仅更换解码器,兼顾灵活性与可复现性。
微信关注回复“开源”,加入AI开源项目交流群
如何使用YuE2
- 环境准备:需要 Linux 系统、Python 3.12,及一块支持 BF16 的 NVIDIA GPU,模型权重首次运行时会自动从 Hugging Face 下载。
- 安装部署:
git clone仓库后创建虚拟环境,执行pip install .即可完成安装。 - 快速生成第一首歌:运行
python examples/generate.py --output outputs/first-song,可从内置示例生成歌曲,输出目录包含音频(flac)、乐谱及全部中间产物。 - Python API 调用:通过
YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B")加载管线,传入风格、歌词即可生成;cot参数控制模式——"full"生成可编辑乐谱(默认)、"melody"仅旋律规划、"off"直接生成。 - 翻唱一首歌:先用 SheetSage2 将原曲录音转录为旋律 ABC 谱,再以
cot="melody"传入新歌词或目标风格重新生成。 - 编辑已有作品:调用
pipe.plan()导出乐谱,人工或让 Agent 修改 ABC 文件后,用--abc-file edited.abc --cot full重新渲染出新版本。 - Agent skill 用法:将仓库中的
skills/yue2-music/导入支持 SKILL.md 的 Agent,即可通过自然对话完成写歌、转谱、改谱和版本对比。
YuE2的核心优势
- 质量对标商业模型:WildSongBench 上 SongBench Avg 达 6.9632(best-of-8),超越 Suno v5、Mureka 9 等商业产品,刷新开源音乐生成上限。
- 白盒可控创作:首创”符号规划”管线,旋律与和弦以 ABC 乐谱形式显式呈现,人和 Agent 都能在渲染前读取、修改作品。
- 三模式统一权重:创作、零样本翻唱、对话式编辑共用同一 checkpoint,翻唱无需专门微调即可实现 0.647 CLEWS mAP 的源曲保持度。
- 完全本地开源:代码遵循 Apache 2.0,3.6B 权重开放下载,单卡 24GB 显存即可离线运行,数据不出本机。
- 生态配套完整:同步开源 SheetSage2 转谱、MERT2 理解模型、WildSongBench 评测集及 yue2-music Agent skill,覆盖”转谱→创作→编辑→评测”全链路。
- 分阶段可干预:
plan() → generate_semantic() → synthesize() → decode()四段式 API,乐谱、语义 token、latent 全部落盘,支持复用计划、中途换解码器。
YuE2的项目地址
- 项目官网:https://map-yue2.github.io/
- GitHub仓库:https://github.com/multimodal-art-projection/YuE
YuE2的同类竞品对比
| 对比维度 | YuE2(M-A-P / 港科大) | Suno v5.5(Suno Inc.) |
|---|---|---|
| 产品性质 | 开源研究模型(约 3.6B 参数) | 闭源商业音乐生成服务 |
| 生成质量 | SongBench Avg 6.9632(best-of-8)/ 6.7316(标准版),17 个设置中排第一与第四 | SongBench Avg 6.7150,排第五,低于 YuE2 两个版本 |
| 核心机制 | 符号规划:先生成可编辑 ABC 乐谱(旋律+和弦),再渲染为 48kHz 音频,白盒可控 | 端到端音频生成,无中间乐谱层,黑盒模式 |
| 可控性 | 乐谱可读、可改、可复用;支持 Agent 对话式编辑和声、旋律、速度、曲式 | 主要通过提示词控制,无法逐音符干预,修改只能整曲重抽 |
| 翻唱能力 | 零样本翻唱:SheetSage2 转谱后换风格/歌词,CLEWS mAP 0.647(948 作品) | 无显式转谱-重演绎管线,翻唱依赖 prompt 引导,旋律保持度不可控 |
| 歌词清晰度 | PER 发音错误率 9.79%(Bo8)/ 8.44%(标准版) | PER 5.96%,明显优于 YuE2,是参测系统中歌词咬字最准的之一 |
| 文本对齐 | MuLan 0.5051 | MuLan 0.5089,略高于 YuE2 |
| 开源与部署 | 代码 Apache 2.0、权重开放下载,本地单卡 24GB 显存可跑,数据不出机 | 闭源,仅云端调用,无法本地部署,歌词与作品数据托管于厂商 |
YuE2的应用场景
- 个人音乐创作:不会作曲编曲的素人输入歌词+风格即可成歌,能通过改乐谱精细调整旋律走向,把”灵感”变成完整作品。
- 翻唱与二次创作:用 SheetSage2 将原曲转谱后,一键把歌曲改编成爵士、摇滚等新风格,或替换歌词做多语言版本,适配粉丝二创与短视频改编需求。
- 影视 / 游戏 / 广告配乐 Demo:制片方快速生成带人声或纯伴奏的候选配乐,低成本试错后再决定是否聘请真人制作,大幅压缩前期沟通成本。
- 音乐教育与和声分析:教师用其生成指定和弦走向、曲式结构的示例乐曲,学生可对照 ABC 乐谱学习作曲技法,实现”听得见、看得见、改得动”的教学闭环。