YuE2 技术报告:SongBench 6.96 碾压公开基线,Suno v5 该慌吗?
YuE2 技术报告SongBench 6.96 碾压公开基线Suno v5 该慌吗【免费下载链接】Yue2项目地址: https://ai.gitcode.com/hf_mirrors/Comfy-Org/Yue2就在中文社区的技术报告解读集中出现的前一天报告正文已于 9 月 27 日挂上 arXiv10 月 8 日社区解读开始发酵香港科技大学与 M-A-P 团队放出了 YuE2 的 56 页完整技术报告。最抓眼球的一句话是在 WildSongBench 上YuE2 的 SongBench 全局平均分达到 6.96best-of-8是全部受测系统中最高的观测均值专家听感评测则显示其音频质量与商用系统 Suno v5 相当。一时间开源碾压 Suno的叙事铺满评论区。但把报告读透之后会发现6.96 这个数字的成立有一整套前提评测集是 192 条真实用户提示的 WildSongBench6.96 是8 个候选中择优的采样口径而碾压的对象严格来说是 8 个公开基线——在面对 Suno v5 时专家偏好其实打成了 40.4% 对 39.9% 的平手。本文从报告原文出发拆解 6.96 分的来路、专家评测的设计细节以及分数口径之外那些容易被标题忽略的局限。一、6.96 分怎么来的一条从乐谱到 48kHz 立体声的生成链路先理解 YuE2 的技术骨架因为 SongBench 分数背后是一个与主流端到端音频生成截然不同的架构。YuE2 用一个约 3.58B 参数的 AR–NAR Mixture-of-TransformersMoT28 层、隐宽 2048、上下文 24,576 位置把生成过程显式分解为三层符号作曲规划s先用 ABC 文本乐谱写出旋律、和弦、调性、拍号、速度与曲式结构——这是人可读、可改的中间产物语义音乐 tokenc把乐谱展开为 25Hz、375 bit/s 的 MERT2 语义 token 序列32,768 项码本每 40ms 一个 token连续声学隐变量z在乐谱与语义 token 条件下通过双向 flow matching 预测 25Hz×64 维的声学 latent最终由独立训练的 Oobleck VAE 解码为 48kHz 立体声波形。生成概率被因式分解为p(score, semantic | text) × p(acoustic | text, score, semantic)自回归流负责先作曲再填细节非自回归流负责按谱演奏。训练数据约 34.6 万小时音乐全程 bf16、64 张 H800。这套设计的直接后果是同一个 checkpoint 能同时做创作、按谱编辑与零样本翻唱因为三者只差乐谱从哪来——创作是模型自己写谱编辑是用户改谱后重渲染翻唱则先用 SheetSage2 把参考录音转成乐谱再换风格渲染。本仓库作为 ComfyUI 生态的重打包版恰好把这条链路的三个关键权重都带了进来ComfyUI/ └── models/ ├── audio_encoders/ │ └── sheetsage2_bf16.safetensors └── checkpoints/ ├── yue2_3b_bf16.safetensors └── yue2_3b_int8_convrot.safetensors其中audio_encoders/sheetsage2_bf16.safetensors正是全曲主旋律转录器 SheetSage2报告称其在 15 组全曲转录对比指标中领跑 12 组RWC-Pop 人声旋律 F1 从 62.71 提升到 82.51checkpoints/yue2_3b_int8_convrot.safetensors则是为消费级显卡准备的 int8 量化变体——社区实测 24GB 显存即可本地跑通这也是本地 71 秒生成一首 3.6 分钟歌曲类教程能成立的基础。二、6.96 的完整口径192 条提示、两候选与 best-of-8回到分数本身。SongBench 是报告引入的七维歌曲质量评测Musicality、Melody、Arrangement、Structure、Instrumental、Mixing、Vocal全局平均分Global Avg取七维均值。所有系统统一跑在 WildSongBench 上192 条在野真实用户请求覆盖 15 个流派桶其中 94 条中文、98 条英文提示歌词与风格描述经各系统原生接口喂入。比较协议的关键是候选预算标准对比中每个系统对每条提示生成 2 个候选取 ASR 四次转写中音素错误率PER较低的那个。在此口径下YuE2SongBench 全局平均 6.7316Musicality 5.90758 个公开基线全部低于它YuE1 4.9165、SongBloom 4.2350、LeVo 2 6.3247、ACE-Step 1.5 6.0118、HeartMuLa 6.2483、DiffRhythm 2 5.2428、Muse 6.0349、MiniMax Music 3 6.2830。所以全面碾压公开基线这个表述在 6.7316 口径下就是成立的而且是用 3.58B 参数打出的——报告中 8 个公开基线里 6 个参数比它多例如 HeartMuLa 为 5.43B。而标题里的6.96 是 best-of-8 口径对每条提示生成 8 个候选先剔除在 SongBench Musicality、Q3O、PER 三维上被支配的候选再保留 Musicality 最高值 0.10 以内的然后依次按 Q3O 与 PER 择优。在此口径下 YuE2 达到6.9632SongBench Global Avg与 6.2666Musicality是包括商用系统在内所有受测系统中最高的观测均值——Suno v5 为 6.8721Mureka 9 为 6.9377。值得指出的是best-of-8 同时也带来了采样成本上的不对等商用接口通常每次请求只返回 2 首歌而 best-of-8 意味着 8 倍生成预算外加一次按指标排序的选择。换句话说6.96 是8 选 1 择优后的上限观测值6.7316 才是与商用接口同预算口径下的默认表现。在同一张表里两候选口径下 Mureka 96.9377与 Suno v56.8721仍排在 YuE2 之前这一点与碾压一切的传播口径存在温差。三、专家评测与 Suno v5对齐的细节与前提自动指标之外报告把专家听感评测当作感知质量的首要证据其流程设计相当严谨线上经 X、GitHub、Hugging Face 招募了 289 场参与837 组保留评价另有 62 名具有音乐学院训练背景或音频 AI 研究经验的付费标注者来自中央、上海、星海等音乐学院合计 4,439 组保留成对评价系统身份隐藏、A/B 顺序随机、每首歌至少聆听 30 秒且每批 32 题埋入 5 个一致性检查同音频必须判平、反转顺序必须保持原偏好。在这个协议下针对六个商用基线Suno v4.5 / v5 / v5.5 / v6 / v6 Wild、Mureka 9YuE2best-of-8vs Suno v4.557.3% 对 30.5%明显胜出vs Suno v540.4% 对 39.9%——几乎打平这正是对齐 Suno v5表述的来源vs Suno v631.6% 对 59.3%——反而落后尽管自动指标上 Bo8 的 SongBench Avg 更高音频质量是突出强项对六个商用基线的平局调整后平均偏好达到58.9%CR1 95% 置信区间 55.6%–62.2%p 1.70×10⁻⁶即在纯声音保真度与混音上专家对 YuE2 的偏好全面占优。换言之Suno v5 慌了这种情绪化标题需要降级为更准确的技术表述在一个需要逐题聆听、30 秒起评、一致性校验的盲听协议下一个 3.58B 的开源模型在整体质量上与 Suno v5 打成平手在音频质量维度上系统性占优——这是开源音乐生成第一次在成品感上站到商用第一梯队但距离碾压还有 v6 这道坎。报告还顺手回答了符号规划到底有没有用用同一 checkpoint、同一提示、同一采样预算做消融专家在整体质量上偏好先写旋律和弦乐谱再渲染的比例为49.3%远高于无规划生成的 34.6%p0.0070音乐性维度为 45.0% 对 29.4%而把语义 token 预测与声学生成合并进统一 MoT、而非分离的 LMDiT整体质量偏好为 53.4% 对 35.6%p0.0084。乐谱不只是可解释的附加品它本身就在提升听感。四、报告之外分数口径与评测集的三点冷静读技术报告不能只读摘要。以下三点是理解 6.96 乃至整个评测体系必须带上的上下文。第一分数口径会说话。6.96 最高观测均值与6.7316 两候选口径是同一个模型的两个数字传播时前者被反复引用、后者被略过。此外报告在二维指数可视化中给出了更细腻的定位质量指数SongBench: SongEval 按 2:1 加权上 YuE2 Bo8 为 88.34但Mureka 9 的质量指数最高90对齐指数上Suno v5 最高90YuE2 Bo8 为 83.89。在 0.6–0.8 的权重区间内做敏感性分析时Musicality 合成指数最高的是 YuE2 Bo8而全局平均合成指数最高的是 Mureka 9——不同维度上谁是第一取决于你更看重哪个指标。第二评测集与基线存在不对称。WildSongBench 是 192 条提示的小样本评测流派覆盖 15 桶中英比例为 94:98所有公开基线中HeartMuLa 被报告以 † 标注——它明确在训练后处理中使用了 SongEval 与 AudioBox 来过滤 SFT 数据并构造 DPO 偏好对属于用评测指标训练模型的情况。报告如实披露了这一点并把分数保留在排名里但读者横向比较时仍应意识到各家基线对评测指标的暴露程度并不相同。同理SongEval 维度上 HeartMuLa4.5519高于 YuE2 Bo84.2960歌词准确率PER最低的是 MiniMax Music 30.0627而非 YuE20.0844——碾压在个别维度并不成立。第三工程落地与许可边界同样重要。本仓库重打包自 m-a-p 的 YuE2-3B 与 SheetSage2README 明确标注 license 为cc-by-nc-4.0非商业许可这与开源对标 Suno的社区叙事之间存在一条需要创作者自己把握的红线。功能层面README 提供了两条官方工作流——YuE2 Music Cover零样本翻唱与 YuE2 Text to Music文字成曲对应报告里两个硬核结论翻唱评测用 948 首 SHS100K 未见作品完整乐谱条件下的 CLEWS mAP 0.647 与 Discogs-VINet mAP 0.288 双双压过 SongEcho0.419/0.122与 ACE-Step 1.5乐谱编辑则做到和声编辑达成率 79.54%、旋律 84.17%、节奏 73.43%同时未编辑内容保留度维持在 90.16%–94.34%——只换和声不动旋律这类白盒操作有数据背书而不是宣传话术。回到标题的问题Suno v5 该慌吗更准确的说法是——当开源模型第一次在同一盲听协议、同一候选预算约等于下与 v5 打成平手、并在音频质量上占优时商用闭源阵营的护城河已经从音质转移到了版本迭代速度与生态封闭性。YuE2 用一份 56 页的报告证明了一件事把作曲显式写成可编辑的乐谱不是牺牲音质换取可控性而是两条路同时走通。至于 v6 之后 Suno 的回应以及 YuE2 团队在 MERT2、SheetSage2 上的后续迭代才是这场竞赛真正的下一回合。【免费下载链接】Yue2项目地址: https://ai.gitcode.com/hf_mirrors/Comfy-Org/Yue2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

TaoToken视角下的大语言模型网络安全应用:系统性文献综述大纲

TaoToken视角下的大语言模型网络安全应用:系统性文献综述大纲

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 23:57:25 阅读更多 →
YOLOv5 OBB旋转框训练实战:从水平框到带角度检测的完整指南

YOLOv5 OBB旋转框训练实战:从水平框到带角度检测的完整指南

简介:本资源为YOLOv5 OBB旋转框训练DEMO,面向具备一定深度学习基础、希望掌握倾斜目标检测的开发者与算法学习者,解决常规轴对齐边界框难以精确表示树木、车辆等有角度物体的问题。压缩包共583个文件,约445.58MB,涵盖7…

2026/10/10 23:57:25 阅读更多 →
玉米数据集1960张VOC+YOLO:从标注转换到YOLOv8训练与避坑指南

玉米数据集1960张VOC+YOLO:从标注转换到YOLOv8训练与避坑指南

简介:这份资源是面向计算机视觉初学者与农业图像分析研究者的玉米目标检测数据集,采用Pascal VOC与YOLO双格式标注,可直接用于模型训练、验证与算法对比实验。压缩包共2000个文件,包含1960张jpg图片及一一对应的1960个xml标注文件…

2026/10/10 23:57:25 阅读更多 →

最新新闻

OpenCV模板匹配实现车牌识别:从定位到字符识别的完整流程

OpenCV模板匹配实现车牌识别:从定位到字符识别的完整流程

简介:这是一套面向Python与OpenCV学习者的车牌自动识别实战资源,基于真实车辆图像完成检测与识别流程,适合智能交通、停车场管理等场景的初学者参考。包内涵盖1999张车辆及字符图片、1个Python主程序及字符匹配模板,共2000个文件&…

2026/10/11 0:46:03 阅读更多 →
LivePortrait ONNX Runtime 部署:C++与Python双语言推理实战

LivePortrait ONNX Runtime 部署:C++与Python双语言推理实战

简介:这份资源面向希望在人像动画生成方向落地的开发者与算法工程师,提供基于onnxruntime推理引擎部署LivePortrait的完整程序,同时给出C与Python两套实现路径,解决从模型推理到工程集成的问题。压缩包共14个文件,约45…

2026/10/11 0:46:03 阅读更多 →
烟雾明火烟火火灾检测数据集:VOC+YOLO双格式3000张实战指南

烟雾明火烟火火灾检测数据集:VOC+YOLO双格式3000张实战指南

简介:这份资源面向计算机视觉方向的目标检测学习者与开发者,提供烟雾与明火两类目标的标注数据集,可用于火灾预警、烟火识别等场景的模型训练与算法验证。压缩包共约2000个文件,以1999个xml标注文件和1个说明txt为主,整…

2026/10/11 0:46:03 阅读更多 →
OFDR光纤传感仿真源码解析:从拍频模型到温度解调

OFDR光纤传感仿真源码解析:从拍频模型到温度解调

简介:这份资料面向光纤传感领域的研究人员与工程师,聚焦光学频率域反射(OFDR)分布式传感技术的仿真与算法实现,适合具备一定MATLAB与LabVIEW基础、希望深入理解OFDR原理并动手复现的读者。压缩包共5个文件,…

2026/10/11 0:46:03 阅读更多 →
Neo4j 与 OpenStreetMap 实战:构建高效路由服务

Neo4j 与 OpenStreetMap 实战:构建高效路由服务

简介:Neo4jOSM 是一套面向 Java 开发者与图数据库学习者的开源路由服务示例,将高性能图数据库 Neo4j 与开放地图项目 OpenStreetMap 结合,用于构建基于地理位置的最短路径与路线规划功能。项目演示了从 OSM 数据中提取路网节点与道路关系、映…

2026/10/11 0:46:03 阅读更多 →
基于SpringBoot的社区疫情志愿者管理系统设计与实现

基于SpringBoot的社区疫情志愿者管理系统设计与实现

看到这个标题,我第一反应就是:这个题目把毕设里最稳的几样东西全凑齐了——Java、Web、SpringBoot,业务上又踩中了“社区疫情志愿者管理”这个非常典型的现实场景。去年我帮几个学弟梳理过同类型的项目,坦白讲,这类系统…

2026/10/11 0:45:02 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →