实测给 AuK 下句说东北话口音真就改了——语音编辑没有想象中那么玄【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK过去几年想让一段录音换个说法换个口音换个情绪基本意味着三件事先准备一整套音频处理管线再祈祷重构别把音色搞崩最后还得接受改一个字、整句重念的粗粒度体验。腾讯混元与上海交大在 2026 年 9 月开源的语音基础模型 AuK1.5B 参数、MIT 协议把这件事压缩成了一句话——自然语言指令加一段参考音频模型自己完成从听到改再到合成的全流程。本文基于开源仓库源码与社区实测情报用说东北话这类指令作为切入点记录口音、风格、情感三类编辑的真实表现并拆解指令怎么写才不改坏音色与韵律。先看架构为什么改口音能是一条指令AuK 的核心设计是任务统一。在 README.md 的任务表中零样本 TTS、指令式 TTS、内容编辑、歌词改写、音高/语速/音量编辑、情绪/音色/去口音/非语言声编辑、耳语转换、语音增强、人声分离、目标说话人提取等十几类任务全部走同一个自然语言指令接口。配套 config.yaml 把生成主干定为 Flux2Edit条件流匹配 CFM 编辑模型语义条件来自 Qwen2.5-Omni-3B 多模态编码器声学条件来自联合在语音、通用音频和音乐上训练的 BigVGANFlow VAE输出 24kHz 高质量音频target_sample_rate: 24000latent_dim: 64。换句话说模型不是针对去口音单独训了一个专用网络而是把口音、音色、情绪、语速、内容全部编码成可条件化的声学特征空间再由扩散主干在保持什么、改变什么的约束下重新生成。这也是它能做到改口音但音色不变的根本原因——音色信息由参考音频条件牢牢钉住指令只负责操控口音这一维度。实测记录口音、风格、情感三类指令的真实表现先说大家最关心的改口音。官方 Cookbook 里给出的去口音模板是中文直白指令请去掉这段语音里的方言口音保持说话人音色一致。对应英文模板为 Remove the regional accent while preserving the speakers voice and content。有意思的是这类指令是双向生效的——既然模型能把四川话改成标准普通话那么反向的加口音同样落在它的副语言编辑能力范围内。社区实测中给模型下请用东北话口音重说这段话保持内容和音色不变输出的口音特征确实发生了可感知迁移而说话人音色、语速节奏基本维持原样——这正是去口音/加口音任务被归入 Paralinguistic副语言编辑的原因它动的是发音腔调这一层而不是内容层和声纹层。其次是风格与音色指令。Cookbook 的音色Timbre模板要求明确保留内容请将这段音频的音色修改为符合以下描述的声音一个低沉平静的男声。实测中这类描述式指令的成功率与描述的具体程度强相关给出低沉、沙哑、老成这类有明确声学指向的短语效果明显优于好听一点这种模糊表达——因为模型是在条件流匹配框架里做声学属性编辑指令文本要能映射到具体的声学维度上。情感编辑是最值得单独记录的一项。官方模板将情感限定在固定集合将情感转变为{开心/愤怒/悲伤/恐惧/惊讶/厌恶/平静/兴奋}。但社区对 AuK 技术报告的拆读指出其情绪编辑成功率仅有 9.94%——这是五个任务族里明显偏弱的短板。实测体验与之一致把平静改成开心时语调和重音会有变化但改了但没完全改的情况很常见且容易在句尾带上不自然的能量起伏。相比之下语速将语速调整为 1.5 倍、音高将音调升高 2 个半音、音量将音量升高 10 分贝这三类数值型声学编辑几乎是指哪打哪——因为它们有明确的物理参数对应模型只需在条件空间里做确定性偏移。指令怎么写才不改坏音色与韵律实测中改坏音色和破坏韵律的高发原因其实集中在指令写法而非模型能力上。从 Cookbook 的模板结构可以归纳出三条规律规律一只描述要改的维度不描述不需要改的维度。好的指令是把 X 改成 Y的原子操作例如内容编辑的把我们没办法拥有的改成与未竟之梦好好相处或者删掉锚点前/后面的内容。反过来如果一条指令同时要求改口音改情绪加快语速多个维度的条件互相牵制韵律被破坏的概率会显著上升。AuK 的架构决定了每个条件都要经过扩散主干的重构条件越多各约束间的冲突面越大。规律二遵循模板的动词参数结构善用 gen_seconds。官方 Python 接口from auk.infer.infer_auk import AukInferrun_auk(...)中TTS、内容编辑、语速调整这类输出时长会变化的任务必须显式传入gen_seconds目标秒数否则模型会按默认时长截断听感上就是语速/节奏不对。而保持等长的任务音高、音量、去口音、增强分离则不需要传。此外 ComfyUI 集成会检查共享的 30 秒参考目标音频预算——超过 30 秒的输入本身就超出模型能力范围这不属于指令问题而是当前版本的硬边界。规律三数值参数比形容词可靠闭集比开集可靠。语速只支持 {0.5/0.75/1.25/1.5/2.0} 倍、音高只支持 {1/2/3} 个半音、音量只支持 {5/10/15} 分贝——这些离散取值是训练时覆盖过的超出集合的取值如1.7 倍速效果会明显退化。情感同样建议从 8 个闭集标签里选而音色、风格这类描述式指令尽量用低沉、沙哑、年轻这种可声学化的词避免有磁性很高级这类主观词汇。实测结论哪些任务稳哪些还是玄学把口音/风格/情感三类指令的实测结果放在一起AuK 的能力边界其实非常清晰稳定区接近指哪打哪零样本 TTS一段参考音频一句指令复刻音色、语音内容编辑替换/插入/删除官方支持歌词改写、数值型声学编辑语速/音高/音量、去口音、耳语转换、语音增强与分离去噪、去混响、人声/音乐分离、目标说话人提取。这类任务要么有明确的物理参数要么有强条件锚点社区实测普遍反馈可靠。玄学区能改但不可控情绪编辑9.94% 成功率的技术报告数字与主观听感一致、开放式音色描述、以及一切超出 30 秒预算的长音频编辑。情绪的问题在于它本身是高度耦合的声学属性——情绪改变几乎必然牵动语速、音高、能量模型很难做到只动情绪。另外两个工程约束值得提前知晓AuK 需要配合 3B 的 Qwen2.5-Omni 编码器运行显存需求不低好在官方同时发布了蒸馏版 AuK-Flash用一致性初始化加任务路由的解耦蒸馏把推理压到 4 步且无需 CFG相对完整版提速约 4.5 倍属于效果可接受、成本大幅下降的日常使用选择。回到开头的判断语音编辑并没有想象中那么玄。它玄的部分音色保持、韵律一致已经由参考音频条件条件流匹配这套机制解决剩下真正玄的部分只剩情绪和开放式描述——而那正是技术报告里也承认的短板。把指令写成原子操作模板参数显式时长你得到的稳定度基本就是 AuK 当前的上限。【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考