扩散语言模型终破100B规模!蚂蚁LLaDA2.2正面叫板自回归,杀入Agent战场
ChatGPT出来快三年了大模型圈几乎形成了一种共识自回归AR似乎就是通往通用智能的主路线。GPT-3、GPT-4、Llama、Qwen主流大模型全在沿着同一条路径狂奔更大的参数、更多的数据、更长的上下文。路越走越宽也越走越挤。一个token接一个token往外蹦的生成方式模型越来越大、需求越来越复杂推理效率慢慢成了绕不过去的坎。那能不能换种生成方式扩散语言模型dLLM给了个不一样的答案。理论上扩散语言模型可以并行预测多个token不用像AR模型那样死等前一个token生成完。同时它还天然具备双向上下文建模的能力。但过去几年扩散语言模型始终没进大模型的主战场。公开的最大离散扩散语言模型规模长期卡在8B而AR那边早就冲到几百B了。关键问题一直没人答得上来扩散语言模型的这些理论优势在百B级规模还能站得住吗规模持续放大后它到底能不能跟成熟的AR路线正面掰手腕蚂蚁联合多所高校发了LLaDA系列技术报告沿着一条清晰的路线连推三个版本。LLaDA2.0先把模型做到了100B47个benchmark上综合追平同规模AR编程和智能体任务已经领先。2.1在此基础上加了 T2T 编辑通道和EBPO强化学习推理速度冲到1587 TPS36个基准全面超过2.0。但这两版有一个共同的限制编辑只能一对一替换token不能增删。到了Agent场景面对缺失参数、重复n-gram、残缺代码块替换根本兜不住。于是有了LLaDA2.2。这次的重点不再是堆规模或提速度而是直接把扩散语言模型推进 Agent 的核心战场让扩散模型在工具交互任务中首次展现出超过同规模自回归模型的潜力。技术报告链接https://github.com/inclusionAI/LLaDA2.X01WSD三阶段持续预训练把dLLM推到100B一LLaDA2.0把扩散模型送上牌桌之前扩散语言模型最大只有8BAR那边几十B、几百B遍地跑。LLaDA2.0干了件别人没干成的事把扩散语言模型做到了100B。关键不是从零训而是拿现成的AR模型通过WSD三阶段持续预训练慢慢洗成扩散模型。Warmup逐步放大块大小让模型适应扩散目标Stable在全序列上充分训练Decay再缩回来保留推理效率。再加上CAP训练让模型解码时更果断推理速度反超AR最多2.1倍。47个benchmark 上100B的flash版综合73.18分差不多追平同规模AR。编程和智能体已经领先了。扩散语言模型上了桌。但两个问题还悬着速度还能更快吗并行解码的局部不一致在复杂任务上会不会崩这俩问题成了LLaDA2.1往下推的方向。光堆规模不够下一步是让扩散模型具备那种回头看、改一改、纠个错的能力。二LLaDA2.1学会改错速度翻倍LLaDA2.1加了一条T2T编辑通道模型能回头看了能纠错了。配合SMode和QModeflash版编程峰值干到892 TPSmini版冲到1587 TPS。同规模AR一般也就200到350。还引入了EBPO强化学习用ELBO替代精确对数似然来估计策略梯度把dLLM 的RL训练拉到了规模化的水平。36个基准上QMode全面超过2.0。但2.1的T2T只能一对一替换不能增删token。碰上缺失参数、重复n-gram、残缺代码块替换根本解决不了。在Agent场景里这就不够灵活了。普通文本生成的话这个限制影响不大。可一旦进了Agent任务模型面对的是不断变化的环境反馈得持续修改自己的行动轨迹。光靠替换token已经兜不住了。02扩散语言模型正式进入Agent时代Agent场景里模型不是单轮生成一段文字就完事了。它得读长的交互历史、规划多步动作、调用外部工具、根据环境反馈修正自己的行为。早期的一点点小错可能像滚雪球一样把后面所有步骤全污染了。LLaDA2.1的T2T编辑在这种场景下暴露了两个致命短板。第一固定长度替换解决不了结构性问题。JSON里多了一个括号或者少了一个参数字段替换没辙。第二块并行解码的任意顺序去噪容易导致推理路径坍缩。低不确定性的 token 先被定死高不确定性的分叉点反而被推迟处理上下文过早锁定了关键决策。LLaDA2.2的答案很干脆把编辑机制从一对一的替换升级成Levenshtein四操作编辑KEEP保留、SUBSTITUTE替换、DELETE删除、INSERT插入。不过要让扩散语言模型真正服务Agent光有编辑能力还不够。长上下文记忆、推理效率、专家路由的算力成本这些问题一个都绕不过去。一128K 长上下文Agent任务的交互历史动不动就几十K token。LLaDA2.2从2.1的8K底座出发两阶段渐进式长上下文持续预训练先在300B token的64K语料上训再用200B token扩展到128K最终原生支持128K上下文窗口。另一个是MoE的推理开销。标准MoE每个token独立选专家块扩散解码时一块32到64个token各自选top-k活跃专家集合可能膨胀到好几十个HBM流量和通信开销直接爆炸。LLaDA2.2搞了个Block Routing先在块级别做专家准入选出固定容量C48 的专家池再在池内 token级路由。每个推理块的专家工作集有了可预测的上界token级的专业化也保住了。二 Levenshtein编辑这是2.2最核心的创新。扩散解码过程中模型不仅可以从[MASK]生成tokenM2T不仅可以把已有token换成另一个T2T还可以删掉多余的token或者在指定位置插入新的[MASK]槽位。训练标签通过LCS最长公共子序列对齐自动构造。模型生成的中间草稿和ground-truth对齐后匹配位置标KEEP错位标SUBSTITUTE多余标DELETE缺失标INSERT。训练目标同时覆盖了预测正确token和判断增删操作这两类决策。效果很直接。同一底座在相同SWE轨迹数据上做SFT只开关Levenshtein编辑这一项差异SWE-bench Verified从35.8分跳到44.4分8.6个点。删和插这两个操作解决的是Token Editing改不动的硬骨头。三L-EBPOAgent场景下的编辑不是一个孤立的纠错动作而是一系列跟环境交互的策略性决策。LLaDA2.2搞了个L-EBPO把Levenshtein编辑操作纳入了强化学习的动作空间。具体来说动作空间从原来的猜下一个token扩展到了 {token词汇表} ∪ {DELETE, INSERT}。L-EBPO在外层用EBPO优化轨迹级决策在内层管理块内编辑什么时候删、什么时候插、在哪插。奖励信号完全来自环境反馈工具调用是否正确、输出格式是否合法、任务有没有完成。训练基础设施用ASystem做分布式编排SGLang做rollout生成AKernel管理大规模沙箱集群。rollout收集、沙箱服务、环境执行和策略优化全部异步并行。03交互式工具使用全面反超AR参照7个Agent基准上LLaDA2.2-flash平均53.83分AR参照Ling-2.6-flash是55.74差距不到2分。在交互式工具使用任务上LLaDA2.2-flash全面反超了AR模型τ²-Bench高出近4个点PinchBench略占上风MCP-Atlas领先超过5个点。扩散模型在需要动态感知和反馈闭环的场景里反而有优势。主要弱项在仓库级软件工程。SWE-bench Verified 拿了49.28比AR的61.20低了十几个点多语言版本也只有25.00落后AR近9个点。长程代码修复这块AR还是更稳。通识能力方面10个基准上2.2-flash平均56.81分低于2.1的59.23和Ling-2.6的65.90。亮点是LongBench v22.2拿了45.13略高于AR的42.94128K长上下文的效果算验证了。11个典型工作负载上LLaDA2.2-flash的BF16推理吞吐平均是Ling-2.6-flash的 1.64倍。FP8量化再提18.6%。Agent 任务里的BFCL-v4冲到703.82 TPSSWE-bench Verified 也到519 TPS。同时放出Agent分数和TPS数据LLaDA2.2想说的东西很清楚扩散模型不是速度换质量是可以同时拿到速度和竞争力。至少在多轮交互式Agent场景里这已经是事实。04自回归之外Agent时代的另一条路线LLaDA2.2并没有证明扩散语言模型已经全面超越自回归。它证明的是一件更重要的事在大模型发展的下一阶段自回归之外确实存在一条可扩展的新路线。交互式Agent任务全面超过同规模AR推理吞吐碾压1.64 倍128K长上下文也站住了。短板当然还在指令遵循、知识推理、长程代码修复这些AR还是更稳。通识能力差距依旧明显Agent的优势还覆盖不了所有任务。但方向已经很清楚了。并行解码、双向上下文、灵活编辑这些架构层面的先天优势不是靠工程技巧能追平的。自回归卷了三年做到了千亿、万亿扩散这条路才刚开始放大。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

如何用OpenVSP快速创建你的第一架飞机模型:新手教程

如何用OpenVSP快速创建你的第一架飞机模型:新手教程

如何用OpenVSP快速创建你的第一架飞机模型:新手教程 【免费下载链接】OpenVSP A parametric aircraft geometry tool 项目地址: https://gitcode.com/gh_mirrors/ope/OpenVSP OpenVSP是一款强大的参数化飞机几何设计工具,能够帮助航空爱好者、学生…

2026/8/9 2:58:12 阅读更多 →
如何快速上手Test PatchTST:零基础实现高精度时间序列预测

如何快速上手Test PatchTST:零基础实现高精度时间序列预测

如何快速上手Test PatchTST:零基础实现高精度时间序列预测 【免费下载链接】test-patchtst 项目地址: https://ai.gitcode.com/hf_mirrors/ibm-research/test-patchtst Test PatchTST是一款基于预训练模型的时间序列预测工具,专为零基础用户设计…

2026/8/9 2:58:13 阅读更多 →
Neo4j Spatial终极指南:如何为图数据库添加空间查询能力

Neo4j Spatial终极指南:如何为图数据库添加空间查询能力

Neo4j Spatial终极指南:如何为图数据库添加空间查询能力 【免费下载链接】spatial Neo4j Spatial is a library of utilities for Neo4j that faciliates the enabling of spatial operations on data. In particular you can add spatial indexes to already locat…

2026/8/9 2:39:00 阅读更多 →

最新新闻

校园二手交易与租赁系统开发实战

校园二手交易与租赁系统开发实战

1. 项目概述校园物品租赁与二手交易系统是当前高校场景下的刚需应用。作为一名在校园信息化领域深耕多年的开发者,我发现学生们经常面临这样的困境:想租个相机记录毕业季却找不到渠道,闲置的教材和电子产品只能低价贱卖,自行车等大…

2026/8/9 19:13:45 阅读更多 →
LearnOpenGL之Shader编程——生成设计

LearnOpenGL之Shader编程——生成设计

———————————————————— 前序 ——————————————————— AndroidLearnOpenGL是本博主自己实现的LearnOpenGL练习集合: Github地址:GitHub - wangyongyao1989/AndroidLearnOpenGL: OpenGL基础及运用 系列文章&#xff…

2026/8/9 19:13:45 阅读更多 →
校园物品租赁与二手交易系统开发实践

校园物品租赁与二手交易系统开发实践

1. 项目背景与核心价值校园物品租赁与二手交易系统是当前高校场景下的刚需应用。每到学期初和毕业季,教材、自行车、体育器材等物品的流转需求就会集中爆发。传统线下交易方式存在信息不对称、交易效率低、信任成本高等痛点。我们团队开发的这款微信小程序&#xff…

2026/8/9 19:13:45 阅读更多 →
进销云掌柜:中小微企业云端进销存管理解决方案

进销云掌柜:中小微企业云端进销存管理解决方案

1. 项目概述:进销云掌柜是什么?进销云掌柜是一款面向中小微企业的云端进销存管理解决方案。作为在零售行业摸爬滚打多年的从业者,我见过太多小老板还在用Excel手工记账,每天对账对到凌晨两三点。这款工具就是为解决这类痛点而生—…

2026/8/9 19:13:45 阅读更多 →
Yocto:.bbclass文件

Yocto:.bbclass文件

OpenBMC是基于Yocto项目的,而Yocto项目实在是太复杂了,本人也只了解了一点点,所以可能有不对的地方,以下是基于目前的理解所做的总结: 1.bbclass的作用 可以认为是为该layer中一些常用的工具定义了一组可以在多个配方中共享的任务和函数或一些通用的信息,比如想使用cma…

2026/8/9 19:13:45 阅读更多 →
FastAPI+Vue3构建高效图书推荐系统实战

FastAPI+Vue3构建高效图书推荐系统实战

1. 项目概述:Python图书推荐系统实战这个图书推荐系统项目采用FastAPIVue3全栈技术架构,是一个典型的内容推荐类应用。我在实际开发中发现,相比传统Django方案,FastAPI的异步特性能让推荐算法响应速度提升40%以上,特别…

2026/8/9 19:12:45 阅读更多 →

日新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/9 17:05:02 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/9 0:45:04 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/9 17:05:02 阅读更多 →