智谱GLM-5.3发布同基座纯靠后训练编程涨50还点亮网安技能树
大家好我是程序员天天困。8 月 14 日智谱正式甩出新一代基座模型 GLM-5.3。这个时间点很微妙——月之暗面 Kimi K3 和 DeepSeek V4 Pro 刚发布没多久国产开源旗舰的节奏已经卷到了月月有新版本。但这次最值得聊的不是又涨了几分而是智谱在官方博客开篇就写了一句很直白的话Scaling post-training is all we did。基座没换参数没加所有提升都来自后训练。这篇就把官方技术报告和文档过一遍聊聊 GLM-5.3 到底强在哪、哪些数字需要冷静看、API 迁移有什么坑。一、先看结论这次到底更新了什么GLM-5.3 是智谱最新旗舰模型据公开报道总参数规模 7430 亿使用与 GLM-5.2 完全相同的基础模型。这意味着所有能力提升都来自后训练阶段——更多任务环境、更多样化的长程任务、更长的训练时间。后训练Post-training基座模型完成预训练之后用强化学习、人类反馈等方法针对性打磨能力的阶段。你可以理解为同一个大脑又送去集训了一个月。官方给了两个核心更新方向更强的编程能力以及意外涌现的网络安全能力。模型支持 1M 上下文窗口最大输出 128K Tokens目前只处理文本模态。发布节奏上GLM Coding Plan 已全量上线 5.3模型 API 近期开放完整权重计划在发布两周后安全评估完成后开源。二、编程能力内部基准涨 50%开源 SOTA 怎么来的先说结论GLM-5.3 在编程上的提升是实打实的而且不是靠刷公开榜刷出来的。公开基准三个最有代表性的数字基准GLM-5.2GLM-5.3说明Terminal Bench 3.04.628.3开源最佳超 Kimi K3 的 17.4DeepSWE v1.146.266.9接近 Fable 5 的 69.7Agents’ Last Exam (CLI)23.828.5超 Kimi K3 的 27.6 和 Opus 4.8 的 25.7Terminal Bench 3.0 从 4.6 飙到 28.3 是这次最夸张的数字。这个基准测的是模型在真实终端环境里端到端完成任务的能力不是写个函数就完事。但智谱自己也知道公开榜可能有污染所以搞了个内部基准叫 Z.ai Code Bench把智能体丢进复杂本地开发环境里按端到端完成率和细粒度检查项准确率两个维度打分。结果是 5.3 比 5.2 提升了约 50%。更值得关注的是 Token 效率。Max 档位下5.3 准确率 34.5%、平均每项任务输出约 7.5 万 Token5.2 是 23.4%、约 9.6 万 Token。花更少的 Token办更多的事。跟闭源模型比High 档位下 5.3 用约 5 万 Token 拿到 31.4%Opus 4.8 用约 12 万 Token 拿到 29.5%。不过官方也很坦诚Max 档 Fable 5 是 39.5%5.3 是 34.5%差距还在。这些提升背后的方法论智谱总结为任务环境规模化。训练任务不再是传统编程题而是接近专家真实工作的完整单元——比如给模型一个计算集群和代码库让它定位训练栈瓶颈、实施优化、跑实验、交付可量化的加速。有些任务资深工程师也要做好几天。说白了前沿模型的竞争正在从谁的模型更聪明转向谁能搭出更接近真实工作的训练环境。三、网络安全意外涌现但别被单一榜单带节奏这是这次发布最有意思的部分。智谱原话是后训练时把漏洞发现数据和环境加进去原本只想让模型更会找 bug结果网络安全能力的增长速度超出了预期。5.3 不只是能识别孤立漏洞开始能跨多个漏洞利用阶段推理形成完整的利用链。三个基准看下来网安基准GLM-5.2GLM-5.3Mythos 5怎么看CyberGym77.2%84.5%83.8%白盒源码找漏洞5.3 全场第一ExploitBench24.4%54.4%78.0%真实漏洞深度利用翻倍但差距明显ExploitGym (6h)39 项130 项247 项限时完成漏洞利用任务仍有近一倍差距CyberGym 84.5% 确实是开源第一还略超 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。但这个基准测的是最基础的白盒场景——给源码、触发异常来验证漏洞属于漏洞挖掘的起点。越往漏洞利用链深处走差距越真实。ExploitBench 上 5.3 虽然比 5.2 翻倍还多54.4% vs 24.4%但 Mythos 5 是 78.0%。ExploitGym 六小时完成数 5.3 是 130 项Mythos 5 是 247 项差了快一倍。官方自己一句话总结得很到位当前差距最大的方向恰恰也是能力增长最快的方向。真正有说服力的是真实代码库测试。从 GLM-5.2 起智谱就联合国内多家安全团队用模型扫真实代码库。经过专家复核、筛选、去重5.3 在 269 个项目中共发现 2436 个漏洞其中 1097 个中高危Critical 107 个、High 990 个。这些漏洞横跨系统内核、浏览器引擎、开源基础设施、Web 应用和网络协议最老的一个已在代码里潜伏约 40 年官方台账标注最早可追溯到 1981 年。智谱为此建了个公开的 Z.ai 安全漏洞披露台账目前 53 个已公开、2383 个仍在协调披露中。这也是开源权重两周后才放的原因——一个编码和挖洞能力都在开源第一梯队的模型直接开放下载安全评估和加固必须先做。四、API 必看思考模式强制开启老代码不改会报错GLM-5.3 的 API 有一个破坏性变更上线前务必注意思考功能不能关闭了。模型始终启用思考提供三个推理强度档位参数取值默认说明thinking.typeenabledenabled仅支持开启不再支持disabledreasoning_effortlow/high/maxmaxlow 轻量、high 增强、max 深度如果你现有代码里写的是thinking.type: disabled直接把 model ID 换成glm-5.3请求会失败。迁移办法是先改成enabled并把reasoning_effort设成low再切模型 ID。官方建议 Coding 等复杂任务用max。请求示例{model:glm-5.3,thinking:{type:enabled},reasoning_effort:max}可能有人会问为什么要强制开思考不给关闭选项从 5.2 到 5.3 的训练路线看智谱把 SAO带上下文压缩的长程 RL 策略和思考深度绑定了。关掉思考等于丢掉这套后训练带来的大部分增益模型表现会明显退化。与其让用户踩坑不如直接不支持。简单任务用low档位省 Token 就行。协议支持上5.3 同时兼容 OpenAI Chat Completion、OpenAI Response 和 Anthropic Message 三种协议Base URL 分别是/api/paas/v4、/api/v1和/api/anthropic。不过订阅过 GLM Coding Plan含已过期的账号暂时只能用 OpenAI Chat Completion 协议官方说近期迭代。能力层面支持流式输出、Function Calling、上下文缓存、结构化输出该有的都有。五、什么时候能用上、怎么用最划算目前 GLM Coding Plan 已经全量上线 GLM-5.3可以在 ZCode、Claude Code、Cline、Cursor、Trae 等主流编程智能体里直接用。新版 Coding Plan 改成了基于积分的配额系统输入、缓存输入、输出 Token 分开计分。有个省钱细节非高峰时段调用只消耗标准积分的 50%。高峰时段是工作日 14:00–18:00UTC8其他时间包括周末全天都是半价。ZCode 侧还有两个 buff98% 的缓存命中率重复上下文按缓存价计费以及 8 月 31 日前 1.5 倍限时额度加成叠加缓存优惠最多能到标准额度的 180%。模型 API 官方说近期上线完整权重两周后开放。换句话说8 月底之前 5.3 就会出现在 Hugging Face 上。说句带限定的判断GLM-5.3 是目前编程和 Agent 能力最强的开源模型之一但开源第一要分场景看——CyberGym 确实第一ExploitBench 和 ExploitGym 离闭源前沿还有明显差距编码能力在 High 档位 Token 效率惊人但 Max 档位和 Fable 5 仍有 5 个百分点的差距。选型时别只看一个数字先想清楚自己的任务在能力链的哪一层。我是程序员天天困持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊GLM-5.3 两周后开源你会第一时间拿来跑编程还是测网安

相关新闻

全国查处食品添加剂违法案件超2.3万件:舌尖上的安全,如何

全国查处食品添加剂违法案件超2.3万件:舌尖上的安全,如何

8月15日,市场监管总局发布数据:全国已查处食品添加剂违法案件超2.3万件,罚没金额1.45亿元。下一步,将聚焦奶茶、肉类、熟食、糕点、面食、酒类等重点品类,继续加大整治力度。"食品添加剂"这五个字&#xff0…

2026/8/16 1:59:25 阅读更多 →
AI工程化落地:从前端交互到后端架构的差异化实践指南

AI工程化落地:从前端交互到后端架构的差异化实践指南

1. 项目概述:当AI浪潮撞上前后端开发的现实最近和几个技术团队负责人聊天,发现一个挺有意思的现象:大家嘴上都在谈AI,但真把AI用进自己产品里的,尤其是能稳定产生业务价值的,其实没几个。前端团队可能还在纠…

2026/8/16 1:59:25 阅读更多 →
游戏启动崩溃?深度解析Easy Anti-Cheat原理与系统级修复指南

游戏启动崩溃?深度解析Easy Anti-Cheat原理与系统级修复指南

1. 从一次典型的“启动即崩溃”说起如果你也和我一样,是个喜欢在《JUMP大乱斗》里用路飞痛殴鸣人的玩家,那你大概率也经历过那个让人血压飙升的瞬间:兴冲冲地点开游戏图标,看着虚幻4引擎的启动画面闪过,然后……屏幕一…

2026/8/16 1:58:25 阅读更多 →

最新新闻

Word图表自动编号与交叉引用全攻略:告别手动更新,提升文档效率

Word图表自动编号与交叉引用全攻略:告别手动更新,提升文档效率

1. 项目概述:告别手动,让图表编号“活”起来在撰写包含大量图表的技术报告、学术论文或项目文档时,最让人头疼的莫过于图表的编号管理。你有没有遇到过这样的场景:文档写到一半,需要在中间插入一张新图,结果…

2026/8/16 2:54:49 阅读更多 →
前端开发中npm/yarn常见报错解析与解决方案:EEXIST与路径语法错误

前端开发中npm/yarn常见报错解析与解决方案:EEXIST与路径语法错误

1. 项目概述:一个前端开发者绕不开的“入门坑” 如果你是一名前端开发者,或者正准备踏入这个领域,那么你几乎不可能没遇到过 npm 或 yarn 的报错。标题里提到的这两个错误——“Error:EEXIST: file already exists, mkdir”和“yarn cre…

2026/8/16 2:54:49 阅读更多 →
【脑电6】

【脑电6】

脑电 6 目录 1. 为什么需要非线性分析2. 熵——信号不可预测性的度量3. 复杂度——信号中模式丰富度的量化4. 分形与自相似性5. 去趋势波动分析——长程相关性6. 非线性特征工具箱 1. 为什么需要非线性分析 1.1 脑电不是线性系统 线性系统的典型特征:输入和输出成…

2026/8/16 2:54:49 阅读更多 →
zed 2i相机坐标系与内参、外参

zed 2i相机坐标系与内参、外参

相应内外参如下:相机型号 : ZED 2i 序列号 : 31474187 固件版本 : 相机 1523 / 传感器 778 左相机 Left 内参 分辨率 : 1280 x 720焦距 fx, fy : 536.4066, 536.4066主点 cx, cy : 642.2694, 351.1544内参矩阵 K : [[536.40655518 …

2026/8/16 2:54:49 阅读更多 →
试用期自我总结撰写指南:从STAR-P模型到十大场景实战

试用期自我总结撰写指南:从STAR-P模型到十大场景实战

1. 项目概述:一份报告,十次成长又到试用期尾声,相信很多朋友和我一样,正对着电脑屏幕,为那份“试用期自我总结报告”绞尽脑汁。这玩意儿,说简单也简单,无非是回顾过去、总结现在、展望未来&…

2026/8/16 2:54:49 阅读更多 →
基于LLM与OpenClaw框架的自动化测试报告生成Skill设计与实践

基于LLM与OpenClaw框架的自动化测试报告生成Skill设计与实践

1. 项目概述:为什么我们需要一个“自动写测试报告”的 Skill?在软件开发和测试的日常里,写测试报告这件事,说大不大,说小不小,但绝对是个“脏活累活”。想象一下这个场景:你刚跑完一轮包含上百个…

2026/8/16 2:53:48 阅读更多 →

日新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/16 0:00:54 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/16 0:00:55 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/16 0:03:55 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/16 0:00:54 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/16 0:00:55 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/16 0:03:55 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/14 13:40:53 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/14 14:06:45 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/15 2:35:29 阅读更多 →