GPT‑5.6 Sol分数暴涨3倍:不是模型变强,是测试框架不再“失忆”
文章目录前言1 先把三个分数掰扯清楚1.1 13.3%和38.3%是同一张卷子的两种答法1.2 7.78%是另一个赛道的成绩2 ARC这题为啥这么吃“记性”2.1 这不是选择题是闯关探案2.2 状态断了等于从头再来3 官方测试框架的“两层失忆”3.1 第一层干完就忘“为什么干”3.2 第二层历史太长直接删前面4 两个“开关”到底解决了啥问题4.1 retained reasoning把思路续上4.2 compaction把历史打包压缩5 Token少六倍为啥分数还能涨5.1 评分公式里根本没Token这一项5.2 真正的逻辑是少做无用功6 别忙着给两个功能分功劳6.1 现在只有两头的数据6.2 俩功能本身也不是完全独立的7 怎么测才算真的靠谱7.1 至少得做四组实验7.2 所有变量都得锁死8 评测得分得两条腿走路8.1 官方榜要的是公平8.2 生产场景要的是上限9 Agent评测得签“运行合同”9.1 模型名只是其中一项9.2 最终比的是系统前沿P.S. 无意间发现了一个巨牛的人工智能教程非常通俗易懂对AI感兴趣的朋友强烈推荐去看看传送门https://blog.csdn.net/qq_34419312前言最近AI圈又出了个能上热搜的料。同一个GPT-5.6 Sol跑同一个ARC-AGI-3公开测试集分数直接从13.3%冲到38.3%翻了快三倍。不少人截图转发OpenAI又偷偷憋大招了模型能力三倍跃升想多了。模型本身半毛钱没改变的是跑模型的“姿势”。说白了就是以前的测试框架一直在给模型喂健忘药现在把药停了模型终于能正常干活了。1 先把三个分数掰扯清楚1.1 13.3%和38.3%是同一张卷子的两种答法这俩数都是在Public公开数据集上跑的。一个用ARC官方的测试框架一个用OpenAI自己基于Responses API写的框架。相当于同一张卷子一个要求写完一页就把草稿纸扔了一个允许保留草稿接着写。最终差出来的25个百分点是框架的差距不是模型本身的飞跃。1.2 7.78%是另一个赛道的成绩还有个7.78%的数很多人会拿来凑增长曲线。别凑。这是ARC官方半私密验证集的成绩跟公开集根本不是一套题。就好比你平时模考60分正式高考50分你不能说你从模考60分涨到了在家刷题90分三者根本不是一个口径。公开集和半私密集难度、判分逻辑都有区别硬拉一条增长线纯纯是耍流氓。2 ARC这题为啥这么吃“记性”2.1 这不是选择题是闯关探案ARC-AGI-3不是那种看完题直接选答案的考试。它是给你一个没说明书的二维小游戏你得一步步试摸规则找规律然后通关。就像玩密室逃脱得挨个道具试记下来哪个有用哪个没用最后拼出解法。这里面最值钱的不是你点了哪一下是你为啥点这一下、验证了啥、排除了啥。2.2 状态断了等于从头再来要是每走一步就把你刚才的思路全清空。下一步你就得对着历史记录重新想我刚才为啥走这步我要验证啥来着走一步忘一步那效率能高就怪了。官方有个对比很直观同样花了差不多的Token官方框架还在第一关晃悠优化后的框架已经闯到第五关了。差距不是最后一秒拉开的是每一步都在越拉越大。3 官方测试框架的“两层失忆”3.1 第一层干完就忘“为什么干”官方框架每执行一步环境操作就把模型的内部推理过程全扔了。模型下一轮只看得见“我刚才点了坐标(46,4)”但忘了“我点这是为了测蓝色区域是不是传送门”。相当于你上班做项目每次开完会都把会议记录和思路草稿全删了。下次开会先花半小时复盘我上次干到哪了我为啥要这么干一天下来光复盘了正经活没干多少。3.2 第二层历史太长直接删前面不光丢推理历史记录长了也删。字符数超过17.5万最前面的消息直接滚动删掉。到这一步就更狠了连“我早期做过什么实验”都忘了。两层失忆叠在一起模型就会反复踩同一个坑重复验证已经被否定的假设纯纯做无用功。4 两个“开关”到底解决了啥问题4.1 retained reasoning把思路续上第一个东西叫retained reasoning保留推理状态。很多人一听“保留推理”以为能偷看模型的内心OS。想多了。原始思维链是加密的开发者拿不到明文。就像你去存包给你个取件码你能拿码取东西但你看不见柜子里别人放了啥。它本质就是系统内部帮你存档下一轮接着上一段思路继续往下走。4.2 compaction把历史打包压缩光续思路还不够历史一直涨上下文总有装不下的一天。第二个东西compaction就是干这个的快到上下文上限的时候把之前的状态和推理压缩成更短的内容。相当于你把几十页的会议记录整理成一页核心要点信息还在占的地方小多了。当然这不是无损压缩官方也没说能百分百还原所有细节核心状态能保住就够了。5 Token少六倍为啥分数还能涨5.1 评分公式里根本没Token这一项很多人会觉得Token少了省下来的空间用来思考所以分高了。没这么直接。ARC用的RHAE评分只看你闯到第几关、用了多少步有效操作。你内部推理写再多字只要没改变游戏状态都不算数。Token多少跟分数没有直接的因果关系。5.2 真正的逻辑是少做无用功那为啥Token少了分还涨了因为状态连续了不用反复重新定向、重复踩坑了。无效的思考少了无效的操作也少了省下来的预算就能用来闯更多关。而且这个评分是平方计算的你操作数比人类多一倍得分就只剩四分之一效率影响被放得很大。但具体这25个百分点里有多少是这个原因贡献的现在还说不准。6 别忙着给两个功能分功劳6.1 现在只有两头的数据现在公开的结果就两个端点全关13.3%全开38.3%。中间只开一个的效果怎么样没人知道。既没有只开retained reasoning的数据也没有只开compaction的数据。就像你感冒了既吃了药又喝了热水病好了你能说清是药管用还是热水管用吗6.2 俩功能本身也不是完全独立的更麻烦的是这俩功能还不是完全正交的。compaction压缩的内容里本身就可能带着之前的推理状态。你以为你关了推理保留只要压缩功能还在说不定状态就偷偷跟着过去了。所以现在网上很多人给俩功能算贡献比例基本都是瞎猜当八卦听就行。7 怎么测才算真的靠谱7.1 至少得做四组实验真想把这事掰扯明白至少得设四个实验组。第一组纯基线就用官方框架啥都不开当参照物。第二组只保留推理不压缩看看在上下文装得下的范围内光续思路能涨多少分。第三组不用原生压缩自己做结构化的状态记录看看显式存关键信息比直接删强多少。第四组两个全开就是现在的最优结果。这样测出来谁贡献多少才说得清。7.2 所有变量都得锁死做实验最忌讳变量不统一。模型版本、推理强度、提示词、游戏版本、评分规则、动作预算、Token上限但凡有一个没固定结果就没法比。很多人测出来的“提升”扒开一看要么提示词改了要么预算放宽了纯纯作弊。测Agent不比测选择题变量多了去了漏一个结论就站不住脚。8 评测得分得两条腿走路8.1 官方榜要的是公平ARC官方其实说得很明白官方排行榜不用专门优化的测试框架。为啥因为官方榜要比的是模型本身的通用能力大家用统一的接口、统一的规则才好比。要是允许各家自己写框架、加状态、做优化那就变成比谁的工程能力强、谁的API私货多了。那就失去模型对比的意义了。8.2 生产场景要的是上限但反过来做产品的人肯定关心最优表现。我用你们家推荐的API、最佳实践到底能做到多好这就是生产对齐的评测测的是落地的上限。两种评测回答的根本不是一个问题没必要非得分个高低。以后看评测先搞清楚它是测公平性的还是测上限的再看分数才有意义。9 Agent评测得签“运行合同”9.1 模型名只是其中一项以前大家报成绩就说“某某模型在某某基准上得了多少分”。放到Agent时代这远远不够。模型、API、提示词、状态策略、上下文处理、环境版本、预算、运行证据八类信息一个都不能少。就像你说你跑马拉松破三得说清在哪跑的、什么天气、用的什么鞋、有没有人带跑不然成绩不算数。9.2 最终比的是系统前沿以后Agent评测比的就不是一个孤立的分数了。是一整条前沿线质量怎么样、花多少Token、延迟多高、成本多少、能不能复现、能不能审计。不同的运行合同对应不同的结果。只甩一个分数出来不说清楚怎么跑的要么是不懂行要么是故意耍流氓。说白了这次三倍分数的事给整个行业提了个醒。Agent时代模型能力只是下限运行系统才决定上限。以后再看到某某模型跑分暴涨的新闻先别急着喊“又进化了”。先问问你这是怎么跑的P.S. 无意间发现了一个巨牛的人工智能教程非常通俗易懂对AI感兴趣的朋友强烈推荐去看看传送门https://blog.csdn.net/qq_34419312

相关新闻

win10搭建hive3开发环境实录

win10搭建hive3开发环境实录

环境准备 需要组件: 组件版本说明JDK8暂时不要选用大于等于JDK9的版本,因为启动虚拟机会发生未知异常MySQL8.x用于管理Hive的元数据Apache Hadoop3.3.0Apache Hive3.1.2Apache Hive src1.2.2因为只有1.x版本的Hive源码提供了.bat启动脚本,有…

2026/8/9 6:58:14 阅读更多 →
基于Claude Code与Docker的Linux环境自动化部署实战

基于Claude Code与Docker的Linux环境自动化部署实战

1. 项目概述:为什么需要全程自动化部署?最近在折腾一个新项目,需要快速搭建一套包含Web服务、数据库和缓存的基础Linux环境。手动操作?太慢了,而且容易出错,换个服务器还得重来一遍。于是,我决定…

2026/8/9 6:58:14 阅读更多 →
电商AI智能体能力评测:MerchantBench基准测试实战指南

电商AI智能体能力评测:MerchantBench基准测试实战指南

如果你正在开发或评估一个电商领域的AI智能体,特别是那种需要处理多轮对话、复杂决策和长流程任务的“长程智能体”,那么你很可能正面临一个核心难题:如何科学、全面地衡量它的真实能力?传统的智能体评测基准,往往聚焦…

2026/8/9 6:57:13 阅读更多 →

最新新闻

应对API涨价:大模型本地部署可行性、硬件成本与迁移实践指南

应对API涨价:大模型本地部署可行性、硬件成本与迁移实践指南

DeepSeek 计划大幅上调 API 价格,这可能是近期国内 AI 开发者圈子里最值得关注的消息之一。对于大量依赖其 API 进行应用开发、测试和产品集成的团队来说,这直接关系到成本结构和技术选型。本文不讨论市场策略,而是聚焦于一个核心问题&#x…

2026/8/9 8:04:43 阅读更多 →
TencentOS Server 4部署Coze Studio:AI应用本地化私有环境搭建指南

TencentOS Server 4部署Coze Studio:AI应用本地化私有环境搭建指南

1. 项目概述与核心价值最近在折腾AI应用本地化部署,发现Coze Studio这个平台挺有意思,它能让开发者快速搭建和调试AI工作流。正好手头有一台跑着TencentOS Server 4的服务器,就想着能不能在上面把Coze Studio给部署起来,搞一个私有…

2026/8/9 8:04:43 阅读更多 →
学生作业项目解析与实用工具推荐

学生作业项目解析与实用工具推荐

1. 项目背景解析 "作业4-巫浩源"这个标题看似简单,实际上包含了典型的学生作业项目特征。作为教育工作者,我见过无数类似命名的作业项目,这种命名方式通常意味着这是某门课程的第四次作业提交,而"巫浩源"显然…

2026/8/9 8:04:43 阅读更多 →
C#桌面应用自动更新方案设计与实现

C#桌面应用自动更新方案设计与实现

1. 为什么需要AutoUpdater自动更新类 在C#桌面应用开发中,自动更新功能几乎是现代软件的标配需求。想象一下:你开发了一个企业级工具软件,部署在客户现场的50台电脑上。某天发现了一个严重bug需要紧急修复,难道要挨个电脑重新安装…

2026/8/9 8:04:43 阅读更多 →
避免自动化误区:如何构建高ROI的业务自动化方案

避免自动化误区:如何构建高ROI的业务自动化方案

1. 项目概述"不要为了自动化而自动化"这个标题直指当前技术领域的一个普遍误区——盲目追求自动化而忽视实际需求。作为一名经历过数十个自动化项目的老兵,我见过太多团队在自动化浪潮中迷失方向,投入大量资源开发华而不实的自动化系统&#x…

2026/8/9 8:04:43 阅读更多 →
解决Firefox配置文件版本不兼容的6种方法

解决Firefox配置文件版本不兼容的6种方法

1. 问题现象与背景解析 当你在Windows或macOS系统上启动Firefox浏览器时,突然弹出一个红色警告框,显示"This profile was last used with a newer version of this application. Please create a new profile or use a different version of this a…

2026/8/9 8:03:42 阅读更多 →

日新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/8 17:02:44 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/9 0:45:04 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/8 17:02:44 阅读更多 →