OpenAI公布秘术:两个设置,GPT-5.6 Sol ARC-AGI-3成绩暴涨三倍!
在官方测试框架下GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的得分只有 13.3%但换用与 ChatGPT、Codex 更接近的运行方式后得分直接提升至 38.3%约提升 3 倍。今天对技术细节一直讳莫如深的 OpenAI终于 OpenAI 了一把。按照 Sam Altman 的说法他们是公布了一篇goblin-level 的 blog。他们只改变了两个设置就能让模型在 ARC-AGI-3 的得分提升 3 倍链接https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/在官方测试框架下GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的得分只有 13.3%但换用与 ChatGPT、Codex 更接近的运行方式后得分直接提升至 38.3%约提升 3 倍。在此期间模型本身并没有发生变化只是改变了两个设置。OpenAI 发现长期运行的 Agent 如果无法保留自己的推理过程也无法有效压缩历史上下文就很难基于过去经验持续学习。这也带来了一个新的问题当 AI Agent 开始执行越来越长、越来越复杂的任务时我们评测的究竟是模型本身还是模型所处的运行环境以下是博客内容。一段加速播放的视频展示了 GPT-5.6 Sol 尝试解决 ARC-AGI-3 基准测试中谜题的过程。左侧为官方测试框架official harness右侧为 Responses API 测试框架该框架能够保留推理过程并支持上下文压缩。在该游戏的排行榜上目前没有任何前沿模型能够通过第一关之后的关卡。而在 Responses API 测试框架下GPT-5.6 Sol 成功解决了全部六个关卡。ARC-AGI-3测试 AI 如何学习陌生游戏ARC-AGI-3 是一个用于评估 AI Agent 学习和推理能力的基准测试。与传统问答任务不同ARC-AGI-3 不会直接告诉模型游戏规则而是让 Agent 自己探索陌生的二维游戏环境通过观察结果和不断尝试逐渐理解游戏机制。因此它测试的并非单次回答能力而是 AI 在长期交互过程中的学习能力。ARC-AGI-3 采用了一个较为通用的测试框架不包含额外工具或针对特定模型的优化。ARC 团队认为这样可以更公平地比较不同模型同时暴露模型在推理和学习上的不足。但 OpenAI 在分析 GPT-5.6 Sol 的测试过程时发现通用测试框架中的一些设计可能影响了模型发挥。GPT-5.6 Sol 为什么表现不佳最初GPT-5.6 Sol 在 ARC-AGI-3 上的表现让 OpenAI 感到困惑。此前GPT-5.6 Sol 已经解决了一些长期存在的数学开放问题也能够完成《宝可梦 火红》《杀戮尖塔》等复杂游戏任务。但在 ARC-AGI-3 中它的表现却明显下降。OpenAI 检查模型运行过程后发现问题并不完全来自模型能力而是测试框架限制了 Agent 的长期记忆。第一个问题推理过程被丢弃。GPT-5.6 Sol 在执行每一次游戏操作后之前产生的私有推理过程都会被删除。这意味着每执行一个新动作模型都需要重新理解当前游戏状态。虽然它还能看到过去执行过的操作记录和简单说明但无法访问此前形成的计划、规律判断以及行动背后的思考过程。第二个问题历史上下文被截断。ARC-AGI-3 测试框架采用滚动截断机制。当上下文超过限制后最早的消息会被删除。因此随着游戏持续进行GPT-5.6 Sol 不仅无法记住过去的思考也会逐渐失去对早期行动和观察结果的记忆。OpenAI 认为这两个因素共同导致模型难以在长时间任务中积累经验。它就像一个玩家每走一步都需要重新理解游戏规则同时还会忘记自己之前尝试过什么。两个设置得分提高 3 倍为了解决这一问题OpenAI 使用了与 ChatGPT 和 Codex 更接近的运行方式重新实现了 ARC-AGI-3 测试框架。其中关键是两个 API 设置保留推理过程retained reasoningOpenAI 的模型在生成回答或调用工具之前会产生内部推理过程。在 ChatGPT 和 Codex 中这些推理信息会作为上下文的一部分保留下来。开启该设置后GPT-5.6 Sol 不需要每一步都重新分析游戏而是可以利用过去形成的理解继续行动。OpenAI 观察发现保留推理后模型每次行动前需要的思考时间减少同时能够基于过去经验形成更加连贯的策略。上下文压缩compaction此前 ARC-AGI-3 使用滚动截断方式解决上下文长度问题即直接删除最早的信息。但这种方式会导致模型丢失关键历史。上下文压缩则会对已有信息进行整理在限制上下文规模的同时保留重要内容。启用上下文压缩后GPT-5.6 Sol 能够在更长时间运行中保持对游戏规律的理解并减少输出 token。如图所示在长时间任务中GPT-5.6 Sol 会将此前累积的推理过程压缩为摘要并继续基于压缩后的上下文进行推理从而避免随着任务增长丢失早期信息。中间列展示了两种测试框架对模型上下文窗口使用方式的差异。由于更改设置后能够更好地记住过去的信息它在每次行动时所需的思考更少执行速度也明显更快。最终在两个设置共同作用下GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的成绩从 13.3% 提升至 38.3%约提升 3 倍。与此同时模型输出 token 消耗降低了约 6 倍。写在最后OpenAI 表示这次实验希望提醒开发者基准测试很少只测量模型本身。它们同时也受到 API 设置、测试框架设计以及提示词方式的影响。对于希望最大化模型性能的 API 开发者OpenAI 建议采用与自身产品一致的配置对于模型之间的比较OpenAI 也建议参考采用这些设置的评测结果因为它们更接近 ChatGPT 和 Codex 中的真实使用环境。ARC-AGI-3 为了保证评测公平采用了一个统一、简化的测试框架但这个框架没有考虑到 Agent 产品中的一些关键能力如推理保留、上下文压缩导致模型表现被低估。这么说来未来衡量模型能力可能还需要一个更接近使用场景的评测体系。

相关新闻

ChatGPT突发封杀令!全球AI写手一夜断粮

ChatGPT突发封杀令!全球AI写手一夜断粮

如今,这场争议已经动摇了用户对AI写作的基本预期。模型未必越写越好,提示词也不再长期有效。AI写作的黄金时代,正在崩塌!进入,模型一代比一代强,文章却一篇比一篇烂。它知道什么时候列出几条建议&#xff0…

2026/7/31 16:57:34 阅读更多 →
GitHub Desktop终极中文汉化指南:3分钟快速实现界面本地化

GitHub Desktop终极中文汉化指南:3分钟快速实现界面本地化

GitHub Desktop终极中文汉化指南:3分钟快速实现界面本地化 【免费下载链接】GitHubDesktop2Chinese GithubDesktop语言本地化(汉化)工具 【GitHub桌面客户端中文汉化】 项目地址: https://gitcode.com/gh_mirrors/gi/GitHubDesktop2Chinese GitHubDesktop2Ch…

2026/7/31 16:57:34 阅读更多 →
为什么你的飞书AI效率分析总“失真”?5分钟定位4类埋点失效场景(含SDK日志解析模板)

为什么你的飞书AI效率分析总“失真”?5分钟定位4类埋点失效场景(含SDK日志解析模板)

更多请点击: https://kaifayun.com 第一章:为什么你的飞书AI效率分析总“失真”? 飞书AI效率分析看似智能,却常给出与团队实际体验相悖的结论——例如标记某成员“响应迟缓”,而其日均处理消息量超200条;或…

2026/7/31 16:56:34 阅读更多 →

最新新闻

足迹交易三大核心原则:订单块识别、不平衡交易与吸收现象分析

足迹交易三大核心原则:订单块识别、不平衡交易与吸收现象分析

在金融市场交易中,你是否曾经遇到过这样的困境:明明看对了方向,却总是买在高点、卖在低点?或者面对复杂的K线图,不知道如何判断真正的支撑和阻力位?传统的技术分析方法往往滞后于市场,而基于订单…

2026/7/31 18:16:13 阅读更多 →
AIGC率控制工具评测与内容可信度提升指南

AIGC率控制工具评测与内容可信度提升指南

1. 为什么我们需要关注AIGC率控制?在2026年的数字内容生产环境中,AI生成内容(AIGC)已经渗透到写作、设计、编程等各个领域。作为一名长期跟踪AI工具发展的技术博主,我发现一个关键问题正在浮出水面:不加控制…

2026/7/31 18:16:13 阅读更多 →
Advent of Code Kotlin Template项目结构全解析:轻松掌握文件组织与工作流

Advent of Code Kotlin Template项目结构全解析:轻松掌握文件组织与工作流

Advent of Code Kotlin Template项目结构全解析:轻松掌握文件组织与工作流 【免费下载链接】advent-of-code-kotlin-template The Advent of Code template project for Kotlin 项目地址: https://gitcode.com/gh_mirrors/ad/advent-of-code-kotlin-template …

2026/7/31 18:16:13 阅读更多 →
【单片机课设毕设项目】基于 STM32 的自习室 IC 卡权限管理及席位提示系统 单片机驱动的图书馆红外座位感应与自动门禁设计(015501)

【单片机课设毕设项目】基于 STM32 的自习室 IC 卡权限管理及席位提示系统 单片机驱动的图书馆红外座位感应与自动门禁设计(015501)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

2026/7/31 18:16:13 阅读更多 →
布列韦肽Hepcludex作用机制:靶向NTCP受体,从源头阻断HBV/HDV肝细胞入侵路径

布列韦肽Hepcludex作用机制:靶向NTCP受体,从源头阻断HBV/HDV肝细胞入侵路径

传统乙肝抗病毒药物以抑制病毒逆转录、核酸合成为主要作用靶点,仅能控制乙肝病毒复制,无法作用于依附乙肝存活的丁肝病毒,这也是既往丁肝治疗收效甚微的核心原因,布列韦肽 Hepcludex 采用全新的病毒入胞抑制机制,作用靶…

2026/7/31 18:15:13 阅读更多 →
用好AiPy Pro(爱派),大幅提升工作效率——我的数据分析工具制作深度使用经验分享

用好AiPy Pro(爱派),大幅提升工作效率——我的数据分析工具制作深度使用经验分享

官方名称:AiPy Pro|中文名:爱派|开发商:知道创宇 一、它到底是什么? AiPy Pro是一款融合大语言模型与Python能力的AI智能体平台,主打本地部署、代码生成、任务自动化。简单来说,它…

2026/7/31 18:15:13 阅读更多 →

日新闻

物理复制比逻辑复制好在哪?数据库复制原理详解

物理复制比逻辑复制好在哪?数据库复制原理详解

数据库复制是把主库数据同步到备库的机制,分为逻辑复制和物理复制两种。逻辑复制传输的是 SQL 语句或行变更事件,物理复制传输的是存储引擎底层的物理日志。阿里云 PolarDB(云原生数据库)采用物理复制,在同步延迟、数据…

2026/7/31 0:00:34 阅读更多 →
BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南 【免费下载链接】BilibiliDown (GUI-多平台支持) B站 哔哩哔哩 视频下载器。支持稍后再看、收藏夹、UP主视频批量下载|Bilibili Video Downloader 😳 项目地址: https://gitcode.com/gh_mirrors/bi/Bilib…

2026/7/31 0:00:34 阅读更多 →
有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

当前,游戏行业的“DataAI融合”已从概念验证进入价值落地阶段。根据IDC 2025年数据,中国AI游戏云市场规模已达18.6亿元;同时,游戏研发环节AI渗透率高达86%,生成式AI内容普及率超过50%。面对庞大的市场,游戏…

2026/7/31 0:00:34 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/31 1:03:03 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/31 4:19:39 阅读更多 →

月新闻