Opus 5.5 对 GPT-6 Sol,谁更强?
美国时间 9 月 22 日Anthropic 发布了 Claude Opus 5.5。大约 90 分钟后OpenAI 发布了 GPT-6 Sol 和 GPT-6 Luna。两家打的是同一张牌能力不降价格往下砍。Opus 5.5 比上一代 Opus 5 便宜约 40%Sol 和 Luna 的 API 价格直接比上一代砍了一半。那么这两个模型放在一起到底谁更强先说结论Opus 5.5 能力更强Sol 单价更低但Sol 一定更省钱并不成立。1、定位一个往上够旗舰一个往下铺主力Anthropic 对 Opus 5.5 的说法是大多数工作能达到自家旗舰 Claude Fable 5.1 的水平运行成本比 Opus 5 低约 40%输出速度快 30% 以上。它是 Claude 5.5 系列的第一个模型Sonnet 5.5 和 Haiku 5.5 会在接下来几周跟上。OpenAI 这边本月初发布的 GPT-6 Astra 才是旗舰。Sol 主打复杂编程和 Agent 工作流Luna 负责抽取、摘要、快速问答这类大批量任务。原来夹在中间的 Terra 已经下线。两家的产品线放在一起看定价档OpenAIAnthropic$10 / $50GPT-6 AstraClaude Fable 5.1另有限量开放的 Mythos 5.1$4 / $20无Claude Opus 5.5$2 / $10GPT-6 SolClaude Sonnet 5$0.10 / $0.50GPT-6 Luna无Haiku 5.5 尚未发布价格单位是美元每百万 token斜杠前是输入价后面是输出价。按命名对位媒体普遍把 Sol 看作 Opus 的对手、Luna 看作 Haiku 的对手。但按价格对位Sol 真正的同价竞品是 Claude Sonnet 5两者都是 2 美元和 10 美元。所以这场对比从一开始就不完全对等Opus 5.5 的单价是 Sol 的两倍它要证明的是多花的钱值不值。2、价格单价差两倍每任务成本要看档位先看账面价格。模型输入输出缓存读取Claude Opus 5.5$4$20$0.20GPT-6 Sol$2$10$0.20GPT-6 Luna$0.10$0.50$0.01Sol 的输入和输出单价正好是 Opus 5.5 的一半。缓存读取两家都是 0.20 美元打平。长时间跑的 Agent 会反复读同一段上下文缓存读取往往占了账单的大头。Anthropic 这次把缓存读取从 0.50 美元砍到 0.20 美元降了 60%比砍单价更实在。OpenAI 的价格还有两处细节Batch 和 Flex 模式在此基础上再打五折。单次请求输入超过 27.2 万 token整次请求按长上下文计价输入和缓存价翻倍输出涨 50%。Sol 变成 4 美元和 15 美元Luna 变成 0.20 美元和 0.75 美元。两个模型都号称 105 万 token 上下文但不能拿这个长度直接乘以 2 美元。单价只是一半。另一半是完成一个任务要用掉多少 token。第三方评测机构 Artificial Analysis 在同一套智能指数任务上测了两家的模型。开到最高档max时Opus 5.5 每个任务平均输出约 11.9 万 tokenSol 只有约 3.1 万。![这样算下来max 档的 Opus 5.5 每任务约 6 美元Sol 是 1.06 美元Luna 只要 0.07 美元。单价差两倍每任务成本差到五倍多。但这个差距只在 max 档成立。Opus 5.5 默认用的是中档medium。Anthropic 公布的 FrontierCode 数据里Opus 5.5 中档得分 54.6%每任务约 0.8 美元开到 max成本涨到约 6.19 美元得分反而是 54.4%。再看同一个测试里 OpenAI 公布的 Sol 数据max 档 49.3%每任务 2.14 美元。两家的测试环境不完全一样这组数字只能粗比。但它至少说明在写代码这件事上默认档的 Opus 5.5 分数更高每任务成本也更低。Artificial Analysis 也指出Opus 5.5 的五个推理档里有四个落在智能 vs 成本的最优曲线上。问题在于用户会不会习惯性开到最高档。3、能力官方没正面交手第三方测出了差距看官方跑分之前要先知道一件事两家都没拿对方的新模型比。OpenAI 的图表拿 Sol 比的是 Claude Opus 5因为 Opus 5.5 只比它早发一个半小时。Anthropic 比的是 GPT-6 Astra 和上一代 GPT-5.6 Sol。所以要把两边的数字放在一起得挑能对上的测试还要看清各自用的是哪一档。测试Opus 5.5GPT-6 Sol说明AutomationBench业务流程40.0%每任务 $1.2833.2%每任务 $0.27均为 Zapier 榜单数据FrontierCode 1.1代码可合并54.4%max49.3%max分别来自两家官方OSWorld 2.0电脑操作81.8%60.5%口径不同不能直接比Artificial Analysis 智能指数5848第三方同一套任务AutomationBench 测的是 Agent 用 47 个工具完成销售、运营、财务等真实业务流程。Opus 5.5 高出约 7 个百分点但每任务成本是 Sol 的 4.7 倍左右。OSWorld 的两个数字看着差了 20 多分其实没法比。Anthropic 自己的表里 Opus 5 是 74.0%OpenAI 给 Opus 5 标的是 60.3%同一个模型在两家的测法下就差了十几分。Terminal-Bench 4.0 常被拿来说事。Anthropic 公布 Opus 5.5 拿到 66.4%但那是它的 xhigh 档对比 Astra 的 high 档Astra 的分数还是 OpenAI 自己报的。Artificial Analysis 独立实测Opus 5.5 是 59.6%和 Astra 打平。OpenAI 没公布 Sol 的这项成绩。真正在同一把尺子下量过两家的是 Artificial Analysis 的智能指数。它综合了 10 项评测Opus 5.5 以 58 分排第一是该指数至今的最高分Sol 48 分Luna 37 分。![这张榜上 Opus 5.5 那一项标注了带 fallback意思是被安全分类器拦下的任务交给其他模型完成。Sol 的问题在于它比上一代进步不大。Artificial Analysis 的数据里Sol 只比 GPT-5.6 Sol 高 1 分Luna 反而比上一代低 1 分。在 GDPval-AA 知识工作测试上Sol 退步了约 100 分Luna 退步约 75 分主要原因是交付物变短、常常漏掉必需的内容。OpenAI 自己的数据也显示Sol 在 DeepSWE 上 max 档拿到 68.8%比上一代 GPT-5.6 Sol 的 72.7% 还低Opus 5 是 73.7%。Sol 的卖点是用更低的成本接近这些分数而不是超过它们。科技媒体 The Decoder 还批评 OpenAI 的跑分挑着报GDPval、Terminal-Bench 这类常规项目都没出现在发布页里。不过 Artificial Analysis 也被质疑过。它此前因为测试集过时把 Astra 评得偏低更新两次之后 Astra 才回到榜首。只论能力Opus 5.5 明显领先Sol 的看点在于用上一代旗舰的分数收一半的价钱。4、上手编程差距最明显写作各有偏好Anthropic 给了不少客户案例。这些是厂商挑出来的适合当参考有测试者用 Opus 5.5 在一天内完成了 68 万行代码的迁移官方说这原本需要一个工程团队干好几周。审计并修复一个 20 万行的代码库Opus 5.5 不到 3 小时Opus 5 用了 20 多个小时token 用量是前者的 2.5 倍。内部把 HAProxy 从 C 改写成 RustOpus 5.5 和 Fable 5.1 都几乎通过了全部回归测试。Opus 5.5 用了 9.5 小时Fable 5.1 用了 12 小时Opus 5.5 的成本低 51%。据 Marktechpost 报道德勤说 Opus 5.5 在最低档就找出了 72% 的已知代码审查问题Opus 5 开到高档才找出 56%。发布当晚科技媒体 Every 的团队做了一场直播把 Opus 5.5 和 Sol 放在一起试。以下是个人体验不是系统评测。工程师 Kieran Klaassen 此前很不喜欢 Opus 5日常主力一直是 Fable 5.1。现在他改用 Opus 5.5。在他自己的 Ruby 性能优化难题上Opus 5.5 中档的结果超过了 Sol、Fable 和 Astra。他还说 Opus 5.5 能稳定遵循他们团队的工程规范而 Sol 需要反复重跑。另一位成员 Mike Taylor 之前因为 Claude 的一些毛病转去用了 OpenAI 的 Codex这次给 Opus 5.5 打了接近满分只在长任务的时间把控上扣了分。但写作上的结论正好反过来。Every 创始人 Dan Shipper 用团队日常编辑工作做成个人测试集排名是 Astra 第一、Sol 第二Opus 5.5 紧随其后。他觉得 Opus 5.5 很聪明但答案偏长重点出来得晚Astra 和 Sol 写得更直接。他也提醒观众他用的是 Opus 的 high 档评价要打个折扣。两家这次都在改文风。Anthropic 说 Opus 5.5 改掉了用户吐槽的Claude 腔重点放前面也更能遵守你给的写作规则。OpenAI 也把 Astra 的沟通风格带到了 Sol 和 Luna 上少行话、少废话回答整体更短。写代码和长任务早期体验更偏向 Opus 5.5要短平快的文字Sol 更合适。5、安全与限制护栏会直接影响你用到的是哪个模型OpenAI 这次把事实准确度当成主要卖点。在一批用户标记过错误的真实对话上Sol 的事实错误比上一代少了约一半接近 Astra。Artificial Analysis 的幻觉测试也显示Sol 的幻觉率从 92% 降到 60%Luna 从 93% 降到 77%。代价是 Sol 更常拒答准确率降了 5 个点到 54%。OpenAI 还公布了几项对抗性测试的结果。这些测试是故意设计来诱导坏行为的而且没有开系统级防护编程欺骗率Sol 从上一代的 10.4% 降到 1.3%Luna 从 9.5% 降到 2.8%。遇到access denied这类明确禁止时Sol 仍有 64.4% 的情况会设法绕过上一代是 68.2%几乎没改善。Luna 从 76.5% 降到 42.4%。Anthropic 这边Opus 5.5 是 CEO Dario Amodei 呼吁控制前沿发展节奏之后发布的第一个模型发布前请 METR 等外部机构做了测试。它在一套覆盖近 2000 个场景的自动化行为审计上拿到了历来最好的成绩。在一项新测试中它试图越过边界的次数比 Opus 5 少了约 85%。Anthropic 也承认了一个局限Opus 5.5 经常察觉到自己正在被测试这让评估结果能在多大程度上代表真实使用打了问号。对用户影响最大的是改派机制。Opus 5.5 的网络安全能力很强所以大部分网络安全任务会被转给更老的 Opus 4.8日常找 bug、修 bug 不受影响。被分类器标记的生物和前沿大模型开发任务会转给 Opus 5。也就是说在这些场景里你实际用到的不是 Opus 5.5。做安全研究或生物研究的机构可以申请 Anthropic 的验证计划解除限制。另外两点变化需要开发者注意防蒸馏的preserved thinking这次也加到了 Opus 5.5 上禁止 API 用户改写之前的上下文来套取推理内容只对 2026 年 8 月 31 日之后创建的 API 账号生效。Opus 5.5 不能再关闭 thinking 模式API 还有一些不兼容的改动迁移前要先测。OpenAI 这边也有摩擦。Shipper 在直播里提到Codex 的安全分类器会拦住 Sol 的自主操作长任务频繁被打断。6、结论能力选 Opus 5.5规模选 Sol回到标题的问题只论能力Opus 5.5 更强。第三方智能指数高出 10 分编程和知识工作测试基本都领先。但谁更强不等于该用谁。选 Opus 5.5 的情况代码迁移、大型代码库审计、复杂研究报告这类长任务返工一次的代价远高于 token 钱。用默认中档就够别习惯性开到 max那是成本暴涨、分数几乎不涨的一档。选 GPT-6 Sol 的情况业务流程自动化、需要快速验收的批量任务、要求简短直接的写作。在 AutomationBench 上Sol 用不到 Opus 5.5 四分之一的钱拿到了它八成多的分数。选 GPT-6 Luna 的情况抽取、摘要、快速问答。每任务成本只有几美分比 Sol 低一个数量级。还有一个容易漏掉的选项。如果你看中的是 Sol 的价格Anthropic 同价位的是 Sonnet 5Sonnet 5.5 也会在几周内发布值得一起放进测试。这次两家同一天发布官方都在反复讲每个任务花多少钱而不只是跑分更高。对企业来说最好的办法是拿自己的真实任务把两个模型都跑一遍记下一次通过率、返工时间和最终花费。](https://i-blog.csdnimg.cn/direct/4e610b54a5fa43cd823a80a0b439e0a4.png)

相关新闻

RuboCop 0.35.0:团队配置终于能发 gem 了,升级前必看的 3 个边界

RuboCop 0.35.0:团队配置终于能发 gem 了,升级前必看的 3 个边界

RuboCop 0.35.0:团队配置终于能发 gem 了,升级前必看的 3 个边界 【免费下载链接】rubocop A Ruby static code analyzer and formatter, based on the community Ruby style guide. 项目地址: https://gitcode.com/GitHub_Trending/rub/rubocop …

2026/9/24 16:59:10 阅读更多 →
基于 Java Spring Boot 的中学课外兴趣小组管理系统设计与实现

基于 Java Spring Boot 的中学课外兴趣小组管理系统设计与实现

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 1. 项目背景与意义 随着素质教育的深入推进,中学课外兴趣小组活动日益丰富,涵盖科技、艺术、体育、文学等多个方向。然而,传统的人工…

2026/9/24 16:58:09 阅读更多 →
Numba 浮点语义指南:精度差异、线性代数类型行为与 ufunc 错误处理

Numba 浮点语义指南:精度差异、线性代数类型行为与 ufunc 错误处理

编译器高性能计算 【免费下载链接】numba NumPy aware dynamic Python compiler using LLVM 项目地址: https://gitcode.com/gh_mirrors/nu/numba 点击查看 免费下载 本指南以 Numba 官方参考文档 浮点陷阱(Floating-point pitfalls) 为骨架…

2026/9/24 16:58:09 阅读更多 →

最新新闻

PHP数据建模的术语大全的庖丁解牛

PHP数据建模的术语大全的庖丁解牛

总纲 PHP的数据建模,本质就是面向对象思想落地到业务数据:把业务里的实体(用户、订单、商品)抽象成模型,打通PHP代码和MySQL数据库。和Java的OOP建模同源,但PHP有自身特点:常用Laravel/ThinkPHP…

2026/9/24 17:48:44 阅读更多 →
【Dify】思维导图生成应用

【Dify】思维导图生成应用

自动化思维导图工具已成为内容整理与知识可视化的重要助手。围绕文本到导图的全流程自动化,简化信息梳理与展示流程,提升表达效率。 本文聚焦于Dify平台下自动生成思维导图的实际流程、核心技术组件及典型应用场景,介绍关键节点功能和操作步骤,助力高效知识结构化。 文章目…

2026/9/24 17:48:44 阅读更多 →
汽车电子瞬变脉冲干扰测试全解析:从ISO 7637标准到TPI-7637系列模拟器实战

汽车电子瞬变脉冲干扰测试全解析:从ISO 7637标准到TPI-7637系列模拟器实战

一、为什么汽车电子必须做瞬传脉冲测试现代汽车上装载的 ECU(电子控制单元)数量动辄上百个,从发动机管理、ABS、车身控制到智驾域控制器,都工作在同一个 12V / 24V / 48V 电气环境中。这套环境并不"干净":继…

2026/9/24 17:48:44 阅读更多 →
【有源码】基于Python的医疗问答数据特征提取与问答趋势可视化分析系统-面向在线医疗社区的疾病问答分布规律与回答质量评价研究

【有源码】基于Python的医疗问答数据特征提取与问答趋势可视化分析系统-面向在线医疗社区的疾病问答分布规律与回答质量评价研究

注意:该项目只展示部分功能,如需了解,文末咨询即可。 本文目录1 开发环境2 系统设计3 系统展示3.1 大屏页面3.2 分析页面3.3 基础页面4 更多推荐5 部分功能代码1 开发环境 发语言:python 采用技术:Spark、Hadoop、Dja…

2026/9/24 17:48:44 阅读更多 →
Python 项目应用:Flask 框架 新手入门与实战

Python 项目应用:Flask 框架 新手入门与实战

摘要:本文手把手带你从零搭建 Flask 开发环境,依次掌握路由、模板、表单、数据库、模块化与调试技巧,最终完成生产部署上线。Flask 轻量灵活、生态成熟、上手门槛低,适合快速构建原型并平滑过渡到生产级应用。无论你是零基础新手,还是想系统梳理后端开发流程,都能从中获得…

2026/9/24 17:48:44 阅读更多 →
剪辑气口视频节奏太拖沓?2026剪气口工作流,5款工具怎么选

剪辑气口视频节奏太拖沓?2026剪气口工作流,5款工具怎么选

剪辑气口视频时,手动找停顿、删空白往往占据口播后期大半时间。鲸剪(WhaleClip)是一款面向短视频创作者与团队的 AI 桌面剪辑工具,支持 Windows 与 macOS,其剪辑气口功能可基于音频波形与字幕时间轴自动识别并裁剪冗余…

2026/9/24 17:47:43 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →