Opus 4.8 级性能满天飞,Ornith-1.5 的榜单水分谁挤过?
Opus 4.8 级性能满天飞Ornith-1.5 的榜单水分谁挤过【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF2026 年 8 月DeepReinforce 发布 Ornith-1.5 系列官方口径一度让开源社区沸腾最大 397B 规模的 MoE 模型部分性能超过 Claude Opus 4.835B-A3B 型号仅激活约 3B 参数却在 SWE-bench Verified 上拿到 79 分把 397B 的 Qwen3.5 都甩在身后量化版甚至号称能跑进 iPhone 17。头条号标题一个比一个猛Opus 4.8 级性能叫板 DeepSeek V4。但另一篇被广泛传播的文章标题却冷静得多——《Ornith-1.5 叫板 DeepSeek V4但仔细看分数事情没那么简单》。自我进化自己出题自己练——这套训练叙事天然自带光环也天然自带争议。本文不打算站队吹捧或唱衰而是把官方评测脚注、社区实测数据与模型卡里的细节逐一摊开榜单分数是怎么测出来的自我改进训练算不算刷分到了真实工程场景分数还撑得住吗榜单分数的测试条件与口径脚注比分数更值得读先看官方给出的数字。以 README.md 中的基准表为准Ornith-1.5-35B-A3B 的关键成绩如下基准Ornith-1.5-35B-A3BOrnith-1.0-35B-A3BQwen3.6-35B-A3BQwen3.5-397BTerminal-Bench 2.1 (Terminus-2)67.864.252.553.5SWE-bench Verified7975.673.476.4SWE-bench Pro59.650.449.551.6SWE-bench Multilingual71.469.367.269.3GPQA Diamond89.286.28688.4HLE (no tools)25.620.821.428.7MCP-Atlas70.264.462.872.3WideSearch67.863.460.174单看这张表35B 级 MoE 追平乃至部分反超 397B 旗舰确实震撼。但分数的可信度不取决于数字本身而取决于测量条件。README 的脚注恰恰是全文信息密度最高的部分所有 Ornith-1.5 的成绩是 5 次独立运行的平均值且统一采用temperature1.0——官方在模型卡中明确提示复现榜单需将温度设为 1.0而通用任务推荐参数是temperature0.6。也就是说榜单分数对应的是一个特定采样配置下的结果与日常使用配置并不完全一致。不同的基准跑在不同的 harness 上SWE-bench 系列用 OpenHands harnessDeepSWE 用 Claude Code harnessSWE Atlas QnA 用 mini SWE agent harnessTerminal-Bench 2.1 用 Harbor/Terminus-2 框架。同一模型在不同 harness 下的成绩彼此并不完全可比更别提与其他厂商自测分数的对比。评判标准高度依赖第三方闭源模型HLE 用 Claude 4.6 Opus 当 judgeMCP-Atlas 用 Claude 4.8 Opus 当 judge。榜单的一部分分数其实是闭源模型主观打出来的judge 的偏置会直接传导到分数上。上下文窗口与算力门槛被脚注轻描淡写SWE-bench 评估用 256K 上下文Terminal-Bench 2.1 单次运行 4 小时超时、32 核 CPU 48GB RAM。这意味着榜单成绩是用巨额推理预算换来的普通用户复现成本极高。自我进化训练是能力跃迁还是自己出题自己考Ornith-1.5 最大的卖点也是最大的争议点是端到端自我改进。官方介绍很直白Ornith-1.0 还依赖固定的人类人工任务集和手工设计的 harness而 Ornith-1.5 把自我改进循环从 scaffold 与 rollout 优化扩展到同时优化任务生成、scaffold 构建和方案 rollout——模型不断生成新训练任务、发现解题策略再通过强化学习提升策略。36Kr 那篇传播量很大的文章标题就是《AI 自己出题自己练两个月狂涨 11%编码自测反超 Opus 4.8》。自测反超四个字精准戳中了质疑者的神经如果一个模型从自己生成的题目中学习又在含同类任务的榜单上拿高分那这个高分里有多少是泛化能力有多少是熟悉考场但把 README 读透会发现官方对评测污染这件事是有意识的甚至做了相当严格的防护只是这些措施集中在评测端SWE-bench Verified/Pro/Multilingual 评估中明确声明应用了反作弊防护从本地仓库镜像中删除 Git 历史防止模型查看先前的解决方案或提交禁用网络访问防止模型检索外部信息。NL2Repo 评估中屏蔽了对指定 GitHub 仓库和 pip 包的访问并注明目的是防止奖励黑客reward hacking。评测使用了统一的 chat template 调整README 指向chat_template.jinja并针对 vLLM 的reasoning_content键修改了 Harbor 框架以保证训练与推理一致性。这说明模型卡作者清楚刷分的套路在哪并试图从评测口径上堵住。不过自我出题导致的另一层风险并没有被这些措施覆盖训练任务分布与公开基准的重合度。当模型在自生成的、贴近 SWE 类任务的语料上强化训练后即便评测端删了 Git 历史、断了网只要任务形态与训练分布相似分数仍可能被系统性抬高。评测防作弊防的是作弊手段防不了分布重合。这也是自我进化叙事下最难证伪、也最需要社区用独立评测去交叉验证的一环。真实工程场景与榜单的落差DeepSWE 的 22 分就是答案如果说上面是方法论层面的怀疑那官方数据本身已经给出了一个刺眼的实证在同一张基准表里模型在 SWE-bench Verified 拿 79 分在 DeepSWE 上只有 22 分。DeepSWE 是什么README 注明它是用 Claude Code harness、256K 上下文评估的agentic 编码基准——换句话说它更接近真实用户任务分布。79 到 22同一个模型同一个团队同样的评估体系落差如此之大只能说明榜单分数高度依赖基准的任务形态越贴近真实工程分数塌得越厉害。同样的信号也出现在 Frontier-Bench v0.1 上Ornith-1.5-35B-A3B 拿到 5.1 分看似是 Qwen3.5-397B1.4 分的 3 倍多但注意绝对数值——一个号称Opus 4.8 级性能的模型在前沿难度基准上只有 5.1 分。这个分数与其说是荣耀不如说是提醒榜单领先不等于前沿能力领先。社区实测也印证了工程场景与榜单的落差。多篇 16G 显存部署实测RTX 4080 / 4090给出了一组更接地气的数据Ornith 35B 与 Qwen 35B 在 4-bit 量化下都能在 16G 显存稳定运行显存占用约 13.2G vs 12.8G推理速度 18.2 t/s vs 16.8 t/sHumanEval 分数 Ornith 78.5% 略胜 Qwen 76.2%——但测评者同时指出Qwen 的输出更贴近工程实践Ornith 的算法更标准即榜单上 2 个百分点的差距在实际代码生成中表现为风格与可用性的差异而非胜负。还有测评直接给出结论Q4_K_M 量化在 16GB 显存下是最佳平衡点——这正是本仓库提供Ornith-1.5-35B-Q4_K_M.gguf等量化文件的原因。另一个容易被忽略的工程现实是部署门槛。README 的快速开始部分写得清楚bf16 权重约 70GB官方推荐的 vLLM 配方是2× 80GB GPU--tensor-parallel-size 2以给 256K 上下文留出余量运行时要求 vLLM ≥ 0.19.1、SGLang ≥ 0.5.9、Transformers ≥ 5.8.1——都是相当新的版本。若想进一步突破 262K 上下文到约 1M tokens需要开启 YaRN 缩放而 README 自己也提醒开源运行时对 YaRN 是静态应用的对普通长度输入的质量略有损害仅在确实需要长窗口时启用。社区里128GB DDR4 跑 35B 大模型90 分钟烧坏一根内存条的极端案例更是把35B 人人可跑的叙事打回了原形——本地跑得动是一回事跑得好、跑得稳是另一回事。结论分数要横向比更要纵向拆回到标题的问题Ornith-1.5 的榜单水分谁挤过答案藏在三层证据里。第一层官方自己挤过——README 的评测脚注详尽到令人意外5 次运行取均值、防 reward hacking 的网络与 Git 历史屏蔽、第三方闭源 judge、明确标注的 harness 与采样参数。这些细节说明官方并非拿一张裸分数表出来营销而是在努力交代分数是在什么条件下测出来的。第二层数据本身在挤——DeepSWE 的 22 分、Frontier-Bench 的 5.1 分与 SWE-bench Verified 的 79 分之间的巨大落差是同一张表里最诚实的部分。第三层社区实测在挤——16G 显存下的量化对比、与 Qwen 35B 的实际体验差异、2×80GB 才能舒服跑满的部署门槛都在把Opus 4.8 级性能拉回到这是一款需要认真对待、但远未封神的开源模型的现实坐标。对于要选型落地的工程师最务实的建议是榜单只用来筛候选别用来定胜负。把 Ornith-1.5-35B-A3B 的 GGUF 量化版Q4_K_M / Q5_K_M / Q6_K / Q8_0拉到自己的真实代码库上跑一遍 Terminal-Bench 式的任务再对照榜单决定去留——毕竟AI 自己出题自己练能涨分但只有你出题它做才是工程世界里唯一的硬通货。【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

cn-llm-router:为Claude Code等harness接入国内大模型的本地路由方案

cn-llm-router:为Claude Code等harness接入国内大模型的本地路由方案

1. 为什么我要折腾模型路由这件事用 Claude Code 这类 harness 工具写代码,体验确实好,但账单也是真让人肉疼。我平时主力开发环境在国内,网络访问海外 API 本来就不算顺畅,再加上按量计费,一个月下来光是模型调用费用…

2026/10/10 13:26:26 阅读更多 →
大语言模型本地部署快速启动:从Transformer原理到Ollama与llama.cpp实战

大语言模型本地部署快速启动:从Transformer原理到Ollama与llama.cpp实战

1. 从零理解大语言模型快速启动的底层逻辑1.1 为什么“快速启动”不是一句空话很多人第一次接触大语言模型,脑子里冒出来的第一个念头就是“我要自己跑一个”。这个想法本身没问题,但问题在于,大部分人卡在第一步——环境还没搭好&#xff0c…

2026/10/10 13:26:26 阅读更多 →
幼小衔接拼音试卷带彩图:分层设计到Word排版一次搞定

幼小衔接拼音试卷带彩图:分层设计到Word排版一次搞定

简介:面向幼小衔接阶段孩子的带彩图拼音试卷,围绕单韵母、复韵母、后鼻韵母、音节拼写与看图连线等典型题型展开,适合幼儿园大班或学前班儿童在暑期、家庭辅导中使用,可帮助孩子系统巩固拼音基础,为入小学后的语文学习…

2026/10/10 13:26:26 阅读更多 →

最新新闻

Harness 工程安全基线:为 AI Agent 编写 SECURITY.md 安全策略文件

Harness 工程安全基线:为 AI Agent 编写 SECURITY.md 安全策略文件

【免费下载链接】learn-harness-engineering Harness engineering beginner tutorial, from 0 to 1 项目地址: https://gitcode.com/gh_mirrors/le/learn-harness-engineering 点击查看 免费下载 SECURITY.md 是面向 Agent 的仓库(agent-first reposito…

2026/10/10 14:07:49 阅读更多 →
ponyc 0.57.1 修复 x86 macOS 上 Xcode 15 链接 Pony 程序失败问题解析

ponyc 0.57.1 修复 x86 macOS 上 Xcode 15 链接 Pony 程序失败问题解析

编程语言编译器语言运行时 【免费下载链接】ponyc Pony is an open-source, actor-model, capabilities-secure, high performance programming language 项目地址: https://gitcode.com/gh_mirrors/po/ponyc 点击查看 免费下载 导读 ponyc 0.57.1 是一次聚焦单一…

2026/10/10 14:07:49 阅读更多 →
LeetCode 139 单词拆分全解析:动态规划、剪枝优化与 Trie 加速

LeetCode 139 单词拆分全解析:动态规划、剪枝优化与 Trie 加速

刷 LeetCode 的人,几乎都会被一道叫“单词拆分”的题拦住过。它排在热门 100 题的中段,题干看起来非常简单:给一个字符串和一个字典,问这个字符串能不能被字典里的单词完整拼出来。但第一次动手写的时候,很容易在贪心、…

2026/10/10 14:07:49 阅读更多 →
每日热门skill-半年228K星,ECC凭什么让AI编程Agent长出肌肉记忆:TaoToken统一Key接入Claude Code与Cursor的配置实录

每日热门skill-半年228K星,ECC凭什么让AI编程Agent长出肌肉记忆:TaoToken统一Key接入Claude Code与Cursor的配置实录

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 14:07:49 阅读更多 →
GGUF 十四个量化版本翻车实录:0731 版本地部署炸显存/掉速的坑全在这

GGUF 十四个量化版本翻车实录:0731 版本地部署炸显存/掉速的坑全在这

GGUF 十四个量化版本翻车实录:0731 版本地部署炸显存/掉速的坑全在这 【免费下载链接】DeepSeek-V4-Flash-0731 项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Flash-0731 DeepSeek-V4-Flash-0731 官方发布后,社区里最热…

2026/10/10 14:07:49 阅读更多 →
STM32F423RH与PJ85718DM的HVAC温度监测方案

STM32F423RH与PJ85718DM的HVAC温度监测方案

1. 项目背景与核心需求拆解温度监测这件事,看起来简单,真要做到“本地能看、远程能查、长期稳定”,里面门道不少。我最近在做一个嵌入式和 HVAC(暖通空调)场景下的温度采集方案,主控用的是 STM32F423RH&…

2026/10/10 14:06:48 阅读更多 →

日新闻

卫星轨道分类全解析:从LEO到GEO的选型逻辑与工程实践

卫星轨道分类全解析:从LEO到GEO的选型逻辑与工程实践

1. 从“卫星轨道分类”这个标题说起:为什么值得花时间搞懂第一次接触“卫星轨道分类”这个概念,很多人会觉得它离自己很远——不就是天上的星星怎么转吗?但如果你正在做航天任务规划、遥感数据接收、星座设计,甚至只是准备一场航天…

2026/10/10 0:00:39 阅读更多 →
Spring AOP 核心原理与实战:从概念到日志切面落地

Spring AOP 核心原理与实战:从概念到日志切面落地

1. 从一个真实痛点说起:为什么你的代码里到处都是重复逻辑刚入行那会儿,我写过一个用户管理模块,注册、登录、改密码、注销四个接口。每个接口里都塞了几乎一样的日志打印、参数校验、事务开启和提交。当时觉得没什么,能跑就行。直…

2026/10/10 0:00:40 阅读更多 →
Python招聘数据采集与分析可视化:从采集清洗到薪资技能城市可视化全链路

Python招聘数据采集与分析可视化:从采集清洗到薪资技能城市可视化全链路

简介:这是一套面向计算机相关专业学生与项目实战学习者的Python数据采集与分析可视化完整项目,以Boss直聘岗位数据为对象,适合用作毕业设计、课程设计或期末大作业。资源包共38个文件,约246KB,以13个py源码文件为核心&…

2026/10/10 0:00:40 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 11:14:25 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 1:36:08 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 11:14:58 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →