Ornith-1.5: From Self-Scaffolding to Self-Improvement——从自我脚手架搭建到自我改进
一、核心贡献Ornith-1.5 提出了一种端到端的自我改进框架让大语言模型能够通过持续自我生成任务、构建解决方案脚手架、产出训练数据形成一个闭环的自我提升系统。这是 Ornith-1.0 自我脚手架搭建框架的重大升级。二、技术核心三阶段自我改进循环每个训练周期包含三个环节且奖励信号会反向传播到所有环节阶段内容作用任务生成模型基于当前能力和历史表现提出比已解决任务更难的挑战持续推动训练前沿暴露能力短板自动构建课程脚手架生成模型为每个任务生成或优化专属的指令、工具、分解策略和编排方案更高效地激发模型能力解决方案生成模型产出具体的解决轨迹用于强化学习训练提供学习信号驱动参数更新三个环节通过 GRPO 算法联合优化形成“更强策略→更难任务→更好脚手架→更优轨迹→更强策略”的正反馈循环。三、任务奖励机制生成任务时系统综合评估三个信号有效性任务是否合法、可验证前沿难度当前模型在该任务上的成功率越接近 20% 越好既具挑战性又能产出足够成功轨迹用于 RL 训练新颖性与历史任务库的差异度防止重复生成相似任务四、模型规格版本架构特点Ornith-1.5-397BMoE混合专家旗舰版对标 Claude Opus 4.8Ornith-1.5-35BMoE每令牌激活 3B高效推理性能大幅超越同尺寸密集模型Ornith-1.5-9BDense密集模型含量化移动版可部署于手机端三者均基于 Ornith-1.0源自 Qwen3.5 Gemma 4进行额外的持续预训练、中期训练和后期训练。五、核心性能表现Ornith-1.5-397B旗舰级基准测试Ornith-1.5Claude Opus 4.8DeepSeek-V4-FlashGLM-5.2Terminal-Bench 2.186.185.082.782.7DeepSWE56.059.054.446.2SWE-bench Verified86.085.881.683.0与 Claude Opus 4.8 持平超越所有同规模开源模型Ornith-1.5-35BMoE在 Terminal-Bench 2.1 上达到68.5远超 Gemma 4-31B43.4在 SWE-bench Verified 上达到79.0大幅领先 Muse Glimmer76.0每令牌仅激活 30 亿参数效率极高Ornith-1.5-9B端侧部署Terminal-Bench 2.147.0SWE-bench Verified70.6性能达到甚至超越 Gemma 4-31B 和 Qwen 3.6-35B 等大模型量化版可部署于 iPhone/Android六、评估覆盖范围论文在三大类基准上进行了全面评估编码类Terminal-Bench 2.1、SWE-benchVerified/Pro/Multilingual、DeepSWE、NL2Repo、SWE Atlas 等推理类HLE含/无工具、GPQA Diamond智能体类MCP-Atlas、Toolathlon-Verified、WideSearch、BrowseComp、ClawEval七、技术亮点摆脱对人工数据与人工设计智能体的依赖完全由模型自主生成任务和策略课程自动演进前沿难度随模型能力动态调整反黑客保护评估中移除 Git 历史、禁用网络、屏蔽外部仓库访问防止奖励作弊跨规模可扩展从 9B 端侧模型到 397B 旗舰模型均验证有效Ornith-1.5 的核心突破在于让模型成为自身进步的工程师——它自己出题、自己想解题思路、自己练题形成可持续的自我进化闭环在编码、推理和智能体任务上达到或超越当前最先进的闭源与开源模型。今天我们推出 Ornith-1.5这是朝着通过端到端自我改进构建基础模型迈出的重要一步。Ornith-1.5 将 Ornith-1.0 中引入的自我脚手架搭建框架扩展为一个更完整的自我改进循环模型提出新任务生成针对特定任务的脚手架并生成用于强化学习的解决方案轨迹从而持续创造新的学习经验并从中进行自我提升。Ornith-1.5 涵盖三种模型规模397B MoE、35B MoE 和 9B Dense。它是在 Ornith-1.0 的基础上扩展而来后者基于 Qwen3.5 和 Gemma 4 开发并进行了额外的持续预训练CPT、中期训练和后期训练。Ornith-1.5 在广泛的推理、编码和智能体基准测试中在同等规模的开源模型中达到了最先进的性能。2026/8/20 13:32 Ornith-1.5从自我脚手架搭建到自我改进 | Ornith 博客Ornith-1.5-397B 在 Terminal-Bench 2.1 上得分为 86.1在 DeepSWE 上得分为 56.0性能与 Claude Opus 4.885.0 和 59.0相当同时优于同规模领先的开源模型包括 GLM-5.282.7 和 46.2和 DeepSeek-V4-Flash-073182.7 和 54.4。在另一端Ornith-1.5-9B 及其量化版本 Ornith-1.5-9B-Mobile 可轻松部署在 iPhone 和 Android 设备上同时性能显著优于 Gemma 4-31B 和 Qwen 3.6-35B 等更大规模的模型。在旗舰级规模上Ornith-1.5-397B 在 Terminal-Bench 2.1 上达到 86.1在 DeepSWE 上达到 56在两个基准测试中均与 Claude Opus 4.8 持平并优于同尺寸的领先开源模型包括 GLM-5.2 和 DeepSeek-V4-Flash-0731。2026/8/20 13:32 Ornith-1.5从自我脚手架搭建到自我改进 | Ornith 博客Ornith-1.5-35B 在所有编码和智能体基准测试中均显著优于其同尺寸竞品 Qwen 3.6-35B。尽管每个令牌仅激活 30 亿参数它在智能体编码任务上也大幅超越了密集模型——Gemma 4-31B 和 Meta 的 Muse Glimmer-30BTerminal-Bench 2.1 得分为 68.5 对比 43.4 和 51.7SWE-Bench Verified 得分为 79.0 对比 52.0 和 76.0。可边缘部署的 Ornith-1.5-9B 也交出了非常亮眼的成绩单在 Terminal-Bench 2.1 上达到 47.0在 SWE-Bench Verified 上达到 70.6。尽管是一个紧凑的 90 亿参数模型它的表现却达到甚至超越了 Gemma 4-31B 和 Qwen 3.6-35B 等大得多的模型。通过自生成任务、工具包和解决方案实现自我改进Ornith-1.5 扩展了 Ornith-1.0将自我改进循环从脚手架和轨迹优化扩展为联合优化任务生成、脚手架构建和解决方案轨迹生成。Ornith-1.5 不再依赖固定的人工策划任务集和手动设计的工具包而是持续生成新的训练任务发现解决这些任务的有效策略并通过强化学习改进策略。每个训练周期分为三个阶段。给定一个环境或代码库、关于任务类型的高级指令以及模型先前任务解决历史的访问权限系统会提出逐步更难的任务这些任务超出了模型已能解决的范围从而暴露能力差距持续推动训练前沿。对于每个任务模型随后会生成或改进一个针对特定任务的脚手架——即用于处理该问题的指令、工具、分解策略和编排方案。以任务和脚手架为条件策略生成一个解决方案轨迹。来自轨迹的奖励会反向传播到所有三个阶段因此系统不仅学会产生更好的解决方案还学会生成更有用的训练任务和构建更有效的脚手架。通过反复训练这就形成了一个封闭的自我改进循环更强的策略能够生成更难、信息量更丰富的任务不断演进的脚手架发现更好方法来激发模型能力更高质量的轨迹提供越来越有效的学习信号。Ornith-1.5 不再依赖于静态的训练数据分布或人工设计的智能体方案而是持续扩展自身的课程并调整其问题解决策略从而在推理、编码和智能体任务上驱动持续的能力提升。任务奖励其中V 衡量生成的任务和脚手架是否构成一个有效且可验证的学习环境D 基于轨迹执行表现衡量任务是否位于模型当前能力前沿附近N 衡量相对于先前生成或训练过的任务的新颖性。这种乘积形式的公式鼓励提议者生成同时满足所有三个属性的任务有效、难度恰当且非冗余。有效性与可验证性一个有用的任务必须形成一个定义良好的学习环境。问题应当连贯且可解而脚手架应当能够正确执行并可靠地评估候选解决方案。我们定义V(q,s)∈[0,1]基于以下检查脚手架是否成功运行、高置信度解决方案是否通过、明显错误的解决方案是否失败以及评估是否与任务规范一致。有效性也可以作为一个硬性门控条件V(q,s)0 ⟹ Rtask0.这可以防止格式错误的任务或不可靠的脚手架仅仅因为看似困难而获得奖励。前沿难度在有效的任务中最有用的那些既非微不足道也非不可能完成。我们直接从模型的轨迹执行结果来估算难度。对于每个任务我们采样 N 条轨迹并计算经验成功率新颖性与多样性仅靠前沿难度可能导致模型反复生成相同任务的微小变体。因此我们增加了一个新颖性项其中 B 是先前生成或训练过的任务的缓冲区。新颖性应当次于有效性和难度其作用是减少冗余而非奖励任意不寻常的任务。这些信号共同鼓励提议者生成有效、可验证、具有挑战性但可学习且足够多样化的任务。由于前沿难度是使用当前模型自身的轨迹来衡量的由此产生的课程将随模型能力自动演进。工具包与轨迹奖励对于生成的问题 q工具包 h 因提供一个与任务对齐、忠实反映解决方案质量、且对奖励黑客行为具有抵抗力的评估环境而获得奖励其中C 衡量工具包是否忠实地反映了任务规范F 衡量其奖励是否能追踪候选方案的真实质量H 衡量其对评估器失败、捷径和奖励黑客行为的抵抗能力。每个轨迹 τi​ 由生成的工具包直接评分对于可验证的任务这可以是一个二进制的通过/失败奖励对于更丰富的环境它可以结合正确性、任务完成度、效率和约束满足。问题生成、工具包生成和解决方案轨迹都使用各自的奖励通过 GRPO 进行优化使得这三个阶段能够在同一个自我改进循环中共同提升。结果评测Ornith-1.5-397BBenchmarkOrnith-1.5(397B)DeepSeek-V4-Flash-0731(284B)GLM-5.2(753B)Claude Opus 4.8Kimi K3(2.8T)Ornith-1.0(397B)CodingTerminal Bench 2.1 (Terminus-2)86.182.7818588.377.5Terminal Bench 2.1 (Claude Code)85.281.882.778.9–78.2SWE-bench Verified8681.68385.886.282.4SWE-bench Pro65.164.462.168–62.2SWE-bench Multilingual79.677.978.475.7–78.9DeepSWE5654.446.25967.58Frontier-Bench v0.113.56.15.121.1232.7NL2Repo59.554.248.969.7–48.2SWE Atlas – QnA55.651.65059.759.741.2ReasoningHLE (no tools)44.63540.549.843.530.2HLE (with tools)56.150.854.757.95647.5GPQA Diamond92.891.491.293.693.588.1AgenticMCP-Atlas8074.677.882.282.376.4Toolathlon-Verified71.270.348.276.273.243.2WideSearch80.877.37972.9–75.2BrowseComp86.684.885.684.391.279.7ClawEval81.477.678.880.2–77.1Ornith-1.5-35BBenchmarkOrnith-1.5-35B-A3BOrnith-1.0-35B-A3BQwen3.6-35B-A3BGemma-4-31B(dense)Muse-Glimmer-30B(dense)Qwen3.5-397B(397B)CodingTerminal Bench 2.1 (Terminus-2)67.864.252.542.151.753.5Terminal Bench 2.1 (Claude Code)68.562.849.2––48.6SWE-bench Verified7975.673.4527676.4SWE-bench Pro59.650.449.535.751.251.6SWE-bench Multilingual71.469.367.251.7–69.3DeepSWE2200––1Frontier-Bench v0.15.11.41.4––1.4NL2Repo46.234.629.415.5–36.8SWE Atlas – QnA39.837.115.5––20.4ReasoningHLE (no tools)25.620.821.419.52228.7HLE (with tools)33.430.128.926.5–48.3GPQA Diamond89.286.28684.383.588.4AgenticMCP-Atlas70.264.462.85575.572.3Toolathlon-Verified48.742.441.740.8–38.3WideSearch67.863.460.154.2–74BrowseComp67.663.562––78.6ClawEval72.569.868.748.5–70.7Ornith-1.5-9BBenchmarkOrnith-1.5-9BOrnith-1.0-9BQwen3.5-9BQwen3.6-35B-A3BGemma-4-31B(dense)CodingTerminal Bench 2.1 (Terminus-2)46.243.121.352.542.1Terminal Bench 2.1 (Claude Code)4740.618.949.2–SWE-bench Verified70.669.453.273.452SWE-bench Pro47.542.931.349.535.7SWE-bench Multilingual54.45239.767.251.7NL2Repo32.427.216.229.415.5SWE Atlas – QnA20.617.99.215.5–ReasoningHLE (no tools)20.216.814.721.419.5HLE (with tools)30.526.424.528.926.5GPQA Diamond86.482.581.78684.3AgenticMCP-Atlas54.249.446.862.855Toolathlon-Verified41.233.429.641.752.8WideSearch59.555.853.660.154.2BrowseComp56.444.841.562–ClawEval66.563.153.268.748.5脚注所有报告的 Ornith-1.5 结果是五次独立运行的平均值。Terminal-Bench 2.1 (Terminus-2):我们使用 Harbor/Terminus-2 框架评估 Terminal-Bench 2.1设置 parserjsontemperature1.0top_p1.0上下文窗口为 128K。每次运行使用 4 小时超时时间配备 32 个 CPU 核心和 48GB RAM结果取 5 次运行的平均值。我们调整了 Qwen 聊天模板以确保训练和推理之间的一致性并修改了 Harbor 以适配 vLLM 的 reasoning_content 键。Terminal-Bench 2.1 (Claude Code):我们使用 Claude Code 2.1.126 评估 Terminal-Bench 2.1设置 parserjsontemperature1.0top_p1.0max_new_tokens131072。结果取 5 次运行的平均值。同样需要修改 Qwen 聊天模板。SWE-Bench Verified, Pro 和 Multilingual:使用 OpenHands 工具包进行评估设置 temp1.0top_p0.95上下文窗口为 256K。整个评估过程中应用了反黑客保护措施从本地仓库镜像中移除 Git 历史记录以防止模型访问先前的解决方案或提交记录禁用网络访问防止模型检索外部信息或资源。DeepSWE:使用 Claude Code 工具包进行评估设置 temperature1.0top_p0.95上下文窗口为 256K。SWE Atlas QnA, RF, TW:使用 mini SWE agent 工具包进行评估设置 temp1.0top_p0.95上下文窗口为 128K。结果取 5 次运行的平均值。NL2Repo:设置 temperature1.0top_p1.0上下文窗口为 400K输出长度为 48K。阻止访问指定的 GitHub 仓库和 pip 包以防止奖励黑客行为。HLE:使用 Claude 4.6 Opus 作为评判模型进行评估。MCP-Atlas:所有模型均以思考模式在 500 个任务的公开子集上进行评估每个任务超时时间为 10 分钟。我们使用 Claude 4.8 Opus 作为评判模型。Tool-Decathlon:我们使用官方评估服务最大令牌限制设为 128K。ClawEval:一个基于真实用户任务分布的智能体编码基准测试设置 temp0.6上下文窗口为 256K。

相关新闻

React面试核心考点与实战优化解析

React面试核心考点与实战优化解析

1. React面试核心考点解析 作为前端开发领域的三大主流框架之一,React的面试题往往聚焦于其独特的设计哲学和底层实现机制。我在过去三年面试过近百名React开发者,发现候选人最容易在虚拟DOM原理、组件生命周期管理和状态管理方案这三个维度暴露出知识盲…

2026/8/22 17:39:04 阅读更多 →
AI写作的边界与风险:从科幻作家批判看人机协作新范式

AI写作的边界与风险:从科幻作家批判看人机协作新范式

这次我们来看一个关于“AI写作”的讨论,它并非一个技术部署项目,而是一篇来自知名科幻作家约翰斯卡尔齐(John Scalzi)的博客文章。这篇文章的核心观点直指当前AI写作热潮中的一个关键问题:为什么你不应该用“AI”来写作…

2026/8/22 17:39:04 阅读更多 →
济南能华机电设备远程供电系统落地应用指南

济南能华机电设备远程供电系统落地应用指南

在偏远地区部署监控或监测设备时,最让人头疼的往往不是设备安装本身,而是“电从哪里来”。很多项目现场位于深山、海岛或是高速公路的隔离带,距离最近的市电接入点动辄几公里甚至十几公里。传统做法是拉设长距离电缆,不仅施工周期…

2026/8/23 17:41:59 阅读更多 →

最新新闻

蒙特卡罗模拟:从核心原理到数学建模实战

蒙特卡罗模拟:从核心原理到数学建模实战

1. 从“赌场”到“实验室”:蒙特卡罗模拟的起源与核心思想我第一次接触蒙特卡罗模拟,是在一个关于核反应堆中子扩散的经典案例里。当时我就在想,这么高大上的物理问题,怎么就用上了以赌城命名的数学方法?后来才明白&am…

2026/8/23 20:17:32 阅读更多 →
从数学建模国赛经典案例到可复用的复杂系统分析方法论

从数学建模国赛经典案例到可复用的复杂系统分析方法论

1. 项目概述:从一篇优秀论文到一套可复用的建模方法论看到“2013年数学建模国赛A题优秀论文”这个标题,很多参加过数模竞赛的朋友可能会心一笑,这几乎是每个“数模人”成长路上绕不开的经典案例。但今天,我想聊的远不止是回顾一篇…

2026/8/23 20:17:32 阅读更多 →
TLS for DeepSeek Harness 可观测实践:从系统总览到会话复盘

TLS for DeepSeek Harness 可观测实践:从系统总览到会话复盘

TLS for DeepSeek Harness 可观测插件,将 DSH(DeepSeek Harness)会话中的模型请求和工具调用转换为 OpenTelemetry Trace,并上报到火山引擎日志服务 TLS。开发者无需改变原有使用方式,就能从系统总览一路下钻到单次模型…

2026/8/23 20:16:32 阅读更多 →
Java微服务与安全框架面试核心解析

Java微服务与安全框架面试核心解析

1. 互联网大厂Java技术面试深度解析 最近在准备互联网大厂Java技术面试的同学可能会发现,微服务架构和安全框架已经成为面试中的必考内容。作为一名经历过多次大厂技术面试的过来人,我想通过这篇文章,详细解析面试中常见的微服务架构和安全框…

2026/8/23 20:16:32 阅读更多 →
从SQL奇偶判断到按位与运算:揭秘底层效率与位掩码应用

从SQL奇偶判断到按位与运算:揭秘底层效率与位掩码应用

1. 从一道“简单”的SQL题说起那天在刷Leetcode,碰到了第620题“有趣的电影”。题目要求从cinema表里找出所有“有趣的”电影,条件很简单:description不是‘boring’,并且rating是奇数。对于任何有SQL基础的朋友来说,这…

2026/8/23 20:16:32 阅读更多 →
GBDT与SHAP在移动网络体验预测与根因分析中的实战应用

GBDT与SHAP在移动网络体验预测与根因分析中的实战应用

1. 项目背景与核心目标解析 去年参与MathorCup大数据竞赛的经历,现在回想起来依然觉得收获颇丰。当时我们团队选的是B题,关于北京移动用户体验影响因素的研究。这个题目听起来很宏大,但核心其实非常落地:就是利用真实的移动网络数…

2026/8/23 20:16:32 阅读更多 →

日新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/23 0:00:50 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/23 0:00:50 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/23 0:00:50 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/23 0:00:50 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/23 0:00:50 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/23 0:00:50 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/23 18:47:06 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/23 12:10:44 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/22 3:22:48 阅读更多 →