SWE-bench 75.6 分从哪来?Ornith 自改进训练框架逐层拆解
SWE-bench 75.6 分从哪来Ornith 自改进训练框架逐层拆解【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUFSWE-bench Verified 75.6 分是 Ornith-1.0-35B-A3B 在 2025 年发布的成绩单也是社区讨论开源编程模型黑马时的起点一个总参数 35B、单 token 仅激活约 3B 参数的 MoE 模型在真实 GitHub issue 修复任务上压过了同期同规模的 Qwen3.6-35B-A3B73.4。而它的继任者 Ornith-1.5-35B-A3B 把这一数字推到了 79SWE-bench Pro 更是从 50.4 直接跃升到 59.6。分数的跃迁并非靠堆数据、堆算力而是训练范式本身的改变官方博客给出的关键词是end-to-end self-improvement端到端自改进——模型自己出题、自己搭评测脚手架、自己生成解题轨迹再用强化学习把这三件事联合优化。本文结合仓库模型卡与官方技术博客逐层拆解这套自改进训练框架到底改了哪些环节、奖励如何设计、分数从哪些细节里长出来以及这套方法能否被其他团队复制。一、先给75.6 分定位它处在哪张坐标系里75.6 这个数字出自 SWE-bench Verified——以真实 GitHub issue 为题干、要求模型在完整代码仓库中定位问题并产出可合并 patch 的基准。它衡量的是Agent 级编码而非函数级代码补全因此分数直接反映模型在真实工程场景中的修复能力。在 README.md 的评测表中Ornith 三代同堂的分数关系一目了然基准Ornith-1.5-35B-A3BOrnith-1.0-35B-A3BQwen3.6-35B-A3BGemma-4-31BMuse-Glimmer-30BQwen3.5-397BSWE-bench Verified7975.673.4527676.4SWE-bench Pro59.650.449.535.751.251.6SWE-bench Multilingual71.469.367.251.7—69.3三个关键事实值得注意。第一Ornith-1.0 的 75.6 分本就领先 Qwen3.6-35B-A3B 约 2 分而 1.5 把这个差距拉大到 5.6 分第二在更难的 SWE-bench Pro 上1.5 相比 1.0 涨了 9.2 分是所有子集中涨幅最大的第三一个激活 3B 参数的模型在 Verified 上已经反超 Qwen3.5-397B76.4与稠密模型 Muse-Glimmer-30B76这在大模型评测史上并不常见。分数可信度还取决于评测口径。模型卡注明了 SWE-bench 系列的评测设置使用 OpenHands harnesstemperature1.0, top_p0.95256K 上下文窗口并且全程施加防作弊保护——本地仓库镜像删除 Git 历史防止模型读取既往提交、禁用网络访问防止检索外部信息。这排除了背诵答案和偷看测试两条捷径说明 79 分是在一个相对干净的隔离环境下拿到的。二、自改进循环从 Self-Scaffolding 到 Self-Improvement如果只是把人工标注的 SWE-bench 数据拿来微调分数涨几个点并不稀奇稀奇的是 Ornith 的训练数据本身是模型现出的。模型卡README 开篇与官方博客完整描述了这套框架的演化路径Ornith-1.0在 Qwen3.5 / Gemma 4 基础上做继续预训练CPT、mid-training 与 post-training训练阶段只对 scaffold解题脚手架指令、工具、任务拆解策略、编排方式与 rollout解题轨迹做优化即 self-scaffoldingOrnith-1.5把优化对象扩展到三个环节——任务生成task generation、脚手架构建scaffold construction、解题 rollout三者联合优化不再依赖固定的人工课程与手工设计的评测 harness。每个训练周期是一个三段闭环给定环境或代码库、任务类型的高层指令、以及模型过去的解题历史系统先提出比已解决问题更难一步的新任务暴露能力缺口、持续前推训练边界随后针对每个任务生成或精修专属脚手架最后策略模型在脚手架约束下产出解题 rollout。奖励信号从 rollout 反向传播到三个环节于是模型不仅学会产出更好的答案还学会出更有用的题、搭更有效的脚手架。2.1 任务奖励有效性 × 前沿难度 × 新颖性官方博客给出了任务奖励的乘性定义R_task V(q, s) × D(q, s, {τ_i}) × N(q)V(q,s)有效性题目是否可解、脚手架能否稳定执行并可靠评估候选解。V 可以充当硬性闸门——V 0时整个任务奖励归零防止畸形任务靠看起来难来骗分D前沿难度对每个任务采样 N 条 rollout统计经验成功率 p奖励靠近目标前沿 p* 的任务D exp(-(p-p*)²/2σ²)。p* 取 0.2即有点难但还练得出成功轨迹的难度。随着模型变强、任务成功率自然上升D 下降从而把题目生成器推向更难的问题——课程表随能力自动进化N新颖性N 1 - max sim(q, q_j)与历史任务库中的最大相似度做差压制重复出题但权重次于有效性与难度。2.2 Harness 与 Rollout 奖励反奖励黑客生成的评测 harness 也参与优化奖励拆成三项的乘积C与任务说明的吻合度×F奖励对解质量的忠实度×H抗奖励黑客能力——能抵抗求值器失效、捷径与 hack 行为。每条 rollout 直接由 harness 打分R_rollout(τ_i) h(q, τ_i)可验证任务上就是二值的 pass/fail复杂环境上则可叠加正确性、完成度、效率与约束满足。三个环节各自用 GRPO 优化各自的奖励——这是框架的联合所在题目生成器、harness 生成器与策略模型在同一循环里共同进化。这也是社区报道如 36KrAI 自己出题自己练把两个月迭代解读为约 11 个百分点编码能力跃升的技术背景训练分布从人写的静态题库变成了模型自己生成的动态课程。这套机制在深度代理任务上的收益最直观。模型卡中有一组长期被忽略的数字基准Ornith-1.5-35B-A3BOrnith-1.0-35B-A3BQwen3.6-35B-A3BQwen3.5-397BDeepSWE22001Frontier-Bench v0.15.11.41.41.4NL2Repo46.234.629.436.8DeepSWE 是从零建仓库级项目的长链路任务1.0 与 Qwen3.6 均得 0 分而 1.5 一举拿到 22。这说明自改进课程训练出来的不是会刷题的能力而是在开放式、长程、多文件场景下的规划—执行—验证闭环——这恰恰是 SWE-bench Pro 想测的东西。三、分数拆解9.2 的 Pro 涨幅说明训练对了场景把三张表放在一起看1.0 → 1.5 的涨幅分布很有信息量SWE-bench Verified75.6 → 793.4。基数已高剩余空间有限属于巩固盘SWE-bench Multilingual69.3 → 71.42.1。多语言修复涉及更多领域知识自生成课程对跨语言覆盖的提升相对温和SWE-bench Pro50.4 → 59.69.2。Pro 子集要求跨文件、跨模块的长期修改探索空间大、解空间稀疏正是前沿难度 稀缺成功轨迹训练信号最稀缺也最有价值的地方。自改进循环用 p*0.2 的难度锚点刻意制造这种稀缺再用稀疏的成功轨迹做 GRPO 更新与刷会高频题的静态 SFT 形成本质区别。再横向看 1.5-35B 与同代的对照Terminal-Bench 2.1Terminus-2 口径67.8 对 Qwen3.6 的 52.5、对 Gemma-4-31B 的 42.1MCP-Atlas 70.2、Toolathlon 48.7、BrowseComp 67.6。Agentic 维度全线领先这与训练阶段脚手架 工具调用 rollout 联合优化的设计一一对应——训练时模型就在自己生成的工具环境中反复试错评测时自然更擅长与工具生态协作。四、框架可复制性方法论开放落地门槛更低对开源社区而言Ornith 这套框架最有价值的资产不是某一版权重而是**任务—脚手架—rollout三段 GRPO 闭环本身可以脱离 Ornith 模型独立复刻**任务生成器、harness、策略三者都是可替换组件任何具备可验证任务环境的团队都能套用同一奖励配方V × D × N / C × F × H。这也是社区文章将 Ornith 称为Agent 编码行为优化层而非单纯新模型的原因——它把强化学习课程设计的活从人工搬到了模型自己手里。落地侧本仓库Ornith-1.5-35B-A3B-GGUF提供了从 BF16 到 Q4_K_M / Q5_K_M / Q6_K / Q8_0 五种 GGUF 精度并附带多模态投影权重mmproj-Ornith-1.5-35B-BF16.gguf。BF16 体量约 70GB模型卡说明Q4_K_M 约 20GB已进入消费级显卡可部署区间。模型卡给出了完整的服务化路径# llama.cpp / Atomic.chat一条命令起 OpenAI 兼容服务 llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF --port 8000 -c 262144 # Ollama 直接拉取运行 ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF需要 256K 长上下文与工具调用解析时官方推荐 vLLM≥ 0.19.1或 SGLang≥ 0.5.9并显式启用 reasoning 解析器与 qwen3_xml 工具解析器上下文不够时可用内置的 YaRN 缩放factor4.0 时窗口扩展至约 1M tokens。模型卡的通用采样建议是temperature0.6, top_p0.95, top_k20复现评测成绩则用temperature1.0——后者对 Agent 任务的探索性至关重要。不过社区对 Ornith-1.5 的讨论也并非一边倒。叫板 DeepSeek V4但仔细看分数事情没那么简单的观察背后是评测口径的复杂性旗舰 397B 在 Terminal-Bench 2.186.1与 DeepSWE56上与 Claude Opus 4.885.0 / 59.0互有胜负但在 HLE、MCP-Atlas 等推理与工具基准上仍与闭源旗舰存在差距各模型成绩都依赖具体 harness、温度与防作弊设置跨模型横向比较时应以模型卡声明的口径为准。对复刻者而言同样如此——自改进循环放大了评测即训练信号的收益也放大了 reward hacking 的风险官方评测中删 Git 历史、断网络的做法应当成为任何自改进训练与评测的默认纪律。五、结语回看75.6 分从哪来这个问题答案其实清晰它来自一个不再依赖人工题库的强化学习闭环——模型自己出题有效性 × 前沿难度 × 新颖性三重约束、自己搭评测对齐 × 忠实 × 抗 hack、自己解GRPO 稀疏奖励更新三者在迭代中互相喂养。Ornith-1.5-35B-A3B 用 79 / 59.6 / 71.4 的成绩验证了这条路的规模效应更强的策略出更难更高质量的题更难的题又训练出更强的策略。当开源模型开始自己给自己布置作业SWE-bench 榜单上的数字就不再只是算力与数据的函数了。【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

1.7 万 Star 的生成式 UI:是刚需还是下一个被 AI 吹起来的泡沫?

1.7 万 Star 的生成式 UI:是刚需还是下一个被 AI 吹起来的泡沫?

1.7 万 Star 的生成式 UI:是刚需还是下一个被 AI 吹起来的泡沫? 【免费下载链接】json-render The Generative UI framework 项目地址: https://gitcode.com/GitHub_Trending/js/json-render 2026 年 1 月中旬,Vercel Labs 开源了一个…

2026/10/10 17:46:12 阅读更多 →
概率输出如何干掉幻觉:Kev 确定性判定的技术底牌

概率输出如何干掉幻觉:Kev 确定性判定的技术底牌

概率输出如何干掉幻觉:Kev 确定性判定的技术底牌 【免费下载链接】kev Jev-like family of decision models built on top of Qwen3.5/3.8 you can train and run on your own 项目地址: https://gitcode.com/gh_mirrors/kev2/kev 大模型落地到业务判定场景&…

2026/10/10 17:45:11 阅读更多 →
如何一键生成完整营销网站:full-stack-ai-agent-template落地页、定价页与博客实战指南

如何一键生成完整营销网站:full-stack-ai-agent-template落地页、定价页与博客实战指南

如何一键生成完整营销网站:full-stack-ai-agent-template落地页、定价页与博客实战指南 【免费下载链接】full-stack-ai-agent-template Full-stack AI app generator — FastAPI Next.js with AI Agents, RAG, streaming, auth, and 20 integrations out of the b…

2026/10/10 17:45:11 阅读更多 →

最新新闻

codex 0.6.5 tar.gz 安装配置全攻略:从PyPI下载到跑通避坑指南

codex 0.6.5 tar.gz 安装配置全攻略:从PyPI下载到跑通避坑指南

简介:codex 0.6.5 是一份从 PyPI 官方下载的 Python 库源码压缩包,面向分布式系统与云原生应用开发者,核心围绕 Zookeeper 协调服务和分布式场景的交互展开,可用于配置管理、集群状态同步及云环境弹性组件的开发。包体共 639 个文…

2026/10/11 13:32:00 阅读更多 →
上位机OBJ模型材质MTL文件解析与渲染实战

上位机OBJ模型材质MTL文件解析与渲染实战

一位搞上位机开发的朋友曾跟我吐槽:接手一个3D模型加载项目,OBJ文件一读一个准,偏偏材质信息死活出不来,整个模型灰蒙蒙一片毫无质感。我一看代码,他压根没处理配套的MTL文件。这几乎是所有上位机工程师接手三维可视化…

2026/10/11 13:32:00 阅读更多 →
松下FP-XHC60T在3C点胶设备中的运动控制方案与调试复盘

松下FP-XHC60T在3C点胶设备中的运动控制方案与调试复盘

1. 项目整体思路与需求拆解1.1 3C点胶设备到底在控什么做3C行业的自动化设备,点胶机应该是很多工程师入行后接触最多的机型之一。手机中框、耳机壳、摄像头模组、电池仓密封、FPC补强,这些制程里都离不开点胶。胶水把结构粘住,把防水做严实&a…

2026/10/11 13:32:00 阅读更多 →
12天3城3展:工业自动化品牌密集参展的排期策略与复盘

12天3城3展:工业自动化品牌密集参展的排期策略与复盘

1. 从天津到杭州再到上海,12天3场展会意味着什么今年这一波秋季展会潮里,拉孚(Larfe)的行程单看得不少人直呼“太拼了”——12天,3座城市,3场展会,从天津出发,经过杭州,最后压轴落在上海工博会。…

2026/10/11 13:32:00 阅读更多 →
SpreadLicense.zip:离线开源许可证扫描与合规校验工具

SpreadLicense.zip:离线开源许可证扫描与合规校验工具

简介:本资源是面向T企业管理软件二次开发与运维人员的SpreadJS授权文件修复工具,专为解决财务报表模块加载时出现‘powered by grapecity spreadjs’未授权提示问题而设计。资源定位清晰:适用于熟悉T系统架构、具备前端JavaScript基础的IT支持…

2026/10/11 13:32:00 阅读更多 →
2026年详解腾讯企业邮箱购买方式,通过购买电话咨询套餐配置

2026年详解腾讯企业邮箱购买方式,通过购买电话咨询套餐配置

腾讯企业邮箱面向企业用户提供专业邮局服务,企业配置自有域名后即可生成以企业域名为后缀的账号,并自主组织、管理和分配。2026年,企业选购时的核心问题集中在两点:通过何种方式完成购买,以及如何借助购买电话把套餐配…

2026/10/11 13:31:00 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →