SWE-Bench 卷到 73.4% 之后,国产编程模型还能卷什么
SWE-Bench 卷到 73.4% 之后国产编程模型还能卷什么【免费下载链接】KAT-Coder-V2.5-Dev项目地址: https://ai.gitcode.com/hf_mirrors/Kwaipilot/KAT-Coder-V2.5-Dev当快手 Kwaipilot 团队把闭源旗舰 KAT-Coder 在 SWE-Bench Verified 上的解决率推到 73.4% 时这个数字本身已经不是新闻——它只是过去一年国产编程模型榜单竞速的又一个注脚。真正值得追问的是当各家模型在同一个榜单上的差距从断档缩小到小数点后两位时编程模型竞争的胜负手究竟移到了哪里答案藏在这份开源权重仓库 KAT-Coder-V2.5-Dev 的细节里。它总参数量 35B、激活仅 3B在 README.md 的评测表中以 69.40% 拿下 SWE-bench Verified 的同规模 SOTA但比分数更有信息量的是它后训练管线里针对异常工具调用并行调用爆炸重复生成的一整套奖励工程以及 config.json 中为长上下文 Agent 任务设计的混合注意力结构。本文以这份开源仓库为解剖样本拆解 73.4% 之后国产编程模型正在卷的三件事榜单的真实含金量、从写代码到做工程的转向以及私有化部署与 Agent 工作流的下沉。一、榜单内卷的现状与天花板先看榜单本身。SWE-bench Verified 是当前 Agentic Coding 公认的高考它要求模型在真实 GitHub 仓库中定位问题、修改代码并通过隐藏测试比单轮代码补全更贴近真实工程。KAT-Coder 系列的路线图清晰可查开源的 KAT-Dev-32B 先做到 62.4%闭源旗舰 KAT-Coder 随后冲到 73.4%而本次开源的 KAT-Coder-V2.5-Dev35B MoE、3B 激活以 69.40% 成为同参数量级下的开源标杆。但把 README.md 那张评测表横向展开能看到另一层现实在同一条统一评测管线agentclaude_code2.1.195、passk1、256k 上下文下69.40 分的身后紧跟着 68.60、64.40、60.60、58.60、55.80 一长串名字榜首与第五名之间的差距不足 14 个点。而在 Terminal-Bench 2.1终端多步任务上README 甚至用两个 Agent harnessTerminus-2 / Claude Code的平均值作为最终成绩——评测本身正在变得环境敏感。README 的评测附注对这种内卷给出了更诚实的脚注同一模型在不同 harness 版本和测试集优化下可能产生约 10 个百分点的偏差Qwen3.5-35B-A3B 在评测中频繁幻觉调用当前环境不存在的 MultiEdit 工具Gemma4 则出现 256k 上下文溢出。换句话说榜单位置有很大一部分取决于模型工具偏好与评测 harness 允许工具集是否匹配而非纯粹的模型能力差。分数曲线的边际收益在递减榜单头部的游戏已经从能力竞赛变成了评测工程竞赛。这也解释了为什么 KAT-Coder-V2.5-Dev 的亮点描述里排在第一位的不是又涨了几个点而是通过 RL 将异常工具标签从 9.34% 压到 0.28%、单轮连续重复从 0.34% 压到 0%。当分数逼近上限模型的行为可靠性——不幻觉工具、不重复输出、不产生无效轨迹——成为比绝对分数更稀缺的能力。二、从「写代码」到「做工程」的集体转向73.4% 之后最明显的转向是整个行业把竞争定义从代码生成质量改写为工程任务完成度。KAT-Coder-V2.5-Dev 的仓库为此提供了三层源码级证据。第一层Agent 协议不再是临时拼凑。打开 chat_template.jinja能看到一套完整的工具调用语言模型被约束以tool_call包裹function...与parameter...的结构化格式调用工具系统提示中明确要求函数调用必须遵循指定格式可在函数调用前给出自然语言推理但不可在调用后补充。模板还实现了multi_step_tool检测——它会回溯消息序列识别以tool_response包裹的多轮工具反馈把工具调用-结果-再调用的循环编码进序列化逻辑。这不是为单次补全设计的模板而是为多轮 Agent 交互设计的会话协议。第二层长程推理被显式训练并保留。模板中preserve_thinking与enable_thinking两个开关对应了 README 中保留思考与非思考模式两节模型默认先思考再作答而preserve_thinking: True会让历史消息中的think块被完整保留进上下文。README 给出的理由是直接指向 Agent 场景的——保留完整推理上下文可以增强多步决策的一致性同时通过减少重复推理来降低总 token 消耗、优化 KV cache 利用率。把历史思考轨迹当作一等公民来训练和序列化是典型的为 Agent 工作流而设计而非为对话体验而设计。第三层RL 奖励不再只看过没过测试。README 的 Post-training 章节披露了完整的强化学习配方先以 127K 样本做 SFT再进行 RL。RL 阶段保留了 KAT-V2.5 验证过的四件套——Token-in-Token-outTITO保证 rollout 与训练阶段的 token 序列严格一致、Truncated Importance SamplingTIS抑制异步 rollout 的策略陈旧性、可靠的沙箱与验证器防止基础设施故障污染奖励信号、以及基于 harness 执行反馈的层级奖励hierarchical rewards。层级奖励的意义在于失败的轨迹只要包含有意义的中间进展也能获得奖励信号让没做完的任务也能参与训练。更值得注意的是 Qwen3.6 基座带来的特殊挑战。README 记录了一个几乎可以当作AI 编程模型训练事故案例的细节简单的 0-1 二元奖励在第二个 epoch 就导致模型崩溃——随着训练推进模型倾向于单轮内发起大量并行工具调用峰值超过 70 次导致上下文迅速膨胀、无效轨迹和执行错误激增。团队的解法是为原始层级奖励叠加针对单轮并行调用过多、工具调用失败、空工具调用块、大量重复内容的专项惩罚。这张 RL 奖励曲线图展示的正是这套奖励工程下训练得以稳定进行 10 个 epoch 的过程。从追求上限分数到治理病态行为这是做工程和写代码在训练层面的分野。三、下一站私有化部署与 Agent 工作流分数之外国产编程模型真正在卷的第三条线是如何让模型跑进开发者的真实环境。KAT-Coder-V2.5-Dev 的仓库配置几乎是为私有化与工作流集成的每一种形态预留了接口。先看架构层面的底气。config.json 显示这是一个 256 专家、每 token 激活 8 个专家的 MoE 模型num_experts: 256、num_experts_per_tok: 840 层中混合排布linear_attention与full_attention——每 4 层插入一个全注意力层其余为线性注意力层layer_types字段清晰可见linear_conv_kernel_dim: 4。线性注意力把长上下文推理的复杂度降了一个量级配合max_position_embeddings: 262144的原生 262K 上下文这个 35B/3B 的模型在长仓库级任务上具备远超同尺寸密集模型的性价比——这正是35B 模型只激活 3B单卡能跑编程 Agent传闻的架构来源。社区实测也验证了这一点基于 llama.cpp 的 GGUF 量化版本可在 CPU/GPU 混合环境下本地运行甚至有边缘 MaaS 平台将其上线为 API 服务宣称实现低于 300ms 的推理延迟。再看部署层面的完成度。README 的 Quickstart 同时给出了 SGLang、vLLM、KTransformers、Hugging Face Transformers 四套推理框架的启动命令且全部对齐 OpenAI 兼容的/v1API 形态工具调用场景只需追加--tool-call-parser qwen3_coder即可获得标准解析。针对超长文本仓库给出了 YaRN 的两种开启方式直接修改 config.json 的rope_parametersfactor: 4.0、original_max_position_embeddings: 262144或通过--hf-overrides命令行注入将上下文上限推到 1,010,000 token——百万级上下文配合混合线性注意力意味着一个 Agent 可以把整个中型仓库的代码树装进上下文里做全局推理。社区生态的走向印证了同样的趋势有人在华为开发者空间的容器里把 Claude Code 与 KAT-Coder 接成 AI 编程助手有人用统一 API Key 网关TaoToken把开源版与闭源版同时接入生产级 Agent 工作流快手 StreamLake 则以三位一体产品矩阵的姿态同时覆盖云端 API、开源权重与本地工具链。这些实践指向一个共同判断编程模型的竞争已经离开排行榜进入谁能以最低成本、最高可控性嵌入开发者工作流的阶段。开源权重 OpenAI 兼容接口 多框架支持 百万级长上下文构成了一整套面向私有化部署与 Agent 化改造的标准化接口。结语SWE-bench 卷到 73.4% 之后答案不是继续卷到 80%而是竞争维度本身发生了迁移从榜单分数转向行为可靠性异常工具调用率 0.28%、工程化协议工具调用与思考轨迹的结构化序列化、训练方法论层级奖励与专项惩罚的精细调校以及部署生态四框架兼容、百万级上下文、量化与边缘化落地。KAT-Coder-V2.5-Dev 这份开源权重恰好把下一站的答案写进了配置文件和模板里——当分数趋同能被复用的不是排行榜而是让模型在真实仓库、真实终端、真实工作流里稳定干活的工程能力。这或许才是 73.4% 之外国产编程模型真正开始卷的东西。【免费下载链接】KAT-Coder-V2.5-Dev项目地址: https://ai.gitcode.com/hf_mirrors/Kwaipilot/KAT-Coder-V2.5-Dev创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

摆锤冲击试验机全指南:原理、操作、故障排查与计量校准

摆锤冲击试验机全指南:原理、操作、故障排查与计量校准

1. 摆锤冲击试验到底在测什么:这台设备的真实应用场景JBS-300B/500B数显摆锤式冲击试验机这名字,行外人听起来就是一台“砸东西的机器”,但实际上它测的是金属材料最关键的一个力学指标——冲击吸收功。说得直白一点,就是用摆锤把…

2026/10/11 7:49:22 阅读更多 →
[智能体-370]:智能体架构实战:云端Web服务与终端应用程序的TaoToken统一接入

[智能体-370]:智能体架构实战:云端Web服务与终端应用程序的TaoToken统一接入

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 20:27:00 阅读更多 →
Hermes Agent 记忆容量如何管理?从 SQLite 到上下文压缩的 TaoToken 实践

Hermes Agent 记忆容量如何管理?从 SQLite 到上下文压缩的 TaoToken 实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 20:27:00 阅读更多 →

最新新闻

【AI 杂谈】只判断、不生成的模型,两周进了七家厂

【AI 杂谈】只判断、不生成的模型,两周进了七家厂

只判断、不生成的模型,两周进了七家厂 10 月 1 日,三家在同一天进场 2026 年 10 月 1 日,Perplexity 发布 pplx-decider-v1-27b,Cloudflare 发布 Clef 和 Clef-flash,AWS 旗下 Strands Labs 发布 Strands Decider 2B&a…

2026/10/11 10:46:21 阅读更多 →
ApexSQLLog2016 数据库日志分析实战:从慢查询到锁等待的故障排查

ApexSQLLog2016 数据库日志分析实战:从慢查询到锁等待的故障排查

简介:ApexSQLLog2016 是一款面向 SQL Server 数据库管理员与运维开发人员的日志恢复工具,主要用于在误执行 delete 或 update 后,借助数据库事务日志找回被修改或删除的数据,适用于数据误操作后的紧急恢复与审计排查场景。压缩包共…

2026/10/11 10:46:21 阅读更多 →
3天跑通LLaMA2预训练、微调与RAG全流程实操手稿

3天跑通LLaMA2预训练、微调与RAG全流程实操手稿

简介:本资源是Datawhale开源的《Happy-LLM:从零开始的大语言模型原理与实践教程》PDF电子书,面向具备基础Python和深度学习知识的NLP学习者、算法工程师及大模型入门研究者,旨在系统解决“原理难懂、代码难跑、训练难上手”的核心…

2026/10/11 10:46:21 阅读更多 →
《Windows核心编程》源码实战:解决系统级开发中的底层契约问题

《Windows核心编程》源码实战:解决系统级开发中的底层契约问题

简介:本资源是《Windows核心编程(第五版)》配套源码包,面向C/C中级开发者、系统编程学习者及Windows平台软件工程师,旨在通过可运行的工程实践,深入理解Windows API机制与底层系统行为。压缩包共240个文件&…

2026/10/11 10:46:21 阅读更多 →
信息系统项目管理师教程第四版深度拆解:过程组、WBS与干系人管理

信息系统项目管理师教程第四版深度拆解:过程组、WBS与干系人管理

简介:《信息系统项目管理师教程-第四版》是一本面向信息系统项目管理师考生及从业者的权威教程,紧扣项目管理知识体系(PMBOK),系统讲解启动、计划、执行、监控、收尾五大过程组,覆盖范围、时间、成本、质量…

2026/10/11 10:46:21 阅读更多 →
双极性四线步进电机控制:四拍、八拍与细分微步的时序本质与避坑指南

双极性四线步进电机控制:四拍、八拍与细分微步的时序本质与避坑指南

简介:这份资源面向单片机开发者、自动化设备调试人员及电机控制初学者,系统讲解双极性四线步进电机的驱动时序与控制方式,帮助解决整步、半步到细分微步的选型与实现问题。压缩包内共1个docx文档,约1.25MB,以图文形式整…

2026/10/11 10:45:20 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →