KAT-Coder-V2 技术报告精读:快手训练配方从 Dev 到 Pro 的演进
KAT-Coder-V2 技术报告精读快手训练配方从 Dev 到 Pro 的演进【免费下载链接】KAT-Coder-V2.5-Dev项目地址: https://ai.gitcode.com/hf_mirrors/Kwaipilot/KAT-Coder-V2.5-Dev2026 年 7 月快手 KwaiKAT 团队在发布 KAT-Coder-V2.5 之后随即开源了其权重版本 KAT-Coder-V2.5-Dev——一个总参数量 35B、仅激活 3B 的 MoE 代码模型并同步发布《KAT-Coder-V2.5 Technical Report》arXiv:2607.05471系统披露了从 KAT-Coder-V2 延续至今的后训练配方。这份报告最反直觉的论断是强编码 Agent 的瓶颈不在于模型规模而在于训练基础设施——可复现的执行环境、可验证的奖励信号与高价值的轨迹数据。本文结合技术报告全文与开源仓库源码拆解快手从开源 Dev 到闭源 Pro 的训练配方演进路径包括环境构建引擎、数据飞轮、RL 稳定性工程与多教师蒸馏并给出对复现者与竞品团队可操作的启示。一、报告的核心结论与新增能力报告开篇即定义了范式转移编码模型不再是被动的代码补全器而是能够在真实、可执行仓库内部自主行动的 Agent。这意味着能力被重新定义为仓库理解、工具调用、长程规划、工程纪律与验证驱动的问题求解的组合——而非仅仅生成语法正确的片段。围绕这一目标报告把 agentic capability 当作一个系统问题而非数据或参数量问题给出了三层新增能力。1. 环境规模引擎 AutoBuilder把真实仓库变成可验证任务从真实 PR/commit 挖掘训练任务的最大障碍是原始 issue 文本往往含糊、残缺、与最终合并的改动不一致而仓库环境又难以规模化复现。报告的解法是可验证任务三元组精确的任务描述 可执行的仓库环境 一组验证测试。AutoBuilder 是一个沙箱化的构建—验证循环构建 Agent 分析仓库并生成配置脚本验证 Agent 在隔离沙箱中执行脚本且不以命令退出码或表面日志为准而是解析结构化测试框架输出——只有当超过 90% 的预期测试被收集且通过/失败结果可跨次复现时环境才被接受。失败的结构化信息会反馈给构建 Agent 迭代修复。为了规模化AutoBuilder 组合了预配置基础环境、语言与构建系统模板以及从成功配置中蒸馏出的可检索构建配方库将环境构建成功率从16.5% 提升到 57.2%最终产出12 种语言、超过 10 万个可验证环境。同时报告还刻意移除了 git 历史、commit 元数据等可能泄露参考解法的痕迹确保 Agent 只能从任务描述、仓库状态与可执行测试出发解题。2. 数据飞轮从最终奖励到过程质量只用最终测试通过率筛选轨迹是误导性的有些通过的轨迹依赖硬编码或绕过机制而有些失败的轨迹反而包含有价值的搜索、定位与修复行为。数据飞轮包含三个组件Hint-Boosted Rollout对差一步成功的轨迹注入过程级提示如检查某个文件将原先零通过率任务的成功率提升到约 20%随后固定已验证的 patch在无提示条件下重新生成轨迹确保训练数据与推理分布一致。Process-Score-Driven Filtering用规则门控 启发式过程评分从探索、定位、规范匹配、patch 最小性、验证质量等维度筛除通过但低质量的轨迹。Harness Rewriting随机化工具名、参数约定、输出格式与提示模板注入缺失依赖、瞬时命令失败等真实扰动迫使模型学到与 harness 无关的解题策略。3. RL 稳定性工程与多教师蒸馏RL 侧的新增能力最为密集引入白盒 harnessmini-swe-agent低噪声与黑盒 harnessClaudeCode、Codex、OpenClaw 等贴近真实部署分布的Harness Scaling将沙箱反馈错误率从约16% 压到 2% 以下采用带 hindsight 增强价值估计的非对称 Actor-Critic PPO——Critic 在训练时能看到最终奖励、测试结果、patch 差异等特权信息而 Actor 只观察正常交互历史推理时仅部署 Actor并设计了核心任务得分 标准行为约束 失败轨迹激励的三层规则奖励辅以经专门 RL 训练的 GRMgenerative reward model做轨迹级评判。最后报告用Multi-Teacher On-Policy DistillationMOPD将软件工程、Claw 工具使用、终端、Web Coding、通用知识五个领域专家在函数空间融合为单一学生模型配合 off-policy cold start 与 drift-aware dynamic truncation缓解了权重空间合并常见的跷跷板效应。基准结果是PinchBench 94.9 居首SWE-Bench Pro 65.2 与 KAT Code Bench 53.1 均仅次于前沿通用模型 Opus 4.8。二、Dev 与 Pro同一配方的开源投影与关键分叉开源仓库的 README.md 明确写道Dev 版本largely follows the post-training recipe of KAT-V2.5数据构建、训练管线、优化策略基本不变以社区广泛认可的 Qwen3.6-35B-A3B 为基座先在 127K 样本上做 SFT再对 SFT 模型进行 RL 训练。这意味着 Dev 与 Pro 共享同一套配方骨架但存在三处分叉恰好是配方如何迁移到新基座的活教材。1. 基座差异引发的奖励适配报告中关于 Dev 的章节披露了一个极具工程价值的细节Qwen3.6 的轨迹模式与 KAT-V2.5 时期不同简单的 0–1 二值奖励在第二个 epoch 就导致模型坍塌。对训练轨迹的分析显示随着训练推进模型越来越倾向在单轮内发起大量并行工具调用——偶尔超过 70 次导致上下文快速膨胀、产生大量无效轨迹与执行错误最终使 RL 训练失稳。为此团队在原有层级奖励之上为 Qwen3.6 增加了若干针对性惩罚单轮过度并行工具调用、失败的工具调用、空工具调用块、大量重复内容。这些适配使训练稳定跑满 10 个 epoch——**奖励设计必须针对基座模型的性格behavioral patterns**是这份配方最可迁移的教训。2. RL 训练的可见成效README 报告了两项异常行为优化的硬数据异常工具标签从9.34% 降至 0.28%-9pp单轮连续重复从 0.34% 降至 0%。仓库自带的训练曲线图注明了 y 轴含义——每批次样本中通过单元测试的比例1 为通过0 为失败展示了 RL 全程的稳步上升趋势3. 开源投影纯语言模型权重多模态不可用Dev 与 Pro 最直接的产品差异在发布形态开源版只发布语言模型权重作为纯文本模型运行视觉/多模态组件不包含且不可用。这一点在仓库中可以得到源码级印证——config.json 中architectures为Qwen3_5MoeForConditionalGenerationmodel_type为qwen3_5_moe仍保留了vision_config、image_token_id248056与video_token_id248057等字段但推理时必须显式跳过视觉编码器vLLM 部署要求--language-model-only标志SGLang 也提示若加载时尝试构建多模态组件可能因缺少视觉权重而启动失败。仓库的权重布局进一步印证了纯语言模型的定位model.safetensors.index.json的weight_map全部指向model.language_model.*embed_tokens、40 层 transformer、每层 256 个专家的 gate/up/down 投影等13 个 shard 合计约 69.3GBbf16。架构细节同样来自 config.jsonnum_experts256、num_experts_per_tok8即 35B 总参、3B 激活的由来、hidden_size2048、max_position_embeddings262144且layer_types采用 3:1 混合的 linear_attention 与 full_attention 交错布局。三、从配置与模板看为 Agent 而生的工程细节Dev 的Agent 原生属性不只体现在训练配方上也写进了推理配置与对话模板里这些在 README.md 与仓库配置文件中都有直接对应。解码配置generation_config.json 中temperature1.0、top_p0.95、top_k20eos_token_id为[248046, 248044]——保留了思维与结尾的双终止符设计与 Qwen 风格一致。工具调用协议chat_template.jinja 完整定义了tool_call/function.../parameter...的 XML 风格调用格式与tool_response回包封装并实现了两个对 Agent 场景至关重要的开关enable_thinkingFalse可进入无思考的直答模式preserve_thinkingTrue可保留历史消息的思维链——README 说明该能力在多轮 Agent 场景中能提升决策一致性、减少冗余推理并优化 KV cache 利用率。模板中甚至包含 multi-step tool 的tool_response包裹校验逻辑确保工具结果不被当作独立用户查询处理。超长上下文原生支持 262,144 token 上下文README 给出通过 YaRNrope_type: yarn、factor: 4.0、original_max_position_embeddings: 262144将max-model-len扩展到101 万 token的完整配置覆盖 vLLM、SGLang、KTransformers 等框架——这是长程仓库级任务多文件定位、长对话压缩的刚需。评估透明性README 给出了可复现的评测协议——SWE-bench 系列采用claude_code2.1.195harness、passk1、temperature1.0、256k 上下文Terminal-Bench 2.1 采用 terminus-2 与 claude_code 双 harness 取平均PinchBench 采用openclaw2026.3.13。在这一统一协议下Dev 取得 SWE-bench Verified69.40、SWE-bench Multilingual63.00、SWE-bench Pro45.96、Terminal-Bench 2.141.02、PinchBench93.43、Scicode44.20、KAT-Code-Bench46.21全部高于同量级对比组Qwen3.5-27B、Qwen3.6-35BA3B、Gemma4-31B、Ornith-1.0-35B 等。值得注意的是README 还主动披露了评估偏差来源对 Qwen3.6-35BA3B 的自测结果与官方存在约 10pp 差距归因于 harness 版本与官方测试集优化对 Qwen3.5-35BA3B 与 Gemma4-26B-A4B 观察到在评测环境不可用的 MultiEdit 工具上的幻觉调用。这些备注把模型能力与harness 适配解耦恰恰是严谨的基准比较该有的样子。四、对复现者与竞品团队的三点启示启示一先修环境再调算法报告中最容易被低估的数字是沙箱反馈错误率早期约16%的轨迹至少包含一次环境自身导致的失败磁盘打满触发 GC 超时、环境变量覆盖导致 verifier 误判、单个沙箱边界错位可使后续约 40 步观测为空。团队最初把训练坍塌归因于 RL 算法本身投入大量精力调超参后才定位到环境问题。对任何复现者而言这条教训的优先级高于算法选型在奖励信号不干净之前任何 RL 算法都救不回来。AutoBuilder 给出的路径也很明确——用结构化测试解析 跨次可复现替代退出码 日志把环境构建本身做成一个可迭代的系统模板库 配方检索成功率可以从 16.5% 拉到 57.2%。启示二奖励设计要读基座模型的性格Dev 的训练历史提供了最直观的证据同样的配方换一个基座Qwen3.6简单的 0–1 奖励第二个 epoch 就崩而加入针对单轮并行工具调用过多、空工具块、重复内容、失败调用的惩罚后稳定跑满 10 个 epoch。这印证了报告提出的三层奖励结构的设计哲学——顶层核心任务得分锚定目标并防 reward hacking必须同时通过 fail-to-pass 与 pass-to-pass 测试中层行为约束全程规范化工具使用底层失败轨迹激励文件搜索 F2 得分、单元测试部分通过率把失败样本也变成有效学习信号。对竞品团队来说奖励系统应当作为针对模型病理行为的监控器 调节器来持续维护而不是一次性写死的公式。启示三开源的边界就是复现的边界对想复现 Dev 的团队README 与仓库已经划清了边界开源的是纯语言模型权重部署需显式--language-model-onlyvLLM或等效选项SGLang训练侧配方TITO token 一致性、TIS 截断重要性采样、可靠沙箱、层级奖励在 README.md 中均有描述但完整的环境构建与轨迹生成基础设施AutoBuilder、KwaiClawEnv属于 Pro 侧的系统能力未随权重开放。因此理性的复现路径是以 Qwen3.6-35B-A3B 为基座先复刻 SFT 127K 两阶段 RL 的骨架再依据自己基座的轨迹模式定制奖励惩罚项最后用 README 给出的统一评测协议同一 harness、passk1、256k 上下文来度量差距——而非期待直接拿到与 Pro 等价的完整系统。结语从 KAT-Coder-V2 到 V2.5快手把编码模型的后训练从喂数据、调损失升级为造环境、修信号、稳 RL、融专家的系统工程而 V2.5-Dev 的开源则把这套配方中最可迁移的部分——奖励适配的教训、评测的透明化、Agent 原生的推理与模板设计——以可下载、可运行、可对照的形态交付给了社区。对从业者而言这份报告最有价值的也许不是某个具体分数而是那句贯穿始终的判断当环境可复现、奖励可验证、轨迹可筛选时编码 Agent 的能力上限将由工程系统的质量决定而非参数规模。【免费下载链接】KAT-Coder-V2.5-Dev项目地址: https://ai.gitcode.com/hf_mirrors/Kwaipilot/KAT-Coder-V2.5-Dev创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Python类的定义和使用详情

Python类的定义和使用详情

前言 写一个能用的类不难,写一个"经得起扩展"的类却需要理解不少语法细节:class 语句的完整形式、类文档串(docstring)的位置、构造函数的约束、继承与方法重写、以及双下划线开头的名字为什么会"消失"。 常见…

2026/10/10 19:25:02 阅读更多 →
Python线程编程之Thread详解

Python线程编程之Thread详解

前言 threading.Thread 是多线程编程的入口类,但很多人只用了它的 start() 和 join(),对构造函数里那几个参数、run() 与 start() 的分工、ident 与 native_id 的区别、异常到底去了哪里,都是模糊的。结果是遇到「线程静默退出」「异常看不见…

2026/10/10 19:25:02 阅读更多 →
论文降重工具怎么选?五款实测对比与查重原理全解析

论文降重工具怎么选?五款实测对比与查重原理全解析

1. 先搞清楚查重系统怎么工作,再谈降重工具怎么选1.1 标红规则:连续多少字符一样会被判重论文降重大概是硕博阶段最容易被低估的一件苦差事。头一回把初稿提交到学校指定的查重平台,看到接近30%的重复率,很多人整个周末都在重写。…

2026/10/10 19:25:02 阅读更多 →

最新新闻

一天 13 篇教程同刷 CSDN:Ever Gauzy 为什么突然在国内爆火?

一天 13 篇教程同刷 CSDN:Ever Gauzy 为什么突然在国内爆火?

一天 13 篇教程同刷 CSDN:Ever Gauzy 为什么突然在国内爆火? 【免费下载链接】ever-gauzy Ever Gauzy™ - Open Business Management Platform (ERP/CRM/HRM/ATS/PM) - https://gauzy.co 项目地址: https://gitcode.com/GitHub_Trending/ev/ever-gauzy…

2026/10/10 22:33:18 阅读更多 →
OPC UA本地测试实战:从模拟服务器到客户端脚本排查

OPC UA本地测试实战:从模拟服务器到客户端脚本排查

简介:面向OPC UA开发与系统集成场景的本地测试工具,可同时模拟服务器与客户端,帮助工程师在没有真实设备的情况下验证节点配置、数据读写及安全通信机制,适合工业自动化、设备互联与协议调试的中高级使用者。压缩包共4个文件&…

2026/10/10 22:33:18 阅读更多 →
Codex连更28天:日更节奏下的功能演进与工程落地实践

Codex连更28天:日更节奏下的功能演进与工程落地实践

1. 这场“连更28天”到底在卷什么1.1 从标题拆出来的三个核心信号先把标题拆开看。“Codex 连更 28 天”说的是一个明确的节奏承诺:连续 28 天,每天都有新东西落地,不是修修补补的补丁,而是能被用户直接感知的功能更新。“每天不上…

2026/10/10 22:32:18 阅读更多 →
323.Fastboot/Recovery 双协议实战,解决 OTA 升级失败核心问题

323.Fastboot/Recovery 双协议实战,解决 OTA 升级失败核心问题

摘要 本文面向具备一定计算机基础的开发者与维修工程师,系统阐述安卓手机刷机与维修的底层原理。文章从Android分区表结构、Bootloader引导流程、Fastboot与Recovery协议入手,结合高通与联发科平台的实际案例,提供完整的命令行操作流程与可运行脚本。内容涵盖解锁BL、刷入第…

2026/10/10 22:32:18 阅读更多 →
SpringBoot校园志愿者管理系统:业务闭环与并发控制的完整实践

SpringBoot校园志愿者管理系统:业务闭环与并发控制的完整实践

校园志愿者管理系统,算是我在SpringBoot方向里做得最完整的一个项目。最初接手时我以为它就是个普通的增删改查,真正动手之后才发现,从活动发布、志愿者报名、签到签退到服务时长统计,整个业务链条里藏着不少需要仔细设计的地方。…

2026/10/10 22:32:18 阅读更多 →
手把手:3 步把插件提交进 Claude 官方目录,让全球开发者搜到你

手把手:3 步把插件提交进 Claude 官方目录,让全球开发者搜到你

手把手:3 步把插件提交进 Claude 官方目录,让全球开发者搜到你 【免费下载链接】claude-plugins-official Official, Anthropic-managed directory of high quality Claude Code Plugins. 项目地址: https://gitcode.com/GitHub_Trending/cl/claude-pl…

2026/10/10 22:32:18 阅读更多 →

日新闻

卫星轨道分类全解析:从LEO到GEO的选型逻辑与工程实践

卫星轨道分类全解析:从LEO到GEO的选型逻辑与工程实践

1. 从“卫星轨道分类”这个标题说起:为什么值得花时间搞懂第一次接触“卫星轨道分类”这个概念,很多人会觉得它离自己很远——不就是天上的星星怎么转吗?但如果你正在做航天任务规划、遥感数据接收、星座设计,甚至只是准备一场航天…

2026/10/10 0:00:39 阅读更多 →
Spring AOP 核心原理与实战:从概念到日志切面落地

Spring AOP 核心原理与实战:从概念到日志切面落地

1. 从一个真实痛点说起:为什么你的代码里到处都是重复逻辑刚入行那会儿,我写过一个用户管理模块,注册、登录、改密码、注销四个接口。每个接口里都塞了几乎一样的日志打印、参数校验、事务开启和提交。当时觉得没什么,能跑就行。直…

2026/10/10 0:00:40 阅读更多 →
Python招聘数据采集与分析可视化:从采集清洗到薪资技能城市可视化全链路

Python招聘数据采集与分析可视化:从采集清洗到薪资技能城市可视化全链路

简介:这是一套面向计算机相关专业学生与项目实战学习者的Python数据采集与分析可视化完整项目,以Boss直聘岗位数据为对象,适合用作毕业设计、课程设计或期末大作业。资源包共38个文件,约246KB,以13个py源码文件为核心&…

2026/10/10 0:00:40 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 11:14:25 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 1:36:08 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 11:14:58 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →