技能应存进权重而非提示词?抽象技能与on-policy自蒸馏
最近越来越觉得很多模型“变笨”不是参数出了问题而是技能的存放位置选错了。明明同样是让模型先分析再回答写在提示词里的规则就是不稳定换到权重里的能力却更可靠。这篇题为Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation的研究正是在回答一个更底层的问题技能应该活在提示词里还是活在权重里。这个问题prompt engineering 做得越久越容易有体感。你花一个下午写好的 system prompt换一个模型版本效果可能直接打折你把 few-shot 示例喂得再全任务一变又得从头调。最近连 “weights” 相关的话题都开始频繁出现某种程度也说明行业关注点正在从“怎么把提示词说清楚”慢慢下沉到“模型参数里到底存了什么能力”。我对这个方向的判断是它不是要否定提示词而是试图把一类能力——抽象技能——从推理时的文本读取搬到训练时的参数固化。真正值得关注的地方不在于“能不能不用 prompt”而在于“能力获取的层级”变了。下面把标题拆开讲清楚。1. 提示词是“临时备忘录”权重才是“长期记忆”1.1 提示词为什么总让人不踏实Prompt 本质上是一份在推理时临时注入的声明。模型每次都要重新读它根据当前上下文来调整行为。这意味着几个天然限制提示词占用上下文窗口技能描述写得越长越挤占输入空间。提示词是概率性的激活换一种表达方式行为就可能漂移。提示词无法改变模型的先验知识它只能临时“唤醒”某种行为。在很多项目里这三点都是硬伤。尤其是 agent 类应用系统提示词里塞满了各种技能定义每次请求还要带一长串历史和工具描述推理成本和效果都受影响。技能不是被模型“拥有”的而是每次开会时被临时提醒的。开完会技能又还回去了。用一个生活化的类比教练在场边喊“注意观察后视镜”“变道前先打灯”这是提示词学员练了三个月之后不用人提醒也能自然完成这些动作那是权重。很多人把大量精力花在怎么把教练的话说得更响、更清楚却忽略了一个更根本的问题——训练量够不够技能有没有真正长在模型身上。1.2 权重中的技能是“会了”提示词只是“知道了”“知道了”和“会了”的区别决定了稳定性的差别。提示词再完美也只是让模型在当次生成时按规则执行而权重里的技能是模型在相关输入下自动触发的行为它不依赖外部提醒也不需要每次重新宣读。从训练机制看把技能放进权重的过程并不神秘本质是让模型在大量带技能标注的数据上做参数更新。只要训练数据分布足够贴近真实使用分布模型就会把“输入特征 → 技能触发 → 行为输出”这条路径固化进参数。之后哪怕你什么都不写它也会自然表现出这类技能。这里也能解释为什么很多团队对 prompt 越来越不放心prompt 可以随时改但也意味着行为随时可能变。权重一旦训练完成行为相对稳定代价是迭代周期变长。两种方案其实各有用处但如果你追求的是“长期稳定的能力”权重显然是更接近本质的位置。2. “抽象技能”和“具体任务”是两件不同的事为什么是技能而不是任务这决定了蒸馏出来的东西能不能迁移。2.1 技能是可迁移的能力任务是具体的目标具体任务是“做一道除法题”“写一段排序代码”。抽象技能则是“把复杂问题拆成子问题”“先检查输入边界再做操作”“在给出答案前做一次自检”。这些技能不绑定某个任务而是跨任务生效。这个区别在落地时非常关键。如果把蒸馏目标定成具体任务模型学到的是“这个输入的答案是什么”换一种问法就失效。如果把蒸馏目标定成抽象技能模型学到的是“遇到这类结构时应该如何组织推理过程”迁移性要好得多。一个典型的抽象技能清单可能是这样技能典型行为适用场景逐步分解把复杂指令拆成子步骤按序执行数学、代码、多步任务先验证后输出检查输入、边界、潜在错误再给答案代码生成、数据清洗、agent 工具调用结构化表达按固定格式输出保持字段完整数据抽取、接口返回自检修正生成后自查一遍发现并修复错误长文本、代码、推理上面这些技能如果你用提示词来教每一轮都要把定义重新写一遍如果用权重来教只要模型在训练中见过足够多“输入 → 技能 → 输出”的样例它就能内化。长期看维护成本反而更低。2.2 抽象技能在蒸馏中扮演“特权信号”论文标题里的 privileged signals说的是训练阶段可以拿到、推理阶段拿不到的信息。技能就是这一类训练时你知道这条样本体现的是“逐步分解”这个技能但推理时你不想依赖任何技能名的提示。模型必须在没有技能标签的情况下自己判断“这个问题需要分解”然后自动做到。这正是把技能做成权重而不是提示词的核心逻辑技能只出现在训练监督信号里不出现在推理输入里。就好比驾校教练在训练时不停提醒你“看后视镜”但你拿到驾照以后没人提醒你也会看。提醒的话是特权信号会看后视镜是长在身体里的能力。而“抽象”这个限定词同样重要。抽象技能比具体技能更容易跨任务迁移更不容易过拟合任务表面特征同时训练时只需要标注一个技能标签或一段简短描述标注成本相对可以接受。如果你把蒸馏目标换成“回答这道题的具体格式”那它就成了任务记忆失去了迁移价值。3. On-Policy Self-Distillation让模型在自己的分布里学习标题里最不好读的一块是 on-policy self-distillation。拆开就三件事蒸馏、自蒸馏、on-policy。3.1 自蒸馏为什么能成立知识蒸馏本来是用一个大模型或教师模型的输出分布去训练一个小模型或学生模型。传统蒸馏里教师往往是一个更强、更大或更稳定的模型。而“自蒸馏”里的教师和学生可以是同一个模型或者同一个模型的历史快照。这听起来有点绕模型本来就不会的东西向自己学能学到什么答案在于模型在一次生成中往往已经具备“表现出某个技能”的潜力只是不稳定。自蒸馏要做的是从自身输出里筛选出高质量的那一部分把它们变成训练数据再让参数更稳定地朝这个方向调整。换句话说它是在把“偶尔会”变成“每次都”。3.2 On-policy 的价值训练数据必须来自当前模型On-policy 这个词来自强化学习。它要求训练数据由当前策略生成而不是用一批别人采集好的固定数据。在自蒸馏场景里这意味着每个训练轮次模型先用自己的当前状态生成一批候选输出经过筛选后再训练自己。为什么不能直接用离线数据因为离线数据分布和当前模型行为之间可能存在漂移。如果数据来自一个已经迭代过的旧模型里面有些行为是新模型已经改掉的用它做蒸馏会把模型往回拉。用 on-policy 数据模型学到的是“在目前的参数状态下哪些输出更好、哪种技能该被强化”分布始终是对齐的。一个典型的 on-policy 自蒸馏循环长这样当前模型在任务集上生成候选输出。用规则、评测集或 LLM 评判筛选出高质量输出。给被选中输出打上技能标签特权信号。用这些数据做一轮蒸馏训练产生新模型。新模型继续生成进入下一轮迭代。这样每一轮模型都在“自己的输出中挑选更好的自己”作为老师再把自己变成更像这个老师的学生。如果不控制筛选质量模型很容易学到错误模式所以第 2 步是整个循环的成败关键。3.3 抽象技能在循环里起什么作用如果没有技能标签上面这个循环本质上是普通的自我训练模型只是记住哪些输出更受好评。而加入抽象技能作为特权信号之后训练目标就多了一个维度模型不仅要学“输出长什么样”还要学“当前输入触发了哪个技能、为什么要触发这个技能”。这让蒸馏出来的东西不再是样例层面的模仿而是技能层面的内化。打个比方普通自蒸馏是让模型看到“这道题你要这样答”带技能的蒸馏是让模型看到“这道题要用逐步分解的技能来答”。后者学到的是一套可复用的策略而不是一道题的答案。4. 特权信号在训练里的几种落地形态前面讲清楚了概念这一节具体聊聊技能标签作为特权信号在训练代码里到底长什么样。4.1 信号注入的几种常见方式从工程上看特权信号可以有不同

相关新闻

百度2019校招计算与存储系统笔试题解析:底层系统研发核心考点与备考思路

百度2019校招计算与存储系统笔试题解析:底层系统研发核心考点与备考思路

说句实话,看到这份“百度2019校招计算与存储系统研发工程师笔试题(第一批)”的时候,我第一反应是亲切,第二反应是——这玩意儿放到今天依然能打。虽然题目是2019年的,但计算与存储这个方向的基础考察逻辑&a…

2026/8/29 12:16:47 阅读更多 →
OLM转PST完整指南:从数据边界到验证归档的迁移实践

OLM转PST完整指南:从数据边界到验证归档的迁移实践

我前段时间帮一个朋友处理过这样一件事:他换了 Windows 电脑,以前的 Mac 上留着一个 .olm 文件,里面是几年的客户往来邮件、联系人、日历日程。他把文件拷过来,在 Windows 的 Outlook 里双击,没有任何反应。网上搜了一…

2026/8/29 12:16:47 阅读更多 →
Transformer+CNN实战:网络入侵检测系统源码与数据集解析

Transformer+CNN实战:网络入侵检测系统源码与数据集解析

简介:深度学习技术正在重塑网络安全防护的范式。传统入侵检测依赖规则匹配和手工特征,面对加密流量与变种攻击时力不从心。基于注意力机制的Transformer擅长捕捉长距离依赖,卷积神经网络则能高效提取局部模式,二者融合为流量异常识…

2026/8/29 12:15:47 阅读更多 →

最新新闻

PowerToys 文本提取器教程:如何把屏幕上的文字一键变成可复制文本

PowerToys 文本提取器教程:如何把屏幕上的文字一键变成可复制文本

PowerToys 文本提取器教程:如何把屏幕上的文字一键变成可复制文本 【免费下载链接】PowerToys Microsoft PowerToys is a collection of utilities that supercharge productivity and customization on Windows 项目地址: https://gitcode.com/GitHub_Trending/p…

2026/8/29 12:55:00 阅读更多 →
三块屏不再混乱:免费搞定多窗口排列的FancyZones快速指南

三块屏不再混乱:免费搞定多窗口排列的FancyZones快速指南

三块屏不再混乱:免费搞定多窗口排列的FancyZones快速指南 【免费下载链接】PowerToys Microsoft PowerToys is a collection of utilities that supercharge productivity and customization on Windows 项目地址: https://gitcode.com/GitHub_Trending/po/PowerT…

2026/8/29 12:55:00 阅读更多 →
Browser-Use AI浏览器自动化入门指南:从0到跑通你的第一个任务

Browser-Use AI浏览器自动化入门指南:从0到跑通你的第一个任务

Browser-Use AI浏览器自动化入门指南:从0到跑通你的第一个任务 【免费下载链接】browser-use 🌐 Make websites accessible for AI agents. Automate tasks online with ease. 项目地址: https://gitcode.com/GitHub_Trending/br/browser-use 早上…

2026/8/29 12:55:00 阅读更多 →
2026最值得关注的开源SEO工具OpenSEO:完整功能解析

2026最值得关注的开源SEO工具OpenSEO:完整功能解析

2026最值得关注的开源SEO工具OpenSEO:完整功能解析 【免费下载链接】open-seo Open source alternative to Semrush and Ahrefs 项目地址: https://gitcode.com/GitHub_Trending/op/open-seo OpenSEO 是一款开源的 SEO 工具,被称为 Semrush 和 Ah…

2026/8/29 12:55:00 阅读更多 →
Vue3加载条(LoadingBar)

Vue3加载条(LoadingBar)

效果如下图: 在线预览 APIs LoadingBar 参数说明类型默认值containerClass加载条容器的类名stringundefinedcontainerStyle加载条容器的样式CSSProperties{}loadingBarSize加载条大小,单位 pxnumber2colorLoading加载中颜色stringundefinedcolorFinis…

2026/8/29 12:55:00 阅读更多 →
FLAC格式播放不了怎么办?flac转mp3的简单方法实测记录

FLAC格式播放不了怎么办?flac转mp3的简单方法实测记录

使用背景与需求分析 相信不少朋友和我一样,收藏了很多无损音乐,尤其是FLAC格式的。音质确实好,但麻烦也不少:手机内存占得飞快,想发给朋友听听,结果对方设备不支持播放,或者车载音响根本不认这…

2026/8/29 12:54:00 阅读更多 →

日新闻

etc目录下的profile.d文件目录设置环境变量和全局脚本shell

etc目录下的profile.d文件目录设置环境变量和全局脚本shell

一、设置环境变量etc目录下的profile.d文件目录 /etc/profile.d1、编写 vi test.sh文件内容# jdk变量 export ZHK_HOME/root export PATH$PATH:$ZHK_HOME/test # 可以取出来ZHK_HOME变量给ZZZ_HOME赋值 export ZZZ_HOME${ZHK_HOME}/test2、刷新 执行source /etc/profile 命令使…

2026/8/29 0:00:24 阅读更多 →
【JavaScript】内存管理-垃圾回收机制-内存泄露

【JavaScript】内存管理-垃圾回收机制-内存泄露

内存管理 C 语言这样的底层语言一般都有底层的内存管理接口,比如 malloc()和free()。 而 JavaScript 是在创建变量(对象,字符串等)时自动进行了分配内存,并且在不使用它们时“自动”释放。释放的过程称为垃圾回收。 整…

2026/8/29 0:00:24 阅读更多 →
Labgrid-MCP:为嵌入式硬件实验室接入AI Agent操控能力

Labgrid-MCP:为嵌入式硬件实验室接入AI Agent操控能力

Labgrid-MCP 的目标是把 MCP(Model Context Protocol)能力延伸到真实嵌入式硬件实验室:AI Agent 通过一个标准化的 MCP Server,就能查看目标板状态、控制上电断电、复位开发板、读取串口日志,甚至执行镜像刷写。对于经…

2026/8/29 0:00:24 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/28 11:23:26 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/28 23:05:07 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/28 19:47:53 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/29 4:34:53 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/28 17:43:04 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/29 2:05:18 阅读更多 →