【AI大模型】Self-Instruct 技术:让模型自己教自己写在前面:给模型一本“新教材”让它自学上一课我们讲了用 GPT-4 这类强模型生成合成数据。这一课的 Self-Instruct(自我指令)是更进一步的思路:不依赖外部强模型,而是让“当前这个模型自己”生成指令和回答,再用这些数据微调自己。听起来像“自己给自己出题再做题”,但其中有关键的质量控制机制,避免模型“教歪自己”。本文讲透 Self-Instruct 的完整流程:种子指令 → 生成新指令 → 生成回答 → 过滤去重 → 微调。全文代码可直接运行,让你真正跑通“模型自己教自己”。一、Self-Instruct 的核心思想Self-Instruct 最早由斯坦福团队提出,用于给基础模型“无中生有”地造出指令微调数据。它的流程像一个自举循环:起点——手工准备一小批“种子指令”(通常几十到一百多条),作为范例。扩写——让模型基于种子指令,批量生成更多、更新的指令。补答——让模型为每条新指令生成标准回答。过滤——去重、去劣、滤掉与已有指令重复或不合规的内容。微调——用这批高质量数据微调模型,得到增强版本。一句话:Self-Instruct 让模型在“自己生成的教材”上自我提升,关键是把住质量关。二、为什么模型能“自己教自己”你可能会怀疑:模型自己都不懂,怎么教自己?关键在于“教”的内容是它从预训练中学到的既有知识,而非新知识。模型知道