当AI开发从单个Agent走向多Agent团队后一个新的问题开始出现不同Agent虽然使用相同模型却不一定采用相同的工作方式。负责开发的Agent可能偏向快速实现。负责测试的Agent可能只运行局部用例。负责代码审查的Agent可能采用另一套质量标准。同一个任务交给不同Agent可能出现代码风格不一致测试流程不一致交付格式不一致对修改范围的理解不同对“任务完成”的判断不同团队规范需要反复重新说明。真正的问题已经不只是Agent会不会完成任务而是多个Agent能不能按照同一套工程规则稳定工作这正是Skills开始变得重要的原因。OpenAI目前将Skills描述为一种可复用能力它可以把指令、参考资料、资源和可选脚本组合起来让ChatGPT或Codex在不同任务中可靠地重复同一套工作流。从系统角度看Skills不只是更长的提示词。它正在成为AI团队的“工程记忆”。一、普通提示词为什么难以支撑长期协作使用Codex完成单次任务时开发者通常会在提示词中说明要修改什么哪些文件不能动需要运行哪些测试最终怎样提交结果。这种方式在短任务中有效。但任务数量增加后团队需要不断重复同样的要求不修改公开接口。不随意升级依赖。修改后必须运行回归测试。输出变更文件和风险说明。遇到数据库调整时暂停确认。这些要求可能分散在聊天记录项目文档README团队规范个人经验历史任务中。每次重新复制不仅效率低还容易遗漏。更麻烦的是不同开发者写出的提示词并不完全相同。于是同一套团队规则会在传递过程中不断变形。提示词适合表达当前任务。Skills更适合保存可重复的工作方法。二、AI团队真正缺少的是组织记忆传统软件团队会通过以下方式保存工程经验编码规范测试流程发布清单架构文档安全要求Code Review标准故障处理手册。这些内容让新成员进入团队后不需要完全依赖口头传授。但AI Agent不会自动理解团队所有隐性规则。它可能知道一种通用最佳实践却不知道当前项目为什么不能升级某个依赖为什么旧接口必须保持兼容哪些测试属于合并前必测项哪些目录禁止自动修改团队要求使用什么交付格式遇到什么情况必须停止执行。如果这些规则只存在于人的经验中每个Agent都需要重新学习。Skills的价值就是把隐性经验转化成Agent可以重复调用的工程能力。三、Skills与项目文档有什么区别项目文档主要解决团队需要知道什么Skills更关注Agent遇到特定任务时应该怎样行动例如一份测试文档可能介绍项目使用哪些测试框架测试文件放在哪里不同测试的运行方式。而测试Skill可以进一步规定先识别受影响模块运行对应单元测试检查是否存在跳过用例再运行关键回归测试汇总失败原因不允许为了通过而降低断言按固定格式提交测试证据。文档提供知识。Skill把知识转化成可执行流程。两者不是互相替代。而是文档负责保存背景Skill负责组织行动。四、一个可靠的Skill应该包含什么Skills并不只是保存一句固定指令。根据当前官方文档它可以组合指令、资源、参考内容以及可选脚本用于重复执行特定工作流。从工程角度看一个可靠的Skill至少可以包含以下部分。1. 使用场景明确什么时候应该调用。例如修改核心业务代码后提交合并请求前涉及权限模块时需要执行安全检查时。2. 执行步骤说明任务的固定顺序。例如读取变更↓判断影响范围↓检查业务逻辑↓运行测试↓输出风险报告3. 工程约束明确不能做什么。例如不删除现有测试不降低原有断言不修改任务范围外的文件不自动操作生产环境不在没有证据时宣布完成。4. 参考资源可以包括项目规范接口文档测试说明安全规则输出模板。5. 完成标准规定最终需要提交变更文件执行命令测试结果剩余风险人工确认事项。Skill不是告诉Agent“尽量做好”。而是把“做好”的标准写成可重复执行的流程。五、多Agent团队为什么更需要Skills单个Agent偶尔偏离规范开发者还可以及时纠正。但多个Agent并行工作时规则不一致会迅速放大。例如开发Agent认为只要功能实现就可以完成。测试Agent认为局部测试通过就足够。审查Agent不知道团队禁止新增某类依赖。文档Agent使用了与项目不一致的术语。单独看每个Agent都完成了自己的任务。组合起来却可能形成无法直接交付的结果。Skills可以为不同Agent提供统一底线相同的代码规范相同的测试要求相同的交付格式相同的风险边界相同的停止条件。Agent可以有不同角色。但不能拥有完全不同的工程标准。六、Skills让团队规范从“提醒”变成“能力”传统提示方式通常是记得检查安全问题。这只是一条提醒。一个安全审查Skill则可以规定检查输入验证检查身份认证检查权限边界检查敏感信息检查错误信息暴露检查新增依赖风险输出发现位置和风险等级。前者依赖Agent临时理解。后者形成稳定流程。当规则被写成Skill后团队规范不再只是文档中的要求。而会成为Agent可以调用的实际能力。七、ChatGPT适合把隐性经验整理成Skills很多团队知道自己有一套工作方法但没有完整写下来。例如资深开发者可能凭经验判断哪类代码必须重点审查哪些测试失败不能忽略哪些改动容易影响兼容性什么情况下应该立即停止任务。这些知识通常分散在人的经验中。ChatGPT可以帮助团队访谈并整理现有流程找出重复出现的任务步骤把模糊经验转化成明确规则补充输入、输出和停止条件形成结构化Skill草案。ChatGPT在这里承担的不是工程执行。而是知识整理和规则设计。八、Codex负责把Skills应用到真实项目Codex的价值在于它可以把这些规则带入实际代码库。例如调用代码审查Skill后Codex可以查看本次代码差异识别影响模块对照项目规范运行指定测试搜索潜在风险按团队模板输出结果。OpenAI目前强调Skills可以帮助Codex在不同任务中一致应用团队的标准、工作流和工作方式减少每次任务都重复粘贴流程与要求。这意味着Codex不只是“知道规则”。还可以在工程环境中执行规则。九、Pro场景需要管理更大的Skill体系对于少量简单任务一个或两个Skills可能已经够用。但在更高频、更复杂的Pro协作场景中团队可能逐渐形成代码库分析Skill功能开发Skill单元测试Skill安全审查Skill性能检查Skill文档更新Skill发布前检查Skill故障复盘Skill。这时新的问题也会出现不同Skills是否存在重复哪个Skill优先级更高同一任务应该调用几个Skills规则冲突时以谁为准Skill更新后如何保持版本一致已失效的规范怎样退出。因此Skills数量增加后也需要治理。不能把所有经验都写成一个巨大的Skill。也不能为每个微小动作都创建独立Skill。更合理的结构通常是通用工程规则特定任务流程项目专属约束十、Skills不能替代人工判断Skills能够提高一致性但不能解决所有问题。它可能保存的是过时规则。也可能把不合理流程重复执行得更加稳定。例如旧架构约束已经失效测试流程没有覆盖新业务安全规范没有及时更新多个Skills之间出现冲突当前任务属于规则之外的特殊情况。因此团队仍然需要定期检查Skill是否仍然有效执行结果是否符合真实目标是否出现机械套用是否需要人工覆盖规则。工程记忆需要被维护。否则记忆也可能成为历史负担。十一、未来团队的竞争力可能藏在Skills里当不同团队都能使用相近的模型和Codex能力后模型本身的差距可能不再是唯一决定因素。真正拉开差距的可能是团队沉淀了什么如何拆分任务如何分析代码库如何控制修改范围如何验证结果如何审查风险如何处理失败如何完成交付。这些经验过去主要存在于资深工程师的大脑里。未来它们可能逐渐被整理成可复用规则可执行流程可版本管理的Skills可被多个Agent共同调用的团队能力。模型可以被所有人使用。但团队独有的工程方法需要长期积累。结语多Agent团队解决的是任务分工和并行执行。Skills解决的是不同Agent怎样保持统一标准。ChatGPT可以帮助团队整理经验、设计规则和构建工作流。Codex可以把这些Skills应用到代码库分析、开发、测试和审查中。Pro支撑的则是更高频、更复杂、更长期的Agent协作场景。未来AI团队真正需要保存的不只是聊天记录和任务上下文。还包括怎样分析。怎样执行。怎样验证。怎样停止。怎样交付。当这些经验能够被稳定复用时Skills就不再只是辅助功能。它会逐渐成为AI团队的工程记忆。