OpenAI Agent Builder和Evals将在11月30日下线:开发者迁移Agents SDK完整清单
文章摘要OpenAI已经明确Agent Builder和平台内Evals产品将在2026年11月30日后停止提供。对于仍依赖可视化工作流、平台数据集、Trace评分和自动化评测的团队这不是简单替换一个API而是需要重新梳理工作流定义、工具调用、状态管理、评测数据和上线治理。本文给出一套从资产盘点、代码化迁移、评测重建、双轨验证到最终切换的完整执行方案。一、哪些产品会受到影响OpenAI在AgentKit页面的更新说明中明确表示Agent Builder Evals将在2026年11月30日后停止提供。官方给出的迁移方向是需要以代码持续运行的工作流 → Agents SDK 更适合自然语言配置的业务场景 → ChatGPT中的Workspace Agents需要注意这并不等于以下能力全部消失Responses APIAgents SDKTool CallingFile SearchWeb SearchComputer UseChatKit模型API自己维护的评测系统。真正需要迁移的是建立在Agent Builder可视化编排和平台Evals产品之上的工作流与质量流程。二、为什么不能等到11月再迁移Agent Builder通常不只是画了几个节点它可能隐含了Prompt分支条件工具配置MCP连接Guardrail人工审批模型参数错误重试版本历史发布环境。Evals则可能保存测试数据集评分规则Trace模型对比Prompt版本人工标注自动评分结果。如果临近下线才开始迁移最容易发生找不到完整Prompt版本不知道某个节点为什么存在无法复现平台中的默认行为历史评测结果无法与新系统对齐新旧系统没有足够时间并行验证工具权限和密钥配置遗漏上线后才发现成本明显上升。建议把迁移拆成三个阶段7—8月资产盘点与目标架构 9—10月代码迁移与双轨运行 11月冻结旧系统并完成切换三、第一步导出工作流资产清单不要先写代码先形成完整资产表。建议每个Agent Builder工作流记录workflow_id workflow_name 业务负责人 技术负责人 当前模型 入口方式 节点数量 工具列表 MCP Server 数据源 Prompt版本 人工审批点 重试规则 超时 日调用量 单次成本 失败率 是否生产使用可以使用表格资产必须记录的内容PromptSystem、User模板、变量、默认值节点类型、输入、输出、分支条件工具名称、Schema、鉴权、风险等级数据File Search、向量库、连接器状态Thread、Session、Memory安全Guardrail、审批、敏感字段评测数据集、评分器、基线结果发布环境、版本、流量、回滚方案还应给工作流分级P0核心生产业务 P1内部高频使用 P2试点或低频 P3实验和废弃候选优先迁移P0和P1不要把时间浪费在已经没人使用的实验流程上。四、第二步把可视化节点转成代码组件迁移不是把整个画布写成一个超长函数。建议拆成Agent定义 Tool定义 Workflow编排 State模型 Guardrail Persistence Observability Evaluation一个最小的代码化结构agent-project ├── agents │ ├── classifier.py │ ├── researcher.py │ └── responder.py ├── tools │ ├── search_customer.py │ ├── query_order.py │ └── create_ticket.py ├── workflows │ └── support_workflow.py ├── guardrails │ ├── input_guard.py │ └── output_guard.py ├── evals │ ├── datasets │ ├── graders │ └── regression.py └── app.py每个可视化节点都应该回答输入类型是什么 输出类型是什么 是否可重试 是否有副作用 是否需要状态 失败后怎么办 是否需要人工确认五、分支条件不要继续依赖自然语言猜测Agent Builder中的分支可能由模型分类退款问题 技术问题 账户问题 其他问题迁移时应把输出改成结构化对象{category:REFUND,confidence:0.93,reason:用户明确要求退回已支付订单}然后使用确定性代码路由defroute_category(result:dict)-str:categoryresult[category]confidenceresult[confidence]ifconfidence0.75:returnhuman_reviewroutes{REFUND:refund_agent,TECHNICAL:technical_agent,ACCOUNT:account_agent}returnroutes.get(category,general_agent)不要把高风险流程建立在不可追踪的自由文本判断上。六、工具迁移时重点检查权限可视化平台可能替你完成了一部分连接配置但代码化后必须明确谁可以调用 可以操作哪些数据 参数范围是什么 是否有副作用 是否需要审批 如何幂等 如何审计工具定义建议增加元数据fromdataclassesimportdataclassfromenumimportStrEnumclassRiskLevel(StrEnum):LOWlowMEDIUMmediumHIGHhighdataclass(frozenTrue)classToolPolicy:name:strrisk_level:RiskLevel requires_confirmation:boolrequired_permissions:tuple[str,...]timeout_seconds:intmax_retries:int高风险工具包括支付退款删除数据修改权限创建外部订单发送正式邮件更新客户信息。模型只能提出调用建议最终授权必须由业务代码完成。七、状态与Memory需要单独设计迁移后不要把全部状态塞进Prompt。至少区分对话状态当前用户问题 最近几轮消息 当前语言 当前任务业务状态订单号 审批状态 任务进度 已完成步骤 工具执行结果长期记忆用户偏好 历史摘要 长期项目资料建议使用显式Statefromdataclassesimportdataclass,fielddataclassclassWorkflowState:trace_id:struser_id:strtask_status:strPENDINGcurrent_step:str|NoneNonecompleted_steps:list[str]field(default_factorylist)tool_results:dictfield(default_factorydict)需要跨请求恢复的状态应进入数据库或持久化Checkpoint而不是只保存在进程内存。八、如何重建Evals能力平台Evals下线后评测不能退回到“人工看几条回答”。建议建立四层评测1. 确定性校验适合JSON是否合法必填字段工具名称参数范围是否泄露敏感字段是否引用不存在的订单。2. 规则评分例如客服回答是否说明处理结果 是否给出下一步 是否包含禁止承诺 是否要求不必要的个人信息3. 模型评分适合评估相关性完整性忠实度语气推理质量。4. 人工抽检高风险业务必须保留人工评审。评测数据结构{case_id:CS-001,input:{message:我要取消订单A1001},expected:{intent:CANCEL_ORDER,requires_confirmation:true},forbidden:[未确认直接取消,修改其他订单]}九、Trace评测应该如何保留Agent质量不能只看最终回答。需要保存完整轨迹用户输入 → 模型决策 → 工具选择 → 工具参数 → 工具结果 → 下一步决策 → 最终回答建议记录trace_id workflow_version prompt_version model step_no tool_name arguments_hash tool_status latency_ms input_tokens output_tokens total_cost final_status可以分别计算任务完成率工具选择准确率参数准确率重复调用率人工接管率平均步骤数单任务成本P95耗时。十、新旧系统如何双轨验证不要直接关闭旧工作流。推荐影子运行真实请求 → 旧系统正常处理 → 同时复制给新系统 → 新系统结果不返回用户 → 比较两套轨迹和结果对比维度指标旧系统新系统任务成功率平均步骤数工具错误率平均成本P95耗时人工接管率当新系统连续达到目标后再逐步导流1% → 10% → 30% → 50% → 100%十一、迁移过程中最容易漏掉什么1. 默认Prompt可视化节点可能存在平台默认指令迁移后行为发生变化。2. 工具超时旧平台可能自动处理代码中却没有设置。3. 重试叠加HTTP层、工具层和Agent层同时重试成本迅速放大。4. 密钥权限迁移时直接复用高权限账户增加安全风险。5. 评测基线只保存平均分没有保存逐条结果无法定位退化。6. 版本映射不知道旧工作流版本对应哪个Prompt和工具版本。十二、建议迁移时间表7月下旬导出全部工作流标记P0—P3冻结无价值流程建立迁移负责人。8月完成目标架构迁移工具与权限重建State和Trace迁移首批P0工作流。9月建立评测数据集影子运行修复行为差异完成P1流程迁移。10月灰度切流完成成本和性能优化演练回滚停止新增旧平台流程。11月全量切换导出最终历史数据关闭旧凭证和连接完成审计归档。总结Agent Builder和Evals下线对生产团队而言不是一次简单的产品替换而是一次Agent工程治理重构。最稳妥的迁移方式是资产盘点 → 工作流代码化 → 权限重新设计 → 状态持久化 → 评测重建 → 影子运行 → 灰度切换越早开始双轨验证越能避免11月集中迁移带来的业务风险。

相关新闻

Wand-Enhancer:解锁WeMod高级功能的本地化增强方案

Wand-Enhancer:解锁WeMod高级功能的本地化增强方案

Wand-Enhancer:解锁WeMod高级功能的本地化增强方案 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer Wand-Enhancer是一款开源工具&#…

2026/7/25 18:40:20 阅读更多 →
如何解决Krita AI绘画插件中SD3模型CLIP文件缺失:终极完整指南 [特殊字符]

如何解决Krita AI绘画插件中SD3模型CLIP文件缺失:终极完整指南 [特殊字符]

如何解决Krita AI绘画插件中SD3模型CLIP文件缺失:终极完整指南 🎨 【免费下载链接】krita-ai-diffusion Streamlined interface for generating images with AI in Krita. Inpaint and outpaint with optional text prompt, no tweaking required. 项目…

2026/7/25 13:51:25 阅读更多 →
Codex CLI实战指南:AI编程代理的安装配置与核心使用技巧

Codex CLI实战指南:AI编程代理的安装配置与核心使用技巧

如果你是一名开发者,最近一定在各种技术社区和社交平台上频繁看到“Codex”这个词。它被描述为“AI编程代理”、“终端里的编程助手”,甚至有人称之为“Copilot的终端版本”。但当你真正想去尝试时,却发现官方渠道访问困难,安装过…

2026/7/21 18:36:55 阅读更多 →

最新新闻

FastFormers进阶教程:自定义NLU任务适配与模型调优指南

FastFormers进阶教程:自定义NLU任务适配与模型调优指南

FastFormers进阶教程:自定义NLU任务适配与模型调优指南 【免费下载链接】fastformers FastFormers - highly efficient transformer models for NLU 项目地址: https://gitcode.com/gh_mirrors/fa/fastformers FastFormers是一个高效的Transformer模型库&…

2026/7/26 21:30:15 阅读更多 →
spaCy与LLM在NLP任务中的高效集成实践

spaCy与LLM在NLP任务中的高效集成实践

1. 当传统NLP遇上大语言模型三年前我接手一个智能客服项目时,花了整整两周时间搭建基础的意图识别系统。如今借助spaCy和LLM的组合,同样的功能只需要几小时就能实现原型开发。这个领域正在发生怎样的变革?让我们从两个典型案例说起&#xff1…

2026/7/26 21:30:15 阅读更多 →
从命令行到API:tsc-watch的多场景应用案例

从命令行到API:tsc-watch的多场景应用案例

从命令行到API:tsc-watch的多场景应用案例 【免费下载链接】tsc-watch The TypeScript compiler with --watch and a new onSuccess argument 项目地址: https://gitcode.com/gh_mirrors/ts/tsc-watch tsc-watch是一款为TypeScript开发者设计的终极编译工具&…

2026/7/26 21:30:15 阅读更多 →
CiviCRM数据库架构深度解析:核心表结构与关系模型

CiviCRM数据库架构深度解析:核心表结构与关系模型

CiviCRM数据库架构深度解析:核心表结构与关系模型 【免费下载链接】civicrm-core CiviCRM (Core Application and Framework) 项目地址: https://gitcode.com/gh_mirrors/ci/civicrm-core CiviCRM是一款强大的开源客户关系管理系统,其数据库架构设…

2026/7/26 21:30:15 阅读更多 →
Jellium Desktop播放速度教程:轻松掌握视频播放速度控制技巧

Jellium Desktop播放速度教程:轻松掌握视频播放速度控制技巧

Jellium Desktop播放速度教程:轻松掌握视频播放速度控制技巧 【免费下载链接】jellium-desktop An unofficial desktop client for Jellyfin 项目地址: https://gitcode.com/GitHub_Trending/je/jellium-desktop Jellium Desktop是一款功能强大的Jellyfin非官…

2026/7/26 21:30:14 阅读更多 →
tsc-watch vs nodemon:为什么它是TypeScript项目的更好选择?

tsc-watch vs nodemon:为什么它是TypeScript项目的更好选择?

tsc-watch vs nodemon:为什么它是TypeScript项目的更好选择? 【免费下载链接】tsc-watch The TypeScript compiler with --watch and a new onSuccess argument 项目地址: https://gitcode.com/gh_mirrors/ts/tsc-watch 在TypeScript开发中&#…

2026/7/26 21:29:14 阅读更多 →

日新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/26 0:00:31 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/26 0:00:31 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/26 0:00:31 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/26 0:00:31 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/26 0:00:31 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/26 0:00:31 阅读更多 →

月新闻