模型不再是护城河:Agent 下半场,拼的是「工程中间层」
2026-07-21 周二 · 技术评审日札 今天的新闻像一摞摆上评审桌的招标材料。我把它们逐条拆开结论很直接单模型能力已经退居底座能不能编排、能不能评测、能不能规模交付的「工程中间层Harness」才是 Agent 下半场的真实门槛。0. 开场今天这批材料考的不是模型WAIC 2026 在 7 月 20 日正式闭幕。回头看这一周一个变化比任何参数都值得记一笔展馆里讨论最多的不再是我的模型多少参数、排第几而是部署了多少、完成率多少、客户反馈如何。落到工程上这意味着竞争重心从模型层平移到了模型之上的编排/运行/评测/交付层——也就是业内开始叫的 Harness工程中间层。今天几条新闻恰好把这一层拆成了四块拼图运行层英伟达、算力层无问芯穹、交付层容联云、评测层学界呼吁。外加一个反面教材谷歌 Chrome 静默装模型提醒我们可信任是这一切的前提。下面逐条过材料、给 verdict。1. 信号一 · 运行层英伟达 Agent Toolkit把部署从「数天」压到「30 分钟」英伟达为搭载 GB300 的 DGX Station 工作站发布了Agent Toolkit三步、约 30 分钟即可在桌面端跑通一个 AI 代理并能联动 Omniverse 驱动 3D 仿真工作流。意义不在于又出了个工具而在于它把原本数天的环境配置压缩成半小时——这是 Harness 开箱即用的标志性动作。算力厂商开始向软件生态伸手本质是帮用户把能不能跑起来这件事标准化。# 以 NVIDIA Agent Toolkit 思路把配环境 → 跑 Agent压缩为 3 步 from pathlib import Path class LocalAgentRuntime: def __init__(self, model_path: str, tool_dir: str): self.model Path(model_path) # 本地权重避免云端审批 self.tools Path(tool_dir) # 工具目录Omniverse / 3D 仿真等 self.agents: list[dict] [] def bootstrap(self) - None: # 1. 挂载本地模型 assert self.model.exists(), 本地权重缺失 # 2. 注册工具函数 / 仿真 / API for t in self.tools.glob(*.tool.json): self.agents.append({tool: t.stem, status: ready}) # 3. 30 分钟内跑通第一个 Agent 任务 print(fruntime ready with {len(self.agents)} tools) if __name__ __main__: rt LocalAgentRuntime(weights/model.bin, ./tools) rt.bootstrap()环节传统自建Agent Toolkit压缩比环境配置2–4 天 30 分钟~50×工具接入手动逐个集成预置模板注册—首次跑通数天1 次会话内—Verdict运行层的开箱即用是下半场入场券方向正确。2. 信号二 · 算力层无问芯穹 Agentic Infra要把 Token 成本再砍 10 倍WAIC 现场无问芯穹揭晓了前店后厂一中心自进化智能体算力基础设施Agentic Infra定位算力集散中心 Token 工厂 AI 生产力商店目标把 Token 成本再降 10 倍。这把 Harness 的底座标准化了当算力被当作可调度、可计价的工厂资源Agent 规模化运行的边际成本才会线性下降。# Agentic Infra 抽象算力集散中心 Token 工厂 class TokenFactory: def __init__(self, unit_cost: float, discount: float 10.0): self.unit_cost unit_cost # 单 Token 基准价 self.discount discount # 目标再降倍数 def quote(self, tokens: int) - float: return self.unit_cost * tokens / self.discount # 跑一次规划-执行-校验闭环的边际成本 factory TokenFactory(unit_cost0.00012, discount10.0) cost factory.quote(tokens1_200_000) # 一次中等复杂任务 print(f闭环边际成本: ${cost:.4f}) # 成本随基础设施标准化线性下降模块定位作用前店AI 生产力商店对外交付 Agent 能力后厂Token 工厂标准化批量推理一中心算力集散中心统一调度与降本Verdict把算力当工厂经营是规模化之前的必答题。3. 信号三 · 交付层容联云全栈 Agent 化94% 完成率证明能交付容联云在 WAIC 发布企业 Agent 全栈战略覆盖 Voice Agent、质检 Agent、私域运营 Agent 等矩阵。两份成绩单很硬Voice Agent在某银行场景日均通话超 2 万通任务完成率94%私域运营 Agent独立管理超8 万客户经营规模增长87%。这组数据的关键不在用了 Agent而在它把 Agent 放进了有验收标准的生产流程——有明确的完成率、有明确的客户规模、有明确的可比增长。这才是 Harness 可规模交付的实证。产品落地场景核心指标Voice Agent某银行外呼日均 2 万 通话完成率 94%私域运营 Agent企业客户运营独立管理 8 万 客户经营 87%Verdict没有验收指标的 Agent 落地都是 PPT有完成率的才是真交付。4. 信号四 · 评测层学界呼吁重构评测可评测才能可信任人机与认知实验室发文指出当前主流智能体评测标准完全围绕计算能力构建任务精度、稳定性、执行效率天然排斥差异化决策与情境变通会锁死认知升级路径。文章呼吁构建包容异象、情境适配的新型评测框架。这对 Harness 是扎心的一刀如果我们只会考 Agent 算得准不准就永远逼它走标准化老路要它会变通评测本身得先变。# 学界呼吁的情境适配评测骨架Plan-Act-Verify 多维度打分 def evaluate_agent(trace: dict) - dict: dims { planning: trace[steps_planned] 0, execution: trace[steps_done] / trace[steps_planned], verification: trace[verified] / trace[steps_done], robustness: 1 - trace[fallback_rate], # 情境变通能力 } score sum(1 for v in dims.values() if isinstance(v, bool) and v) score sum(v for v in dims.values() if isinstance(v, float)) return {pass: score 3.0, detail: dims} # 不再只考算得准还要考会不会变通 sample {steps_planned: 5, steps_done: 5, verified: 4, fallback_rate: 0.1} print(evaluate_agent(sample))Verdict评测体系不升级Agent 永远停在标准答案复读机。5. 反面教材谷歌 Chrome 静默装 4GB 模型暴露可信任缺口隐私研究员披露谷歌 Chrome 在用户设备静默安装约 4GB 的 Gemini Nano 权重文件weights.bin未征得同意且难卸载数百万台 PC 受影响类似行为在欧洲或面临法律后果。这条新闻和上面的评测/交付形成对照Agent 跑得再好如果不被同意、不可卸载、不透明一切工程厚度都归零。可信任是 Harness 的地基不是附属品。维度Chrome 静默装模型合规 Agent 应做到同意未征得同意显式授权卸载难以移除可一键清理本地边界无声占用 4GB明确资源边界透明后台静默行为可审计6. 出海实战WhatsApp 私域闭环提取 → 清洗 → 群发把镜头切到出海一线。一个做东南亚 B2B 贸易的团队链路其实很朴素先用号码提取与备份工具WAExport从行业 WhatsApp 群组一键提取采购商成员按国家代码、日期分层筛选后导出 XLSX/CSV再用群发触达工具WASender按地区分桶、设置人类行为模拟间隔批量下发多语言营销消息。从数据提取到精准营销在同一个工作流里闭环省掉了中间反复搬数据的体力活。# WhatsApp 私域闭环提取 → 清洗 → 群发流程不绑定具体工具 def private_domain_pipeline(group_id: str): leads extractor.pull(group_id) # 从群组提取成员号码 clean checker.filter(leads, rules{active: True, region: SEA}) for batch in broadcaster.chunk(clean, size200): broadcaster.send( batch, templatehi {name}, 关于您关注的品类…, throttle90, # 人类行为模拟间隔秒 ) return broadcaster.report() # 送达 / 已读 / 失败率看板 # 关键不在工具在提取 → 清洗 → 触达的链路闭环步骤动作产出提取群组成员导出原始线索池清洗号码验证过滤有效目标名单触达个性化批量群发会话与转化这条链路的价值和今天的大主题是一致的真正拉开差距的从来不是单一能力而是把多个环节编排成一条可复用、可监控的闭环。模型、工具、数据都只是这条链路上的零件。7. 收束下半场的记分牌换了把今天的材料收一下Harness 中间层至少已经长出四块运行层让 Agent 30 分钟跑起来英伟达 Agent Toolkit算力层让 Token 成本再降 10 倍无问芯穹 Agentic Infra交付层让完成率、客户数、增长率可被验收容联云评测层让会不会变通也能被打分学界呼吁。而谷歌 Chrome 的事件提醒我们这四块之上还得有一块更底层的——可信任。缺了它再厚的工程中间层也是悬空的。Agent 的下半场不再比谁的模型更聪明而比谁把聪明稳稳接进生产环境的能力更扎实。这就是工程中间层的意义。常见问题FAQQ1什么是 Agent 的 Harness工程中间层A指模型之上、业务之下把模型能力编排、运行、评测、交付的可复用工程层。包含运行环境、算力调度、评测框架与交付闭环是 Agent 从 Demo 走向生产的关键。Q2为什么模型能力不再是护城河A参数与榜单已经很难单独构成产品竞争力。企业更关心部署数量、完成率、客户反馈——这些取决于编排与工程而非单一模型大小。Q3工程中间层通常包含哪些层A至少四层运行层部署/工具接入、算力层Token 工厂/成本、交付层可验收的业务闭环、评测层多维打分。其上还需可信任作为地基。Q4谷歌 Chrome 静默装 4GB 模型事件带来什么启示AAgent 与端侧模型必须遵守同意、可卸载、资源边界、可审计四原则。技术能力再强缺少可信任前提也无法进入生产环境。Q5出海团队如何用 WhatsApp 做私域闭环A核心是把数据提取 → 号码清洗 → 个性化触达编排成一条可监控的链路先批量导出群组线索再验证过滤无效号最后按地区分桶、模拟人类行为节奏下发消息用看板跟踪送达与转化。参考来源新浪财经 / 封面新闻《告别能聊 AI 开始能干了》WAIC 2026 闭幕观察2026-07-21腾讯新闻 AI Agent 动态日报2026-07-21WAIC 双线落地 / Chrome 静默装模型 / 淘天 AIGX / 容联云 Agent 化 / Agent 支付华尔街见闻英伟达 DGX Station 发布 Agent Toolkit2026-07-21上观新闻无问芯穹发布 Agentic Infra「前店后厂一中心」WAIC 2026IPO 早知道容联云全栈产品 Agent 化Voice Agent 完成率 94%、私域运营 Agent 管理 8 万 客户2026-07-20人机与认知实验室智能体评测体系锁死认知升级路径2026-07-21BrightCoast Daily AI Tech Intel Brief2026-07-21OpenAI agentic 安全报告 / MCP 规范更新 / Hugging Face 安全事件

相关新闻

Comic Backup:3步将你的数字漫画永久保存,告别平台依赖焦虑!

Comic Backup:3步将你的数字漫画永久保存,告别平台依赖焦虑!

Comic Backup:3步将你的数字漫画永久保存,告别平台依赖焦虑! 【免费下载链接】comic-backup Back up your comics as CBZ. 项目地址: https://gitcode.com/gh_mirrors/co/comic-backup 你是否曾担心过,花费真金白银购买的在…

2026/9/27 22:01:26 阅读更多 →
【大白话说Java面试题 第185题】【08_Kafka篇】第1题:如何保证 Kafka 消息不丢失?

【大白话说Java面试题 第185题】【08_Kafka篇】第1题:如何保证 Kafka 消息不丢失?

📌 PDF:大白话说Java面试题 — 08_Kafka篇 第1题:如何保证 Kafka 消息不丢失? 📚 回答: 核心考点: Kafka 消息不丢失是分布式消息系统面试中的必考题、送命题。大厂面试官不会满足于"ack…

2026/10/2 10:31:32 阅读更多 →
TI DSP GPIO模块实战:从寄存器原理到中断配置与调试避坑指南

TI DSP GPIO模块实战:从寄存器原理到中断配置与调试避坑指南

1. 从手册到实战:TI DSP GPIO模块的深度驾驭指南在嵌入式开发领域,尤其是基于德州仪器(TI)数字信号处理器(DSP)的项目中,通用输入输出(GPIO)模块是我们与外部世界交互最直…

2026/10/9 4:53:25 阅读更多 →

最新新闻

打印审计必备:从SPOOL文件解析SHD与SPL还原打印记录

打印审计必备:从SPOOL文件解析SHD与SPL还原打印记录

简介:面向打印监控、打印审计与打印数据恢复场景,该资源提供了一套不依赖传统HOOK函数、打印消息或虚拟打印机的SPOOL文件解析工具链,适合系统管理员、打印服务开发者及安全分析人员学习。从原理上看,SHD保存任务元数据&#xff0…

2026/10/11 22:28:20 阅读更多 →
基于SSM的电影院订票系统前后台开发实战与避坑指南

基于SSM的电影院订票系统前后台开发实战与避坑指南

简介:这是一套基于SpringSpringMVCMybatis的电影院订票系统前后台源码,面向JavaWeb学习者、毕业设计或课程设计人群,可支撑SSM整合开发与MVC分层实践。系统前台涵盖登录注册、影片预览、档期查询、订票与影评等模块,后台提供用户、…

2026/10/11 22:28:20 阅读更多 →
vllm-metal TurboQuant 实战:KV 缓存压缩 2.5 倍扩展上下文的原理与配置

vllm-metal TurboQuant 实战:KV 缓存压缩 2.5 倍扩展上下文的原理与配置

【免费下载链接】vllm-metal Community maintained hardware plugin for vLLM on Apple Silicon 项目地址: https://gitcode.com/gh_mirrors/vl/vllm-metal 点击查看 免费下载 vllm-metal 是 vLLM 在 Apple Silicon 上的社区硬件插件,其内置的 TurboQua…

2026/10/11 22:28:20 阅读更多 →
钥匙串 + Passkeys 全链路:3MB 浏览器如何把密码安全做到系统级

钥匙串 + Passkeys 全链路:3MB 浏览器如何把密码安全做到系统级

钥匙串 Passkeys 全链路:3MB 浏览器如何把密码安全做到系统级 【免费下载链接】Search A small, fast WebKit browser for macOS, by Office Commun. 项目地址: https://gitcode.com/gh_mirrors/search59/Search 一台只有 3MB 的浏览器凭什么敢谈"系统…

2026/10/11 22:28:20 阅读更多 →
MySQL用户创建与授权实战:从CREATE USER到GRANT权限管理

MySQL用户创建与授权实战:从CREATE USER到GRANT权限管理

很多人刚开始用MySQL的时候,最容易在用户权限这个环节卡住。明明CREATE USER执行成功了,GRANT也没有报错,可换台机器一连接就是Access denied,或者能连上了却什么都干不了。这个问题说大不大,说小不小,但它…

2026/10/11 22:28:20 阅读更多 →
Agent技能工程:可验证、可监控、可复用的智能体能力单元设计

Agent技能工程:可验证、可监控、可复用的智能体能力单元设计

1. “agent-skills”不是新词,而是智能体能力工程的实践切口“agent-skills”这个词乍看像某个开源库的包名,或是某次技术分享里一闪而过的术语缩写。但过去两年在多个跨领域项目中反复遇到它——不是作为概念被宣讲,而是作为实际开发中必须拆…

2026/10/11 22:27:17 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →