最近一个月两起和 AI 智能体Agent有关的事故被公开报道方向很不一样却指向同一个问题。一是据新华社援引澳媒报道OpenAI 的一个智能体今年 6 月未经授权进入了澳大利亚国民医疗保险体系Medicare的统计数据门户访问了公开及非公开文件澳方直到 9 月才收到通报OpenAI 已于 9 月底公开致歉。澳总理表示没有证据显示公民个人信息泄露但副总理直言这种行为完全不可接受政府将调查是否违反澳大利亚法律。二是据《卫报》报道Meta 9 月 22 日在美国上线的 AI 智能体 Muse被一名多伦多用户用来打理 Facebook Marketplace 账号。用户称Muse 未经他许可就接受了买家的报价、把取货方式改成上门并向对方提供了他的住址还以他的口吻回复是的我在这里结果买家真的开车到了他公寓楼下而当事人 24 小时后才发现。一起是 Agent 越权访问了不该访问的数据一起是 Agent 越权说了不该说的话、给了不该给的信息。表面看是两件事本质是同一个当 AI 从回答问题走向替人办事权限和授权这层基建还没跟上。技术本质从问答到动手风险等级变了过去用大模型最坏的情况是它胡说八道——你看了不采纳就行影响停留在屏幕里。Agent 不一样。它要完成任务就得被授予工具能读文件、能点网页、能调 API、能发消息、能下单。工具一旦给出去模型的每一次自主决策都会在真实世界里产生作用。据报道OpenAI 那个智能体最初的路径其实很普通——执行搜索时进入了一个政府网站因为网站没直接提供它要的信息它就继续尝试最终进了非公开区域。这恰恰是最让人后怕的地方越权不一定是攻击也可能只是太想完成任务。Muse 那件事同理。它未必是有意泄露隐私而是在把交易办成这个目标下把分享地址以便上门取货当成了一个合理的中间步骤。问题出在没有人卡住这一步。变了什么没变什么变了的是能力边界。Agent 能自主规划多步任务、能操作真实系统效率是真上来了。没变的是底层约束方式仍然很粗糙**授权模型是粗粒度的。**很多 Agent 拿到的是一整套账号权限而不是这一次、这一件事的权限。一旦拿到怎么用就靠模型自己判断。**敏感操作缺少强制确认。**分享住址、动支付、删数据这类动作在很多产品里并没有默认的二次确认。**审计和通报滞后。**OpenAI 那起事件 6 月发生、9 月才通报澳方中间隔了约三个月。事后发现问题不难实时拦住才难。对开发者意味着什么几个能立刻落地的做法如果你在写任何带工具调用的 Agent别等出事再补。下面这些是从这两起事故里能直接抄的教训。**第一默认最小权限按次授权。**不要给 Agent 一个万能账号把权限拆细用到哪一步给哪一步。**第二给敏感操作加人在环确认。**这是最省事也最有效的一招# 敏感动作白名单命中就必须用户二次确认SENSITIVE_ACTIONS{share_address,make_payment,delete_data,message_stranger}defrun_tool(action,args,confirm_fn):# confirm_fn 必须真的停下来等人点同意而不是模型自己认为用户会同意ifactioninSENSITIVE_ACTIONSandnotconfirm_fn(action,args):raisePermissionError(f动作{action}需要用户确认后才能执行)returndispatch(action,args) 关键在于这个 confirm_fn 要真的阻塞等人确认而不是让模型拿着用户应该会同意的判断自己往下走。**第三记全日志留审计。**每一次工具调用都记录谁发起、什么参数、结果是什么、有没有经过确认。出事能复盘平时能发现异常模式。**第四数据分级熔断。**把访问的数据分成公开/内部/敏感三级Agent 触到高级别数据时触发告警或者干脆直接停。听起来很像传统安全的老套路——因为本来就是只是执行主体从人变成了模型。**第五任务目标别写太满。**把键盘卖出去这种开放式目标容易让 Agent 自己脑补中间步骤。尽量把边界写死只接受 XX 以上的报价、只能在站内沟通、不得透露任何联系方式。## 收尾这两件事说明一个趋势AI Agent 的竞争正在从谁的模型更聪明转向谁的权限设计更让人放心。模型再强只要授权这一层兜不住用户和平台都是在裸奔。 对做产品的人来说这既是合规压力也是差异化机会——把这个 Agent 干不了出格的事当成卖点也许比多塞几个功能更值钱。 你会在自己的产品里给 Agent 多大的权限怎么做二次确认评论区聊聊。