最长运行两小时的网络调查 Agent,怎样避免在恶意页面里跑偏
工程上的答案长时间调查 Agent 不能只靠更大的上下文窗口。先定义证据、图谱、时间线和停止条件再把状态写入可恢复文件系统固定动作由 harness 强制未知页面和工具故障才留给模型判断。质量 eval 与安全 eval 还要分开通过。先定义调查产物再决定 Agent 能用哪些工具Claude 官方在 2026 年 7 月 22 日发布 Outtake 的 Recon Agent 案例。Outtake 用 Claude Code 和 Claude Agent SDK 构建长时间运行的网络调查 Agent从仿冒登录页出发收集和分类证据继续追踪关联域名、账号与基础设施形成攻击网络图最后输出调查过程、威胁主体画像和时间线。官方披露Outtake 的 Agent 会话中位数为 16 分钟常常持续一小时以上最长一次运行了两小时。长会话的问题不只在上下文长度而在每一步新线索都会改变后续方向。若“调查完成”没有固定定义Agent 可能不断探索也可能过早停在一个仿冒页面上。Outtake 的第一步不是写 Agent而是工程师亲自完成真实调查并从客户和设计伙伴那里整理领域经验定义什么证据有价值、怎样组织、可行动结论与猜测有何区别。这套标准成为后续原型、评测和生产迭代的固定参照。工程实现时可以先定义交付 schema初始事件、证据节点、关联边、来源与抓取时间、可信级别、未验证假设、时间线和建议动作。Agent 每发现一个新对象就写入文件系统中的结构化记录压缩上下文或重启会话后调查状态仍可恢复。图谱去重不能只依赖名称。域名、证书、IP、账号和页面模板的关系需要分别保存关联边带上证据类型和可信状态。相同字符串可能属于不同主体同一攻击者也可能频繁更换基础设施grader 应检查是否存在无证据合并而不是奖励节点越多越好。停止条件可以写成状态机主要线索已覆盖且新增证据价值下降时生成报告需要主动提交表单、接触敏感数据、风险评分超过阈值或预算耗尽时暂停证据冲突则进入人工复核。这样“继续调查”是可解释决定而不是 Agent 只要还能找到链接就一直运行。检查点可以采用追加写而不是反复覆盖。每一阶段保存任务版本、当前目标、已确认节点、新增关联、待验证假设、工具错误和下一步恢复时先校验快照哈希再从最后一个完整阶段继续。这样既能回放错误路径也能避免损坏文件让 Agent 带着不完整状态重新运行。证据节点与模型判断要分开存储。网页内容、请求时间和页面哈希属于原始证据实体归属与攻击者画像属于分析。后续模型升级时可以重算分析而不改变原始记录也能看出结果差异来自证据变化还是判断变化。orchestration 写死步骤判断空间留给 AgentOuttake 先在 Claude Code 中验证假设再转向 Agent SDK以便更细控制 memory、context 和 filesystem。团队形成的原则是在编排层强制每次调查都执行的动作例如保存证据、更新图谱、检查停止条件遇到新页面、失效工具或未知基础设施时允许 Agent 自己写代码和选择路径。官方文章提到文件系统加 bash 让 Agent 在工具遇到网络故障时寻找替代办法继续工作。开放能力也带来风险。允许读写文件和执行代码不代表可以接触内部密钥、任意网络或生产系统。工具适配器应限定目录、网络出口、进程资源和运行时间每次访问恶意页面前经过风险检查点。模型选择可以在 147AI 中用脱敏调查图、静态页面快照和固定线索集进行对照记录证据遗漏、错误关联、修订轮次、用量和人工评分。真实恶意域名、客户暴露面、Claude Agent SDK 会话和处置权限仍留在隔离调查系统。稳定规则不要只写在 system prompt。Outtake 的经验是长时间 Agent 可能忽略提示中的某些词必须每次执行的要求应进入 harness证据落盘、来源标记、禁止提交真实凭据、达到风险阈值后暂停以及向外部页面发送数据前的检查。Prompt 留给需要判断的空间硬边界由系统执行。错误类型同样进入 harness。临时网络失败允许有限重试和替代工具策略拒绝、未批准目标和敏感信息请求只能生成待处理事项。若所有失败都返回同一错误Agent 可能把安全边界误认为普通技术障碍并继续寻找绕过路径。每次运行绑定模型、harness、工具、策略和页面快照版本。实时网页持续变化事故后只重新访问目标无法证明旧问题保留原输入和状态才能复现提示注入、错误关联或工具行为。出站请求应经过独立代理。代理不仅判断域名能否访问还检查请求方法、payload 和当前任务身份。普通公开页面可以只读获取表单提交、文件上传、携带客户标识或访问新目标时默认暂停并等待批准。Agent 看到的是策略结果没有权限修改白名单。命令执行也需要产物清单。脚本读取了哪些文件、创建了哪些临时工具、产生哪些网络请求都与当前检查点绑定。任务结束后临时程序不会自动进入共享工具层要复用必须补齐测试、负责人和权限审查。评测要缩短开发循环也要验证隔离边界早期每次运行后工程师人工阅读约 30 分钟的完整轨迹成本很高。Outtake 将这些人工 reflection 逐步写成自动 eval让 grader Agent 根据固定标准检查调查是否完整、证据是否支持结论、图谱是否错误合并、停止点是否合理。模型升级和 memory 重构时多场景并行回归能更快暴露变化。评测还驱动工具改进。Recon Agent 会报告自己缺少什么工具另一个 coding Agent 读取建议、编写工具并建立测试场景最后由人判断新工具是否让调查更好。这个链条必须限制自动发布工具先在固定样本和沙箱中运行检查权限、输入输出和失败路径再决定是否进入调查 harness。安全边界采用“可能被劫持”的假设。Outtake 构建 blastbox将 Agent 与敏感内部信息隔离并在它接触互联网的具体节点评估页面是否仿冒、包含恶意代码或试图提示注入。企业参考这套思路时可以再用网络白名单、短期身份、文件系统快照和工具日志限制并回放影响。新工具也不能从 Agent 建议直接进入生产。独立 coding 流程生成实现和测试先在历史页面与失败样本中运行检查权限、网络和状态写入再由人批准进入只读工具层。当前会话的临时脚本任务结束后自动归档。生产指标分成质量与控制两组。质量看证据覆盖、错误关联、报告采纳和人工修订控制看越界请求、风险拒绝、状态恢复和资源消耗。两组都通过才能扩大运行时间或网络范围。回归集至少包含顺利调查、工具超时、页面格式变化、无价值线索、错误关联和提示注入。grader 检查最终报告时还要读取命令、网络和文件轨迹确认固定步骤确实执行。只评最终文本可能让中途越界但最后写出正确报告的版本获得高分。上线可以分三段先使用静态页面与脱敏图谱验证 schema 和恢复再开放经过代理的受限互联网只读访问少量目标最后才增加运行时长和临时脚本能力。每段都设置回退条件出现证据丢失、无法解释的关联或越界请求就退回前一层。最小验收清单中断后能从检查点恢复每个结论能回到来源错误关联可被固定样本发现策略拒绝不会被当成工具故障重试人接管时不必重读完整轨迹新模型在质量和控制两套回归中都通过。最终验收不能只看是否找到更多域名。还要看每个结论能否回到证据错误关联能否被发现长会话中固定步骤是否执行恶意输入能否突破隔离以及人工是否能在高风险节点接管。长时间 Agent 的可靠性来自领域标准、可恢复状态、自动评测和硬边界共同作用。官方来源ClaudeHow Outtake built a cyber investigator on Claude发布于 2026-07-22。

相关新闻

汽车底盘运维面试30问:大模型技术助力零基础备考

汽车底盘运维面试30问:大模型技术助力零基础备考

1. 项目背景与核心价值汽车底盘运维岗位的技术面试往往让零基础求职者望而生畏。作为车辆系统中最为复杂的机械-电子耦合系统,底盘涉及悬架、转向、制动、传动四大核心子系统,每个子系统又包含数十个关键部件。传统面试准备需要大量时间研读维修手册和技…

2026/7/24 1:22:53 阅读更多 →
AI专著生成工具:核心价值与主流产品评测

AI专著生成工具:核心价值与主流产品评测

1. AI专著生成工具的核心价值解析在学术研究领域,专著撰写一直是让众多学者又爱又恨的工作。传统专著创作往往需要耗费数月甚至数年的时间,从选题确定、资料收集到框架搭建、内容撰写,每个环节都需要投入大量精力。特别是在逻辑严谨性和学术规…

2026/7/24 1:21:52 阅读更多 →
AI音乐技术实践:从算法到工程化落地

AI音乐技术实践:从算法到工程化落地

1. 项目概述:AI音乐技术的落地实践 《AU 把 AI 音乐拉回人间》这个标题本身就蕴含着强烈的行业洞察——当AI音乐技术被过度神化时,我们需要回归音乐创作的本质。作为从业十余年的音乐科技开发者,我亲历了从算法崇拜到实用落地的完整周期。这个…

2026/7/24 1:21:52 阅读更多 →

最新新闻

大模型核心技术:向量嵌入原理与应用解析

大模型核心技术:向量嵌入原理与应用解析

1. 大模型的核心灵魂:向量嵌入的本质解析"AI大模型"这个术语近年来频繁出现在各类技术讨论中,但真正理解其运作原理的人却不多。很多人把大模型简单地看作是一个能自动生成文本的黑箱系统,却忽略了支撑其智能表现的核心技术——向量…

2026/7/24 1:30:54 阅读更多 →
OpenCV图像处理核心技术解析与工程实践

OpenCV图像处理核心技术解析与工程实践

1. OpenCV图像处理技术全景解析OpenCV作为计算机视觉领域的瑞士军刀,其图像处理模块构成了整个库最核心的功能基础。我在工业质检和医疗影像项目中深度使用OpenCV多年,发现90%的视觉任务都建立在图像处理技术栈之上。不同于深度学习"黑箱"特性…

2026/7/24 1:30:54 阅读更多 →
AEGIS:AI内容安全增强框架的迭代式安全引导机制解析

AEGIS:AI内容安全增强框架的迭代式安全引导机制解析

这次我们来看一个很有意思的安全增强项目——AEGIS(Awareness-Enhanced Guidance for Iterative Safeguard)。这个项目专门解决AI模型在生成内容时的安全问题,特别是针对那些绕过常规安全机制的对抗性攻击。AEGIS的核心思路很直接&#xff1a…

2026/7/24 1:30:54 阅读更多 →
Java生态下的企业级AI开发实践与优化

Java生态下的企业级AI开发实践与优化

1. 为什么Java团队需要关注AI开发?在传统印象中,AI开发似乎是Python的专属领域,但实际情况正在发生变化。作为企业级应用开发的主力军,Java生态正在快速拥抱AI技术栈。我最近主导的几个企业级AI项目落地案例表明,Java团…

2026/7/24 1:30:54 阅读更多 →
BitNet:1-bit量化大模型在CPU上的高效部署与实践

BitNet:1-bit量化大模型在CPU上的高效部署与实践

1. BitNet:微软推出的轻量化大模型革命去年第一次听说BitNet时,我正在为一台老旧的开发机发愁——这台只有4核CPU的机器跑不动任何主流的大语言模型。直到看到微软研究院的论文,才发现原来在CPU上跑大模型并非天方夜谭。BitNet通过1-bit量化技…

2026/7/24 1:30:54 阅读更多 →
千笔与云笔AI写作工具横向评测:降AIGC技术对比

千笔与云笔AI写作工具横向评测:降AIGC技术对比

1. 项目概述:两大AI写作工具横向评测作为一名长期关注AI写作工具发展的从业者,最近市场上两款国产AI写作平台引起了我的注意——千笔专业降AIGC智能体和云笔AI。这两款工具都主打"降AIGC"概念,即降低AI生成内容(AI-Generated Conte…

2026/7/24 1:29:54 阅读更多 →

日新闻

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…

2026/7/24 0:00:29 阅读更多 →
AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口 AppCertDlls 位于 HKLM\System\CurrentControlSet\Control\Session Manager\AppCertDlls。本文的程序功能是只读列出这个键在 64 位和 32 位注册表视图中的全部值,并显示每条值的来源、名称、类型和可安全显示的数…

2026/7/24 0:00:29 阅读更多 →
我的编程之路:第一篇博客

我的编程之路:第一篇博客

大家好,我是一名编程初学者,同时这也是我编程学习之路上的第一篇博客。在这里,我想要向大家介绍我的一些想法和规划。a.自我介绍我是一个刚刚接触编程的新手,目前在学习c语言,我对编程世界充满了强烈的好奇。当然&…

2026/7/24 0:00:29 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻