Agent面试详解(上):从模型接口到可恢复的运行时
《Agent面试详解》系列上篇运行时与上下文 · 中篇记忆、工具与并发待发布 · 下篇评测、安全与落地待发布最近刷到几段讨论 DeepSeek Agent 岗位和面试的视频。里面反复出现的问题很有代表性上下文窗口怎么选多用户并发怎么处理长期记忆会不会无限膨胀一个 Agent 跑几十步以后为什么越来越不稳定。这些问题表面上像面试题实际已经越过 Prompt 和框架用法进入运行时、分布式系统、数据治理和工程架构的范围。DeepSeek 的公开招聘也能印证这个变化。当前职位列表中已经出现 Agent Harness、Agent Infra、Agent 后端和 Code Agent 数据等不同方向。它需要的不是一个“会调模型 API 的人”而是一支能把模型能力变成稳定产品的完整团队。DeepSeek 官方招聘这个系列不整理“面试题标准答案”而是从零设计一套企业级 Agent。假设它支持多租户可以连续执行 100 步能访问内部与外部工具进程崩溃后可以恢复高风险操作必须审批所有行为可以审计和评测。上篇先处理底座模型、Harness 和环境是什么关系运行时如何保存状态长任务为什么会失控上下文窗口应该怎样管理。DeepSeek 最近在招什么人Agent 这个词过去太宽泛。一个聊天框接上搜索 API也有人叫它 Agent一个可以操作代码仓库、跑几小时、修改外部状态的系统也叫 Agent。两者显然不是同一种工程问题。DeepSeek 当前公开岗位把边界划得更清楚Agent Harness 团队、Agent Infra、Agent 后端、Code Agent 数据、搜索算法与架构分别承担不同工作。可以用一个简化公式表达这种分工Model Harness Agent如果把真实工作环境也纳入系统公式还要再补一项Model Harness Environment Agent System模型负责理解、推理和生成决策Harness 决定模型能看到什么、能调用什么、怎样保存状态、失败后如何恢复Environment 则提供代码仓库、浏览器、数据库、业务 API 和权限边界。离开后两层模型再强也只能在对话框里给建议。近期的 Harness Engineering 研究把这层运行时拆成任务定义、上下文选择、工具访问、项目记忆、任务状态、可观测性、失败归因、验证、权限和人工干预等职责。它强调的不是“模型能否生成一个 patch”而是整个系统能否交付一个可验证、可归因、可维护的修改。AI Harness Engineering这也是 Agent 面试变硬的原因考察对象从某个框架的 API变成了一个完整软件系统。先把企业级架构画出来先不要急着讨论 LangGraph、AutoGen 或某个 SDK。框架选型之前应该先确定系统边界。一套可以长期运行的企业 Agent至少需要下面这些模块。模块主要职责不应该负责什么API Gateway认证、租户解析、限流、请求入口不编排 Agent 步骤Run Manager创建、去重、取消、恢复和查询 run不直接执行工具State Machine驱动 Agent Loop约束状态迁移不保存全部业务数据Planner拆任务、维护依赖、触发重规划不绕过权限调用工具Context Builder组装每一轮模型输入不把数据库当成聊天记录倾倒Model Router按难度、风险、延迟和成本选模型不决定业务权限Scheduler排队、并发、租约、重试和背压不持有长期数据库事务Tool Gateway发现、校验、授权和执行工具不暴露 Secret 给模型Sandbox隔离 Shell、浏览器和代码执行不承担全局调度Memory Service记忆写入、合并、检索和遗忘不控制 Agent LoopApproval Center审核高风险和不可逆操作不替模型补参数Trace / Eval记录轨迹、证据、指标和评测结果不反向污染运行状态模块之间怎么通信短查询可以走 HTTP 或 gRPC例如 Run Manager 查询一个 run 的状态长操作应该进入消息队列例如一个需要运行十分钟的浏览器任务。状态变化最好发布版本化事件而不是让所有模块直接读写同一批表。有三条边界尤其重要Tool Gateway 不应依赖 Planner 的内部对象只接受稳定的 Tool Call Contract。Memory Service 不应知道某个框架的 message class只存储有版本的领域对象。数据库事务不能跨模型调用、工具调用、文件 I/O 或网络 I/O。如果多个模块共享 ORM 对象、共享进程内全局状态、共享一条长事务系统在单机 Demo 里很方便到了多 Worker、重试和滚动升级时就会迅速失控。Agent Loop 怎样从 Demo 变成运行时最小 Agent Loop 通常写成这样while not done: response model(messages, toolstools) if response.tool_call: result execute(response.tool_call) messages.append(result) else: done True它适合教学不适合企业运行。至少缺少状态持久化、预算、取消、错误分类、并发控制、审批和完成证据。更接近真实系统的循环是读取 run 与 checkpoint → 构造本轮上下文 → 模型规划下一动作 → 策略与权限检查 → 执行工具或等待审批 → 持久化 observation → 更新任务状态 → 验证完成条件 → 继续、重试、重规划、暂停或结束每一步都要能够回答三个问题这一步的输入来自哪个版本的状态这一步是否已经产生外部副作用进程现在崩溃下一台 Worker 从哪里继续“完成”不是模型说了算模型输出done只能表示它认为自己完成了。系统还要运行验证器。例如代码 Agent 必须检查目标测试、相关回归测试和工作区 diff数据 Agent 必须核对查询范围、行数和口径客服 Agent 必须确认工单状态确实改变。完成条件应该是机器可观察的状态completion: required: - target_tests_passed - regression_tests_passed - no_unapproved_side_effects - final_evidence_attached max_steps: 100 max_duration_seconds: 7200这里的max_steps是安全上限不是让 Agent 必须跑满 100 步。真正的结束条件来自证据预算只负责在异常时切断循环。跑到五十步为什么容易崩长任务最先碰到的通常不是模型智力而是上下文管理。如果每次工具调用都把原始结果追加到messages上下文会持续膨胀。更麻烦的是Token 变多不只意味着成本变高还意味着关键约束被大量 observation 淹没、旧错误继续传播、模型开始重复已经做过的工作。不要只按“最近 N 轮”截断固定保留最近 10 轮很简单但不可靠一次浏览器 DOM 或日志输出可能比十轮普通对话还长而第 11 轮恰好可能保存了不可丢失的架构决策。更稳妥的是按 Token 预算组装混合窗口固定区system policy、目标、权限和不可变约束 任务区当前 plan、未完成步骤、最近 checkpoint、关键决策 动态区最近交互、本步工具摘要、按需检索的记忆 预留区模型输出、Tool Schema、下一轮 observation阈值怎样设不能等模型 API 返回“context too long”才处理。一个可落地的初始方案是上下文水位动作60%–70%开始监控重复内容工具大结果只保存摘要75%–80%生成 checkpoint压缩旧轨迹85%大型原始结果全部外置只保留引用和关键事实90%停止扩展任务不再接收不可预测的大结果接近硬限制从 checkpoint 启动新线程或交还人工真正的输入预算不是模型标称上下文上限可用输入预算 上下文上限 - 最大输出预算 - Tool Schema - 安全预留 - 序列化与格式化开销建议至少留出 10%–20% 给输出和不可预测增长。对于会返回大结果的浏览器、日志和数据库工具预留还要更高。阈值不是行业标准应根据真实轨迹、模型输出长度和工具分布持续校准。溢出前的兜底顺序删除可以重新获取的原始工具结果。合并重复 observation。把旧步骤压缩成带证据引用的 checkpoint。只加载当前阶段需要的工具定义。将独立工作拆给 Subagent隔离上下文。冻结旧线程用结构化状态启动新线程。仍无法压缩时暂停而不是静默丢掉约束。DeepSeek 的上下文缓存可以降低相同前缀的延迟和成本但缓存并不能解决上下文语义污染。它优化的是重复计算不是信息选择。DeepSeek Context Caching上篇留下的接口到这里Agent 已经有了运行时骨架每一步受状态机约束慢调用不占用数据库事务完成依赖证据上下文按预算组装进程可以从 checkpoint 恢复。但状态能够恢复不代表长期记忆可信工具能够调用也不代表它不会越权或重复产生副作用。中篇继续处理最容易把 Demo 拖垮的三件事记忆、工具和多用户并发。**接下来**中篇将继续讨论记忆、工具与多用户并发暂未发布。《Agent面试详解》系列上篇运行时与上下文 · 中篇记忆、工具与并发待发布 · 下篇评测、安全与落地待发布

相关新闻

智慧文旅与景区慢直播|数字化赋能,视频直播点播平台EasyDSS一体化视频能力激活文旅传播新势能

智慧文旅与景区慢直播|数字化赋能,视频直播点播平台EasyDSS一体化视频能力激活文旅传播新势能

当下智慧文旅建设已成趋势,但多数景区、文博机构、文旅企业的直播运营普遍存在痛点:直播画面卡顿掉帧、并发承载不足、内容版权无保护、无法24小时常态化直播、活动数据无统计、无法对接自有平台,导致文旅宣传效果差、流量无法沉淀、品牌传播…

2026/7/23 19:23:52 阅读更多 →
软路由小白必看:如何用闲置电脑5分钟搭建OpenWrt系统(附详细图文)

软路由小白必看:如何用闲置电脑5分钟搭建OpenWrt系统(附详细图文)

软路由新手指南:用闲置电脑打造你的专属网络中枢 手边是不是总有一台旧电脑,食之无味,弃之可惜?与其让它躺在角落吃灰,不如赋予它新的使命。今天,我们就来聊聊如何将这台“退役”的电脑,变身为一个功能强大、可玩性极高的家庭网络核心——软路由。整个过程,从准备到点…

2026/7/23 19:22:52 阅读更多 →
AI自动生成优质内容:3步构建零失败工作流,今天部署明天见效

AI自动生成优质内容:3步构建零失败工作流,今天部署明天见效

更多请点击: https://codechina.net 第一章:AI自动生成优质内容:3步构建零失败工作流,今天部署明天见效 构建高可靠性AI内容生成工作流,关键在于解耦输入、处理与输出三阶段,并引入轻量级验证闭环。以下三…

2026/7/23 19:22:52 阅读更多 →

最新新闻

零基础小白如何去SRC平台挖漏洞赚钱?全网最全最强的干货教程一定要收藏!

零基础小白如何去SRC平台挖漏洞赚钱?全网最全最强的干货教程一定要收藏!

2026 年国内 SRC 产业持续规范化发展,各大互联网企业、政企单位漏洞响应平台全面扩容,依托合规漏洞挖掘发放赏金已经成为网络安全新手最稳妥的变现途径。补天SRC年度统计数据表明,现阶段 72.3% 的中高危有效漏洞均为业务逻辑类漏洞&#xff0…

2026/7/23 19:33:55 阅读更多 →
MySQL锁

MySQL锁

锁锁是计算机协调多个进度或线程并发访问某一资源的机制,具体内容如下:Mysql中的锁按照颗粒度可以分为以下三类全局锁以下是全局锁的概述,全局锁是对整个数据库加锁加锁后数据库处于只读状态 ,后续的ddl和dml语句都将被堵塞全局锁的语法如下以…

2026/7/23 19:33:55 阅读更多 →
深入解析TI F021 Flash控制器:寄存器配置与诊断模式实战指南

深入解析TI F021 Flash控制器:寄存器配置与诊断模式实战指南

1. F021 Flash控制器:嵌入式存储的“神经中枢” 在嵌入式系统,尤其是汽车电子和工业控制领域,Flash存储器扮演着“非易失性大脑”的角色,负责存储启动代码、应用程序、校准数据和用户配置。然而,直接操作Flash物理阵列…

2026/7/23 19:33:55 阅读更多 →
开源桌面 Agent OpenClaw ,Windows/Mac 极简安装步骤与指令使用分享

开源桌面 Agent OpenClaw ,Windows/Mac 极简安装步骤与指令使用分享

📌前言 近期备受关注的本地 AI 智能体 OpenClaw(因其图标被昵称为"小龙虾")现已推出 2.7.9 稳定版本。本次更新重点解决了大量旧版存在的使用痛点,不仅内置了超过 490 款国内外主流大模型的适配库,还全面优…

2026/7/23 19:32:55 阅读更多 →
TI Hercules/C2000 IOMM模块:引脚复用、eCAP/eQEP配置与安全锁定机制详解

TI Hercules/C2000 IOMM模块:引脚复用、eCAP/eQEP配置与安全锁定机制详解

1. 项目概述与IOMM模块的核心价值在嵌入式系统开发,尤其是基于德州仪器(TI)Hercules系列或C2000系列微控制器的项目中,我们经常需要面对一个现实问题:芯片的物理引脚数量是有限的,但需要实现的功能却越来越…

2026/7/23 19:32:55 阅读更多 →
Hyper-V虚拟化环境下的多网口软路由单臂路由实战:VLAN配置与剩余网口复用指南

Hyper-V虚拟化环境下的多网口软路由单臂路由实战:VLAN配置与剩余网口复用指南

1. 为什么要在Hyper-V里折腾多网口软路由? 大家好,我是老张,一个在虚拟化和网络这块摸爬滚打了十来年的老玩家。今天想和大家聊聊一个挺有意思的场景:你手头有一台性能不错的Windows主机,比如一台迷你主机或者淘汰下来的台式机,上面跑着Hyper-V。你装了个软路由系统,比…

2026/7/23 19:32:55 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻