大模型智能体——从模块化架构到自主协作
具身智能学习路径小白入门具身智能学习路径https://mp.weixin.qq.com/s/rh4nN-KCYCECIyH32d8rhQRAG与知识工程方法知识工程学习方法源自Tsinghua Science and Technology作者秦川、金龙等大模型的发展推动人工智能迎来范式变革催生具备复杂推理、规划能力且可与数字环境、物理环境交互的自主智能体。该领域正以前所未有的速度蓬勃发展亟需一套完整、体系化的综述梳理现有研究成果为后续创新提供指引。本文围绕基于大模型的人工智能智能体展开全面综述。首先拆解现代大模型智能体的核心架构剖析推理、感知、记忆、规划、行动与学习各大核心模块之间的协同机制其次系统梳理智能体评测体系归纳现有基准测试、评价指标以及各模块存在的性能权衡问题再者广泛调研此类智能体在众多领域带来的变革性应用覆盖数字场景与具身智能系统。文末总结当前亟待解决的关键难题并展望未来研究方向为下一代大模型智能体的发展勾勒研究路线。。论文信息中文标题大模型智能体综述架构、评测与应用英文原题A survey of large-model-based AI agents作者秦川、金龙关键词人工智能、大模型、AI 智能体、具身智能、深度学习DOI10.26599/TST.2026.9010072为什么需要大模型智能体过去的大模型更像“被动的写手”你问一句它答一段。但人们真正想要的是能主动感知环境、制定计划、调用工具、在虚拟或物理世界里把事办成的“智能体”。从专用模型到通用、目标导向的智能体是不可逆的范式转变。然而这个领域每天都有新架构、新方法、新应用冒出来记忆系统、工具增强、自我反思等概念快速演进却也导致研究图景“繁荣而碎片化”。对资深研究者和新人而言从信息洪流中分辨“基础原理”与“一时风口”都成了难题。本文的价值正是给出一套统一的“词汇表”和概念框架把五花八门的智能体设计讲清楚、比明白。给智能体装上“大脑”以推理为中心的模块化架构本文的核心观点可以浓缩成一句话大模型智能体不是单个模型而是一套由大模型统一调度、以“推理”为中央认知引擎的模块化系统。它的运转像一条闭环感知模块先采集原始数据但真正“看懂世界”的是推理核心——它把含糊的感官信息转化成对当前状态的结构化理解接着它决定往记忆里存什么、从记忆里取什么并把高层目标分解成可执行的策略行动模块据此挑选工具、确定参数去执行最后学习模块对全程做元级复盘分析轨迹、找出错误、更新记忆形成“执行—反思—改进”的持续循环六大模块协同运转第一项 推理模块中枢这是智能体的“大脑”。大模型在预训练中获得了语言与语义推理、常识推理、逻辑与数学推理等内在能力前沿方向还包括因果推理推断“谁导致谁”对稳健决策至关重要、社会推理、多模态推理与伦理推理。为了让推理更可靠研究分两路一是“推理时缩放”用更大算力换更稳的推理如思维链CoT、自洽多路径投票、思维树ToT、Self-Refine生成—自评—精炼二是“把推理学进权重”通过监督微调、结果监督强化学习RLHF 思路、过程监督强化学习对每一步推理给奖励来根本提升能力。第二项 感知模块让智能体“认识世界”。文本感知以 Transformer 为基并向更高效的长文本架构Mamba、Jamba 等状态空间模型演进视觉感知通常用 ViT 编码、再经 CLIP/投影器对齐到语言空间如 LLaVA听觉感知靠 Whisper 等做语音转写与情绪识别。更重要的是感知早已超越“文本/视觉/听觉”三件套扩展到空间与本体感知、触觉HapticLLaMA 把振动译成语言描述、化学嗅觉乃至神经信号。第三项 记忆模块负责存储与组织交互历史形式包括日志、轨迹、向量数据库以及自然语言、嵌入、结构化列表等。挑战在于长期记忆的检索质量与延迟分层记忆H-MEM四级语义抽象、MemOSKV 式记忆注入首字延迟最高提速约 94%等方案显著提升了长程检索的准确率与效率。第四项 规划模块把复杂目标拆成可管理的子任务策略分静态、动态与分层规划。它依赖推理引擎去评估逻辑依赖、做因果推断并校验子目标的可行性。第五项 行动模块把计划翻译成可执行操作调用 API、执行代码或在物理世界里完成真实交互如机器人动作。第六项 学习模块让智能体自我改进通过反思Self-Refine、Reflexion 用语言复盘带来显著提升、记忆巩固与技能习得把一次经验沉淀为长期能力构成持续改进的飞轮。在评测中见真章六类基准与关键发现为严谨比较各类架构本文建立统一评测框架基准分六大类——Web 导航、代码、数学、医学、艺术与设计、游戏以及科学外加“安全与鲁棒性”一类指标分四类——任务表现成功率、Passk、进度率、输出质量、效率、鲁棒性。几个数字很能说明问题在网页智能体基准 WebArena 上前沿智能体端到端成功率仅约 11%–14%短板在主动探索与失败恢复在旅行规划 TravelPlanner 上GPT-4 的最终通过率低至 0.6%在真实电脑任务 OSWorld369 项上最强模型成功率仅 12.24%。工具空间从常规扩到 147K token 的 schema 时Claude-4-Sonnet 的工具调用成功率从 62.4% 跌到 44.2%。这些差距暴露了三类反复出现的失败模式脆弱的工具选择靠表面匹配而非语义理解、不一致的规划推理链越长越易累积错误、脆弱的跨模态推理具身场景里的感知噪声会顺着推理链酿成错误动作。换言之今天的智能体离“可靠”还有距离。落地应用从数字世界到物理世界数字智能体充当“认知助理”自动化复杂工作流并在多个领域放大人类能力WebWebArena、Mind2Web、SeeClick——把浏览器 DOM 当结构化 API或用视觉定位直接“看屏操作”。代码SWE-Agent 设计专用智能体—计算机接口ACICodeLlama、Qwen2.5-Coder、DeepSeek-Coder-V2 等支撑“代码即行动”AgentCoder 用“程序员—测试设计—测试执行”三角色多智能体协作。数学DeepSeek-Prover 把大模型与定理证明器结合、用 RL 换可机器验证的正确性AlphaGeometry、ToRA推理与 Python 执行交织等各有打法。医学Med-Gemini、MDAgents多智能体自主协作形成诊断共识但始终坚持“医生在环”以确保安全与可解释。艺术与设计GenArtist 统一图像生成与编辑MusicAgent 编排专业音频模型作曲。游戏与社会Generative Agents 在虚拟小镇涌现可信的个体与群体行为Cicero 在《外交》游戏中达到人类水平靠的是把战略推理与对话模型紧耦合。科学发现自主系统正在加速化学、物理、生物等研究。具身智能体则架起“计算”与“物理动作”之间的桥固定基座机械臂操作、移动机器人导航、自动驾驶VLA 架构、LMDrive 端到端驾驶以及普适智能体智能家居、AR/VR 可穿戴、空中无人机蜂群。未来挑战与方向推理的可靠性模型仍易受到事实幻觉、逻辑谬误与对因果的“浅层理解”的困扰方向是神经—符号结合、过程监督奖励、推理过程的不确定量化。长程规划与战略前瞻反应式框架如 ReAct擅长短程任务却易陷局部最优、难为长远收益做短期牺牲方向是与蒙特卡洛树搜索等经典规划混合。开放世界适应让智能体仅凭文档就零/少样本用上新工具并缓解终身学习中的“灾难性遗忘”与“仿真到现实sim-to-real”鸿沟。智能体安全端到端 VLA 决策不透明、语义意图未必动态可行、中心化架构存在单点脆弱方向是可验证的安全约束与能“硬干预”的安全中间件。多智能体协作通信瓶颈、个体目标合理却群体“涌现错位”、协调开销随规模超线性膨胀方向是轻量、去中心化的共识协议。具身部署多模态大模型推理太慢、跟不上实时控制感知噪声沿推理链级联放大仿真与真实环境的域差距明显。

相关新闻

AI辅助学术写作:工具链与效率提升实践

AI辅助学术写作:工具链与效率提升实践

1. 项目概述:AI如何重塑学术专著写作十年前我完成第一部学术专著时,整整耗费了两年半的周末和夜晚。如今借助AI工具,同样的工作量可以压缩到三个月内完成——这不是魔法,而是现代研究者正在经历的生产力革命。学术专著写作正在从&…

2026/10/1 11:36:16 阅读更多 →
深入解析C程序机器表示:从编译链接到函数调用栈与逆向分析

深入解析C程序机器表示:从编译链接到函数调用栈与逆向分析

1. 项目概述:从C语言到机器指令的旅程 当你用C语言写下 int main() { return 0; } 并按下编译按钮时,一个魔法般的转换过程就开始了。我们写的这些对人类友好的高级代码,最终是如何变成CPU能够识别并执行的一串串0和1的呢?这背后…

2026/10/11 6:13:00 阅读更多 →
智能车竞赛越野组:从PID控制到视觉感知的嵌入式系统实战

智能车竞赛越野组:从PID控制到视觉感知的嵌入式系统实战

1. 项目概述:从“极速越野”看智能车竞赛的硬核魅力 如果你是一名对电子、机械、编程感兴趣的大学生,或者是一位想让孩子接触硬核科技竞赛的家长,那么“全国大学生智能车竞赛”这个名字你一定不陌生。而“越野组”,无疑是这项赛事…

2026/10/6 16:56:11 阅读更多 →

最新新闻

WPS表格函数公式实战:VLOOKUP、SUMIFS避坑与组合应用

WPS表格函数公式实战:VLOOKUP、SUMIFS避坑与组合应用

简介:WPS官方函数公式视频教程是一份面向职场办公与数据分析人群的精选函数指南,旨在帮助用户系统掌握VLOOKUP、IF、SUMIF、COUNTIF等高频函数的实用技巧,解决数据处理中查找、统计、排序与日期计算的常见难题。压缩包共1个PDF文件&#xff0…

2026/10/11 10:28:12 阅读更多 →
预算只有几万块,要不要单独做GEO?看两个信号

预算只有几万块,要不要单独做GEO?看两个信号

预算只有几万块,值不值得单独做GEO?答案不在预算大小,而在两件事:你的行业有没有被AI模型高频问到,手里有没有现成内容能被引用。两样都没有,钱砸进去也看不到效果,这篇就按这个思路往下拆。 先…

2026/10/11 10:28:11 阅读更多 →
Node.js 定时任务的幂等与恢复设计:从重复触发到可靠执行

Node.js 定时任务的幂等与恢复设计:从重复触发到可靠执行

问题背景:定时触发不等于可靠执行 在 Node.js 服务中,用 setInterval 或 cron 库启动任务很容易,难点是让任务在重复触发、进程崩溃和服务停机之后,仍然产生正确的业务结果。例如,每天给符合条件的账户发放积分。部署多…

2026/10/11 10:28:11 阅读更多 →
长代码场景首选 ClaudeCode 搭配全离线内网工具,TaoToken 统一 Key 打通 RPA 7×24 小时落地

长代码场景首选 ClaudeCode 搭配全离线内网工具,TaoToken 统一 Key 打通 RPA 7×24 小时落地

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:28:11 阅读更多 →
Spring Boot物联网平台密钥泄露应急:密钥轮换与设备禁用实战

Spring Boot物联网平台密钥泄露应急:密钥轮换与设备禁用实战

半夜三点,手机震动把我从梦里拉出来。电话那头是运维同事的声音:“平台上一批设备密钥出现在日志截图里,已经有人拿着这个 Key 在尝试调设备接口了。”那一瞬间我脑子里的第一反应不是“要不要切备份”,而是“设备密钥泄露了怎么办…

2026/10/11 10:28:11 阅读更多 →
批处理执行模型与避坑实战:变量展开、括号块与for /f解析

批处理执行模型与避坑实战:变量展开、括号块与for /f解析

简介:《Windows命令行(批处理)语法全解》是一份面向Windows运维人员、开发者和脚本初学者的批处理语法参考文档。文档系统介绍了Command Shell与PowerShell两种命令行环境,不仅讲解如何编写.bat批处理文件,还深入分析了命令重定向运算符、for…

2026/10/11 10:27:11 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →