智能体训练新范式:RPSR如何通过反思优化提升大模型决策能力
1. 项目缘起当智能体训练撞上“事后诸葛亮”最近在折腾大语言模型智能体训练时我遇到了一个挺有意思的瓶颈。我们团队设计了一个能处理多步骤任务的智能体比如让它根据用户需求去规划、调用工具、整合信息。训练初期它表现得像个莽撞的新手规划路径常常南辕北辙工具调用顺序混乱甚至在任务中途就“卡壳”了。我们用传统的强化学习比如PPO去微调效果有但总觉得差点意思——模型好像只是在机械地学习“在某个状态下哪个动作的奖励更高”至于这个动作为什么好为什么不好它似乎缺乏一种深层次的“反思”能力。这让我想起了人类学习的过程。我们做完一件事尤其是搞砸了之后总会复盘“我当时第一步是不是就错了”“如果中间换种做法结果会不会更好”“下次遇到类似情况我该注意什么”这种基于过往经历Retrospective的、结合任务进展Progress-Aware的自我审视Self-Refinement恰恰是当前很多LLM智能体训练范式所缺失的。它们更像是在接受“填鸭式”教育而非主动的“经验总结式”学习。于是我开始琢磨能不能把这种“事后诸葛亮”的智慧系统地引入到智能体的训练循环里不是简单地给最终结果打分而是让智能体学会回顾自己的整个行动轨迹结合任务目标的完成进度去诊断问题、提炼经验并主动优化未来的决策策略。这就是“Retrospective Progress-Aware Self-Refinement”回顾性进度感知自我优化后面简称RPSR这个想法最初的来源。它不是一个现成的工具包而是一套训练范式的设计思路核心目标是提升智能体从自身经验中学习、进化的效率与质量。2. RPSR的核心思想拆解不止于奖励更在于诊断要理解RPSR得先把它拆开来看。这三个词——“Retrospective”、“Progress-Aware”、“Self-Refinement”——共同定义了一种更精细、更内省的学习机制。2.1 Retrospective回顾性从结果反推过程传统的强化学习奖励信号很多时候是一个“终点式”的标量。任务成功了给1失败了给-1或者根据最终产出质量给出一个连续分数。这就像考试只告诉你总分不批改试卷。RPSR强调的“回顾性”要求智能体或者说训练框架必须审视完整的行动轨迹Action Trajectory。这包括序列决策记录智能体每一步选择了什么动作如调用哪个API、生成什么文本。中间状态与观察每一步执行后环境或工具返回的反馈是什么。子目标达成情况对于复杂任务是否完成了某些关键的里程碑。回顾的目的是建立“因”特定序列的决策与“果”最终的任务表现之间更细致的关联而不仅仅是一个笼统的关联。2.2 Progress-Aware进度感知量化“做到哪一步了”这是RPSR区别于简单轨迹分析的关键。很多任务不是非黑即白的而是有一个渐进的完成度。例如一个“撰写市场分析报告”的任务进度可能包括搜集数据30%、分析数据50%、生成大纲70%、撰写初稿90%、润色定稿100%。如果智能体在分析数据阶段就出错了导致后续步骤无法进行那么它的失败点是在50%的进度上。进度感知意味着训练框架需要或引导模型学会对任务进度进行量化或定性评估。这能带来两个好处更精准的归因失败是因为早期规划错误还是后期执行偏差在50%进度上的错误其责任和需要调整的策略与在90%进度上的错误截然不同。提供中间奖励信号可以设计基于进度的稀疏奖励鼓励智能体稳步推进而不仅仅是追求最终结果。2.3 Self-Refinement自我优化让智能体成为自己的教练这是最终的落脚点。基于回顾性分析和进度感知RPSR旨在驱动智能体进行自我优化。这种优化可以发生在两个层面策略层面Policy Refinement调整模型内部的决策参数。例如通过强化学习将“在进度30%、遇到某类数据缺失时选择调用补充搜索工具而非强行继续”这条经验固化到策略网络中。推理层面Reasoning Refinement优化智能体的“思考过程”。例如让模型生成对本次任务执行的“反思总结”我哪里做得好哪里出了问题如果重来我会怎么调整我的计划这种反思文本可以作为高质量的思维链Chain-of-Thought数据用于后续的监督微调SFT直接提升模型的任务拆解和规划能力。所以RPSR的整体逻辑是引导智能体像一个有经验的工作者一样在完成任务无论成败后不是被动等待一个分数而是主动回顾全过程结合任务进度评估每一步的得失并从中提炼出可执行的改进方案用于优化自己未来的表现。这是一种将强化学习的试错学习与模型自身强大的推理、总结能力相结合的高级训练范式。3. 实现RPSR的关键组件与架构设计纸上谈兵容易真正要把RPSR的思路落地需要设计一套具体的架构。这里我结合自己的实验和业界的一些前沿思路梳理出一个可行的框架它主要包含以下几个核心组件3.1 轨迹记录与存储模块这是数据基础。我们需要完整记录智能体与环境或工具集交互的每一个回合Episode。每条轨迹记录应包含任务指令Instruction初始的用户请求。初始状态Initial State。动作序列Action Sequence每一步模型输出的动作如函数调用。观察序列Observation Sequence环境对每个动作的反馈。最终结果与奖励Final Outcome Reward任务的最终输出和外部评估器或人工给出的奖励分数。元数据Metadata如时间戳、模型版本、环境配置等。这些轨迹数据需要被系统地存储和管理形成一个不断增长的“经验池”。这个池子不仅是当前训练轮次的数据源更是未来进行回顾性分析的宝贵资源库。3.2 进度评估器Progress Estimator这是实现“Progress-Aware”的难点和核心。我们需要一个能够自动、动态评估任务进度的模块。根据任务复杂度可以有不同实现方式基于规则的进度评估对于流程明确的任务如“订机票-选座位-付款”可以预先定义状态机进度根据当前所处的状态节点来确定。这种方式精确但缺乏灵活性。基于模型的进度评估训练一个独立的进度预测模型。输入是当前的任务描述、已执行的动作序列和观察结果输出是一个0到1之间的进度标量。这个模型可以通过对已完成任务轨迹进行标注人工标注或启发式规则标注来训练。例如对于一个编程任务每通过一个测试用例进度就增加一部分。基于LLM的零样本/少样本评估直接使用一个强大的LLM如GPT-4作为评估器给定任务描述和当前轨迹让其判断“当前任务完成了百分之多少并简述理由”。这种方法灵活度高但成本也高且可能存在不一致性。在实际中我倾向于采用“规则打底LLM校准”的混合策略。对于有明显里程碑的任务先用规则定义基础进度对于模糊或复杂的子步骤用轻量级提示调用LLM进行微调评估并将评估结果反馈给规则系统逐步迭代。3.3 反思总结生成器Reflection Generator这是驱动“Self-Refinement”的引擎。它的任务是基于完整的轨迹和进度评估生成结构化的反思文本。提示词Prompt的设计至关重要。一个有效的反思提示可能包含你是一个善于从经验中学习的AI助手。请回顾你刚刚完成的任务 任务目标[插入任务指令] 你的行动记录[插入动作序列] 环境反馈[插入观察序列] 任务最终进度评估[插入进度评估结果如“完成70%”或“失败于数据搜集阶段”] 最终结果[插入最终输出和奖励分数] 请从以下角度进行反思 1. **成功之处**哪些步骤有效地推进了任务为什么这些决策是好的 2. **关键问题**任务在哪个环节出现了停滞或偏差直接原因是什么例如工具选择错误、信息理解偏差、规划逻辑缺陷 3. **根因分析**导致上述问题的深层原因是什么例如对任务某部分的理解不足、忽略了某个约束条件、工具API使用方式错误 4. **改进方案**如果让你重新执行这个任务你会如何调整你的行动计划请给出具体的、可操作的步骤修改建议。这个模块的输出——高质量的反思文本——是后续优化步骤的黄金数据。3.4 优化执行器Optimization Executor这是将反思转化为实际改进的环节。根据反思内容的不同优化可以走不同的路径生成训练数据用于SFT将“任务指令 反思后改进的规划/行动”作为新的高质量对话数据对模型进行监督微调。这直接提升了模型的规划能力。例如原来失败的轨迹经过反思生成了正确的计划这个“指令-正确计划”对就是极好的SFT数据。构造偏好对用于RLHF对于同一任务指令我们可以有“原始失败轨迹”和“反思后建议的成功轨迹”。这两者可以构成一个偏好对后者优于前者用于训练奖励模型进而通过PPO等算法优化策略。这比单纯使用最终成功/失败作为标签要精细得多。更新内部知识或提示对于一些可归纳的经验如“调用某API时参数X必须大于Y”可以将这些经验总结成结构化的知识条目存入智能体的内部知识库或在系统提示System Prompt中动态添加注意事项。3.5 整体训练循环架构将这些组件串联起来一个完整的RPSR训练循环大致如下采样与执行从任务分布中采样一个任务让当前策略的智能体执行产生一条轨迹存入经验池。进度评估调用进度评估器对该轨迹进行进度打分。反思生成对于未完成或低质量的轨迹例如进度80%或奖励低于阈值调用反思总结生成器产生反思文本。数据构建利用反思文本构建SFT数据或RLHF偏好对数据。模型更新使用新构建的数据以一定的频率如每收集N条反思数据后对模型进行微调SFT或强化学习RL更新。迭代更新后的模型进入下一轮采样与执行形成“实践-反思-优化-再实践”的闭环。这个循环可以是在线on-policy的即用最新模型产生的数据立即优化它自己也可以是离线off-policy的即用一个旧策略收集大量数据然后进行批量反思和优化。在线方式更及时离线方式更稳定可以根据资源情况选择。4. 实战中的挑战与应对策略在具体实现RPSR框架时我踩过不少坑也总结出一些让这套机制更有效、更稳定的经验。4.1 挑战一进度评估的噪音与不一致性这是最初遇到的最大问题。无论是基于规则的还是LLM评估的进度都可能出现波动。比如同一个半成品今天评估是60%明天可能变成55%。这种噪音会传导至反思环节导致反思焦点漂移。应对策略多评估器投票对于关键轨迹使用多个评估器如规则两个不同提示的LLM进行评估取中位数或经过一致性检验的结果。进度平滑不是对单条轨迹的进度“斤斤计较”而是关注一个批次Batch内轨迹的进度分布变化。训练的目标是让模型产生高进度轨迹的比例稳步上升而不是纠结于某一条的进度是58%还是62%。定性标签辅助除了百分比增加定性标签如“规划阶段失败”、“执行阶段失败”、“工具错误”、“逻辑错误”等。反思生成器可以同时参考进度值和定性标签使反思更聚焦。4.2 挑战二反思质量参差不齐LLM生成的反思有时会流于表面比如只会说“我错了下次要更仔细”缺乏具体、可操作的洞见。有时甚至会“胡说八道”编造不存在的错误。应对策略结构化提示与强制输出如前文所示使用高度结构化的提示强制要求从几个固定角度分析。可以要求输出为JSON格式便于后续程序化处理。自我验证在反思生成后增加一个“反思验证”步骤。用另一个简单的提示让LLM判断“基于给定的轨迹这份反思中指出的问题是否真实存在”过滤掉明显不靠谱的反思。基于成功轨迹的正面反思不要只对失败轨迹进行反思。对成功轨迹同样进行反思总结“成功的关键因素是什么”。这些正面经验对于构建偏好对和SFT数据同样宝贵能告诉模型“什么是对的”而不仅仅是“什么是错的”。4.3 挑战三训练不稳定与遗忘引入反思数据后特别是进行SFT可能会导致模型在原始指令跟随能力上出现退化或者学到的改进策略过于特定无法泛化。应对策略数据混合在每一轮训练中将新生成的反思数据无论是SFT还是偏好对与原始的、高质量的基础指令数据混合。混合比例需要小心调整通常反思数据占比不宜过高例如10%-30%以确保模型核心能力不丢失。课程学习从简单的任务开始应用RPSR循环让模型先学会对简单错误进行反思。随着模型能力提升再逐步引入更复杂的任务。这好比让学生先学会检查算术错误再学习检查论文的逻辑漏洞。定期在验证集上评估不仅看训练任务上的表现更要关注在一个干净的、未见过的验证任务集上的表现。如果验证集性能下降需要暂停反思数据的注入回溯检查反思质量或调整混合比例。4.4 挑战四计算与成本开销完整的RPSR循环涉及多次LLM调用进度评估、反思生成、验证特别是如果使用大型商用API成本会显著增加。应对策略异步与批处理将轨迹存储、进度评估、反思生成等步骤设计为异步流水线。收集一批轨迹后统一进行批量的评估和反思生成可以利用API的批处理功能降低成本。小模型代理探索用较小的、本地部署的模型来承担部分工作。例如用7B或13B参数量的开源模型专门微调成一个“进度评估专家”或“反思生成专家”。虽然质量可能略逊于顶级大模型但成本可控且可以无限次调用。选择性反思并非所有轨迹都需要深度反思。可以设置触发阈值例如只对奖励低于某值、或进度低于某值的轨迹进行完整的反思流程。对于高分轨迹可以只进行简单的成功经验提取。5. 效果评估与迭代方向实施RPSR后如何衡量其效果不能只看训练损失下降更要看智能体在真实任务中的表现提升。5.1 评估指标设计除了最终任务成功率、平均奖励这些传统指标应引入更能体现“反思优化”效果的指标首次尝试成功率First-Attempt Success RateRPSR的目标是让智能体变得更“聪明”减少无谓的试错。首次尝试成功率是核心指标。平均任务进度Average Task Progress即使最终失败看智能体平均能推进到多远这个指标的提升意味着模型“死得更明白”在更后期才出错。反思质量人工评估定期抽样反思文本由人工评估其“诊断准确性”和“建议可行性”分为高、中、低三档。确保反思机制本身在健康发展。在分布外任务上的泛化能力在训练任务分布之外找一些相似但不同的任务进行测试看模型能否将反思中学到的“元技能”如如何规划、如何排查工具错误迁移过去。5.2 一个简化的实验对比为了直观感受RPSR的效果我们可以在一个简单的模拟环境如ALFWorld的一部分子任务中进行A/B测试。对照组使用标准的PPO进行训练实验组在PPO的基础上增加RPSR循环例如每100条轨迹对其中得分最低的20条进行反思并生成SFT数据混合训练。经过数轮迭代后你可能会观察到实验组比对照组更快地达到相同的成功率平台。实验组在复杂任务上的表现优势更明显因为简单任务可能不需要深度反思也能学会。分析实验组的轨迹会发现智能体犯重复性错误的概率显著降低面对相似困境时能更快地调整策略。5.3 未来的迭代方向RPSR是一个框架性思想有很多可以深化和扩展的方向多粒度反思不仅进行任务级别的反思还可以进行步骤级别“我上一步为什么选A不选B”甚至推理链级别“我生成这个思考时哪个假设出了问题”的反思。跨任务经验迁移建立一个“反思知识库”将不同任务中总结出的通用经验如“当信息不全时优先执行查询操作”存储起来在新任务开始时可以作为上下文信息提供给智能体实现“吃一堑长一智”的跨任务学习。与探索策略结合反思不仅用于修正错误也可以用于指导探索。当模型发现自己在某类状态上总是失败时反思结论可以用于调整探索策略主动去尝试那些被反思建议的、未曾试过的动作。自动化提示工程将反思中总结出的有效策略自动转化为系统提示的补充部分动态优化智能体的“初始设定”。从我实际的探索来看将“回顾性进度感知自我优化”引入智能体训练确实像给模型装上了一个“内省”模块。它不再是被动地接受奖励信号的驯化而是开始主动地分析、诊断和规划自己的成长路径。这个过程当然会增加系统的复杂性和计算开销但它所带来的训练效率提升和模型最终呈现出的、更接近人类学习模式的“灵性”让我觉得这些投入是值得的。尤其是对于旨在部署到复杂、开放环境中的智能体这种从自身经验中持续学习和进化的能力或许是走向真正“智能”的关键一步。

相关新闻

零成本解锁Coze工作流:免费导入、解析与运行全攻略

零成本解锁Coze工作流:免费导入、解析与运行全攻略

在实际使用 Coze 这类 AI 应用开发平台时,很多开发者会遇到一个瓶颈:平台的核心功能,尤其是工作流(Workflow)的复杂编排能力,往往与付费计划绑定。对于个人开发者、学生或项目初期的团队,直接付…

2026/8/22 4:08:13 阅读更多 →
Cloudflare 免费 SSL 证书与兼容端口列表科普

Cloudflare 免费 SSL 证书与兼容端口列表科普

Cloudflare 免费 SSL 证书与兼容端口列表科普 一、Cloudflare 的"免费 SSL"到底是什么 很多人第一次用 Cloudflare 时会有个误解:以为域名接入 Cloudflare 后自动获得的那把"小锁"证书,是自己网站真正的 HTTPS 证书。其实不完全是…

2026/8/21 3:39:21 阅读更多 →
加州酒庄烧毁葡萄园:供需失衡下的产业止损与市场调整

加州酒庄烧毁葡萄园:供需失衡下的产业止损与市场调整

1. 先理解“酒庄烧葡萄园”背后的真实困境看到“加州酒庄正在烧毁葡萄园”这个标题,很多人第一反应可能是震惊或不解。这听起来像是一个极端甚至有些荒谬的举动。但如果你身处葡萄酒行业,或者关注农业经济,就会明白这背后是一个典型的“供给过…

2026/8/22 3:55:49 阅读更多 →

最新新闻

熵权法:基于信息熵的客观权重计算原理与Python实现

熵权法:基于信息熵的客观权重计算原理与Python实现

1. 项目概述:从“拍脑袋”到“算权重”在数学建模、数据分析乃至各类决策评估中,我们常常面临一个灵魂拷问:这几个指标,到底谁更重要?比如评价一个城市的综合发展水平,GDP、人均收入、绿化率、空气质量、教…

2026/8/22 6:19:26 阅读更多 →
AI时代技术面试新趋势与应对策略

AI时代技术面试新趋势与应对策略

1. 技术面试的范式转移 2026年的技术面试现场已经和五年前截然不同。当AI辅助编程工具能够自动生成80%的业务代码时,面试官不再满足于考察LeetCode算法题的背诵能力。上周我刚经历了一场典型的2026年SDE终面:系统设计环节需要现场用Copilot X完成模块开发…

2026/8/22 6:19:26 阅读更多 →
AI校招薪资解析:百万年薪offer的技术门槛与突围路径

AI校招薪资解析:百万年薪offer的技术门槛与突围路径

1. AI行业校招薪资现状与市场背景2023年AI领域校招薪资水平持续成为行业焦点话题,头部企业为顶尖人才开出的百万年薪package屡见报端。但真实情况是,这类高薪offer仅集中在特定技术方向的前1%毕业生群体。根据我近三年跟踪的校招数据,AI算法岗…

2026/8/22 6:19:26 阅读更多 →
移动AI智能体的知识驱动推理:从概念到工程实践

移动AI智能体的知识驱动推理:从概念到工程实践

1. 项目概述:当AI智能体开始“思考”最近和几个做AI应用落地的朋友聊天,大家不约而同地提到了同一个痛点:现在的AI智能体(Agent),尤其是面向移动端或具身场景的,能力看起来花哨,但一…

2026/8/22 6:19:26 阅读更多 →
微信小程序云开发实战:从架构设计到性能优化的全链路指南

微信小程序云开发实战:从架构设计到性能优化的全链路指南

1. 项目概述:从零到国奖的实战复盘去年,我带着一支学生团队,用几个月的时间从零开始打磨了一个微信小程序,最终拿下了全国大学生微信小程序应用开发赛的全国三等奖。这个成绩不算顶尖,但整个过程踩过的坑、积累的经验&…

2026/8/22 6:19:26 阅读更多 →
Nginx核心知识点与面试高频问题解析

Nginx核心知识点与面试高频问题解析

1. Nginx面试核心知识点解析作为Web服务领域的瑞士军刀,Nginx在技术面试中的考察频率居高不下。根据我对数百场技术面试的观察统计,Nginx相关问题主要集中在配置优化、架构原理和故障排查三个维度。以下是面试官最常深挖的12个技术要点:1.1 基…

2026/8/22 6:18:26 阅读更多 →

日新闻

沉金PCB工艺实战指南:从设计到SMT焊接的可靠性保障

沉金PCB工艺实战指南:从设计到SMT焊接的可靠性保障

在电子硬件开发领域,PCB(印制电路板)的沉金工艺是提升产品可靠性和焊接质量的关键环节。对于需要高密度互连、长期稳定运行或高频信号传输的板卡,如“黍姐仿通行证”这类可能涉及身份识别、数据交互的硬件项目,选择正确…

2026/8/22 0:00:11 阅读更多 →
电气考研电路八月强化四步法:从知识体系到真题实战的闭环攻略

电气考研电路八月强化四步法:从知识体系到真题实战的闭环攻略

这次我们来看一个针对电气考研电路科目的学习规划项目。它不是软件工具,而是一套聚焦于8月份关键节点的备考策略。对于电气工程考研的同学来说,电路分析是专业课的重中之重,也是拉开分差的关键。进入8月,复习进入强化阶段&#xf…

2026/8/22 0:00:11 阅读更多 →
消除AI代码的“AI味”:Claude Code设计优化技能配置与实战指南

消除AI代码的“AI味”:Claude Code设计优化技能配置与实战指南

大家好,我是专注于前端开发与AI工具实践的技术博主。在日常使用 Claude Code 等AI编程助手时,你是否也遇到过这样的困扰:生成的代码功能上没问题,但代码风格、组件设计、交互逻辑总透着一股“AI味”——布局单调、样式简陋、交互生…

2026/8/22 0:00:11 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/21 3:21:33 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/21 0:02:09 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/21 6:07:56 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/21 16:42:28 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/20 21:46:49 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/22 3:22:48 阅读更多 →