终端智能体基准测试:TerminalWorld如何评估AI在真实环境下的可靠性
1. 项目概述为什么我们需要一个“终端世界”来评测智能体如果你最近关注AI领域尤其是围绕大语言模型LLM构建的智能体Agents可能会发现一个现象演示视频里智能体在模拟的、干净的测试环境中总能流畅地完成任务比如“列出当前目录文件”或“创建一个简单的Python脚本”。然而一旦你把它放到自己那台装着各种老旧依赖、配置混乱、时不时弹出权限错误的真实开发机上它的表现往往大打折扣甚至寸步难行。这中间的鸿沟正是“TerminalWorld”这个基准测试项目试图填补的核心问题。简单来说TerminalWorld 是一个专门为评估和基准测试“终端智能体”而设计的真实世界任务集。它不是一个简单的命令集而是一个模拟了真实开发者工作流的、充满“陷阱”和复杂依赖的沙盒环境。这里的“终端任务”远不止是执行ls或cd而是涵盖了从环境配置、故障排查、多步骤工作流到与复杂CLI工具交互的全过程。它的出现直接回应了当前AI智能体评测中的一个关键痛点我们如何知道一个智能体在真实、混乱、不可预测的终端环境里是否真的可靠、高效且安全对于开发者、研究者和AI产品经理而言TerminalWorld 的价值在于提供了一个客观、可复现的“标尺”。过去我们评价一个智能体可能靠感觉或者几个精心设计的演示。现在我们可以说“它在TerminalWorld的‘软件包依赖地狱’场景中解决了95%的问题但在‘调试模糊的编译错误’场景中成功率只有60%。” 这种量化的、基于真实场景的评估是推动智能体从“玩具”走向“工具”的关键一步。2. 核心设计思路构建一个“足够真实”的测试沙盒构建一个终端智能体的基准测试最大的挑战在于平衡“可控性”与“真实性”。测试必须在隔离的沙盒中进行以防智能体的错误操作破坏宿主机但同时这个沙盒必须足够“像”一台真实的、被长期使用的开发机。TerminalWorld 的设计思路正是围绕这一矛盾展开的。2.1 任务场景的选取与分类TerminalWorld 没有采用随机命令组合的方式而是从真实的软件开发、系统运维和数据处理工作流中抽象出核心任务场景。这些场景通常具备以下特点多步骤性一个任务很少由单一命令完成。例如“搭建一个本地Python数据分析环境”可能涉及检查Python版本、安装pip、用虚拟环境隔离、通过可能很慢的网络安装特定版本的pandas和numpy最后还可能因为缺少系统库如libblas而失败。模糊性与歧义性真实世界的指令往往是模糊的。用户可能说“清理一下磁盘空间”智能体需要自己判断是查找大文件、清理包管理器缓存还是查看日志轮转设置。依赖与状态性任务之间存在依赖关系。任务B的成功执行可能依赖于任务A创建的某个文件或设置的环境变量。智能体需要理解并管理这种状态。错误处理与恢复真实终端充斥着“命令未找到”、“权限被拒绝”、“文件已存在”、“网络超时”等各种错误。一个优秀的智能体不能一遇错误就停止它需要解读错误信息、尝试替代方案或优雅地报告阻塞点。基于这些特点TerminalWorld 的任务库大致可以分为几类环境配置与初始化例如在全新的容器或虚拟机中从一个最小化系统配置成可用的开发环境。故障诊断与修复给定一个出错的症状如“服务A启动失败”要求智能体通过查看日志、检查配置、测试连通性等步骤定位并解决问题。数据获取与处理流水线例如从远程API获取JSON数据进行过滤、转换最后输出为CSV报告。与复杂CLI工具的交互如使用git进行包含解决冲突的复杂操作、使用kubectl管理Kubernetes资源、使用aws-cli操作云服务等。2.2 沙盒环境的设计哲学为了安全地运行这些任务TerminalWorld 的核心是一个精心构造的沙盒环境。这个环境通常基于Docker容器但进行了深度定制不完全干净的起点与许多测试从“纯净”系统开始不同TerminalWorld 的沙盒可能预装了一些半旧不新的软件包、存在一些残留的配置文件、甚至有一些故意设置的“坑”如错误的软链接、满的/tmp分区。这模拟了用户接手一台“祖传”服务器或长期使用的个人电脑的场景。资源限制与干扰沙盒会模拟真实的资源限制如有限的磁盘空间、缓慢的网络通过tc命令模拟延迟和丢包、或受限的CPU份额。智能体需要学会在资源受限下工作并识别由资源不足导致的问题。状态持久化与任务链沙盒支持在系列任务中保持状态。智能体在任务1中创建的文件和设置的环境在任务2中依然存在。这要求智能体具备“记忆”和“规划”能力不能把每个任务当作独立事件。安全边界与监控所有操作被严格限制在沙盒内。同时沙盒会详细监控智能体的每一个行为执行了哪些命令、输出了什么、修改了哪些文件、尝试了哪些非法操作如试图逃逸到宿主机。这不仅用于评分也是分析智能体行为模式和安全性的重要数据。3. 评测体系如何量化智能体的“终端智商”有了任务和沙盒下一步就是定义“做得好”的标准。TerminalWorld 的评测体系是多维度的不仅仅看任务最终是否成功。3.1 核心评测指标任务成功率最直接的指标即智能体在限定步骤或时间内独立完成任务的百分比。这是基准线。步骤效率成功完成任务所花费的步骤命令数。一个高效的智能体应该能用最少的命令达成目标避免冗余操作。例如要安装多个包pip install pkg1 pkg2 pkg3就比分别执行三次pip install更高效。时间效率完成任务所花费的挂钟时间。这与步骤效率相关但更复杂因为涉及到命令的执行时间如下载、编译。一个智能体如果能在执行长时间操作的同时并行开展其他检查就能获得更好的时间分数。安全性与合规性监控智能体是否尝试了危险操作如rm -rf /、未经授权的网络访问、是否遵循了最小权限原则在可用时使用sudo而非默认root、以及是否在操作前对关键修改进行了确认或备份。违反安全规约会扣分甚至直接判定任务失败。交互质量对于需要与用户模拟交互的场景评估智能体指令的清晰度、对问题的理解深度以及解释的易懂性。例如当遇到权限错误时是直接粗暴地建议sudo还是先解释原因并给出更安全的解决方案如修改文件所有权鲁棒性与错误恢复故意在任务中注入错误如拼写错误的命令、不存在的文件路径。评估智能体是否能识别错误、从错误信息中提取有用线索、并尝试合理的恢复策略如检查命令是否可用、搜索相似命名的文件。3.2 评分机制与基准线TerminalWorld 会为每个任务设定一个“黄金参考路径”即人类专家完成该任务的最优或典型步骤序列。智能体的表现会与这个参考路径进行对比。评分不是非黑即白的而是加权组合上述指标。例如一个任务可能这样评分成功完成基础分 100分。步骤数每比参考路径多一步扣2分。执行了危险命令每次扣20分。成功从注入的错误中恢复额外加15分。提供了清晰的中途解释额外加10分。最终会生成一个综合评分报告并可能在不同的任务类别如“系统管理”、“开发运维”、“数据处理”中分别设立排行榜。同时项目会维护一个基于开源模型的基准线Baseline让新的智能体有一个明确的追赶或超越目标。4. 对智能体架构的启示与挑战参与TerminalWorld评测不仅仅是为了获得一个排名其过程本身对智能体的架构设计提出了深刻的挑战并指明了改进方向。4.1 核心能力要求强大的上下文理解与记忆智能体必须能长时间维持对话和操作历史理解当前状态是之前哪些操作的结果。这对于解决“任务链”场景至关重要。简单的“一问一答、答完即忘”的模式在这里完全行不通。对终端语义的深度理解这不仅仅是把自然语言翻译成命令。智能体需要理解命令的副作用、文件系统的状态变化、环境变量的影响、进程间的关系。例如它需要知道source ~/.bashrc和./script.sh的区别知道放入后台的进程如何管理。规划与推理能力面对一个复杂任务智能体需要将其分解为子目标并规划执行顺序。它需要能预判某些操作的可能结果并在遇到障碍时进行重新规划。例如在安装软件前先检查磁盘空间在编译前先解决依赖。主动探索与信息获取当信息不足时优秀的智能体应该会主动使用man、--help、apt-cache search、find、grep等工具去探索系统、查找文档或定位文件而不是坐等用户给出所有信息。安全意识的內建安全不能是事后添加的补丁而必须内建于决策核心。智能体应在建议任何具有破坏性或权限提升的操作前进行风险提示并优先寻找更安全的替代方案。4.2 技术实现上的难点长上下文窗口的消耗记录完整的终端会话包括大量命令输出会迅速耗尽大多数LLM的上下文窗口。需要设计高效的摘要、选择性记忆和关键信息提取机制。工具使用的准确性与灵活性如何让智能体在成千上万的命令行工具中准确选择并组合使用这需要庞大的工具知识库和精准的检索能力。同时工具的输出可能是结构化JSON也可能是杂乱的多行文本需要被有效解析和理解。状态管理的复杂性沙盒内的系统状态是动态且高维的。智能体需要有一个内部的“世界模型”来跟踪重要状态的变化如某个关键文件的内容、某个服务的运行状态而不是每次都重新查询。评估的自动化与客观性如何自动判断智能体对错误信息的“理解”是否到位如何量化“解释的清晰度”这些主观性较强的指标需要设计巧妙的自动化评估方法例如使用另一个LLM作为评判员或者设计可量化的代理指标如用户模拟器提出后续问题的次数。5. 实操如何利用TerminalWorld评估或训练你自己的智能体假设你正在开发一个终端辅助智能体并希望用TerminalWorld来检验其成色或者利用其任务进行训练可以遵循以下路径。5.1 环境准备与接入首先你需要让你的智能体能够与TerminalWorld的沙盒环境交互。这通常通过一个定义良好的API来实现。获取TerminalWorld从项目仓库如GitHub克隆代码和任务定义。理解交互协议TerminalWorld 会为你的智能体提供一个会话接口。你的智能体接收当前的沙盒状态可能是当前工作目录、之前命令的输出、任务描述然后需要输出下一个要执行的命令或一组命令。沙盒执行该命令后将结果返回循环往复直到任务完成或超时。封装你的智能体你需要编写一个“适配器”将你的智能体核心可能是调用某个LLM API与TerminalWorld的接口连接起来。这个适配器负责接收沙盒状态并格式化为你的智能体能理解的提示Prompt。将你的智能体生成的“想法”或“命令”解析为TerminalWorld要求的动作格式。处理超时、中断等控制信号。一个简化的交互流程伪代码如下# 伪代码示例 def run_agent_on_task(task_description, sandbox_client): state sandbox_client.initialize(task_description) while not state.is_terminal(): # 任务未完成也未失败 # 构建给LLM的提示包含历史、当前状态、任务目标 prompt construct_prompt(state.history, state.current_output, task_description) # 你的智能体核心生成下一步动作 agent_response your_llm_client.generate(prompt) # 解析响应提取要执行的命令 next_command parse_command(agent_response) # 在沙盒中执行命令 state sandbox_client.execute(next_command) # 记录历史用于下一轮 state.history.append((next_command, state.current_output)) return state.get_score()5.2 训练策略与技巧如果你不仅想评测还想用TerminalWorld的任务来训练或微调你的智能体以下策略可能有效模仿学习利用任务提供的“黄金参考路径”作为专家演示进行行为克隆。你可以用状态 专家动作这样的配对数据来微调你的模型让它学习在特定状态下应该采取什么动作。强化学习将TerminalWorld的评分作为奖励信号。智能体通过尝试不同的动作序列来最大化累计奖励。由于终端动作空间巨大且探索成本高一个错误命令可能破坏状态这通常需要与模仿学习结合或者使用高级的规划算法。课程学习不要一开始就挑战最复杂的任务。从简单的、单步的任务开始如“用cat查看文件内容”逐步过渡到多步骤任务如“查找并替换文件中的文本”最后再尝试需要规划和错误恢复的复杂任务。TerminalWorld的任务通常有难度标签可以利用这一点设计训练课程。反思与复盘在智能体失败的任务上进行人工或自动化的复盘分析。为什么它会做出错误的决策是上下文理解有误是工具知识缺乏还是规划逻辑有漏洞将这些失败案例转化为针对性的训练数据或规则能有效提升智能体的性能。5.3 常见陷阱与避坑指南在实际接入和评估过程中我遇到过不少坑这里分享几个关键点注意过度依赖“模式匹配”。早期的智能体容易陷入一种模式看到“安装”就调用apt-get install看到“查找”就用grep。但在TerminalWorld的真实场景里这可能完全错误。比如在一个基于Alpine Linux的容器里使用apk包管理器apt-get根本不存在。智能体必须首先识别出系统环境例如通过cat /etc/os-release再选择正确的工具。教训是智能体的第一反应应该是“观察环境”而不是“执行动作”。注意对错误信息的处理过于肤浅。很多智能体只是把错误信息原样返回给用户或者给出一个笼统的建议。在TerminalWorld中错误信息是黄金线索。例如“Permission denied”可能意味着需要sudo也可能意味着文件不存在对父目录无读取权限或者SELinux策略限制。智能体应该引导用户或自行执行更深入的诊断如ls -la查看权限dmesg | tail查看内核日志。核心技巧训练智能体将常见的错误信息与一系列诊断命令关联起来形成“如果-那么”的排查树。注意忽视操作的副作用和状态残留。智能体可能成功完成了当前任务但其操作却破坏了后续任务的环境。例如为了完成任务A它修改了一个全局配置文件如/etc/environment导致任务B运行时环境变量混乱。最佳实践在设计中鼓励智能体使用“局部化”操作如优先使用虚拟环境、在用户目录下操作、在修改重要文件前进行备份。在评分体系中对造成全局状态污染的行为进行扣分。另一个容易被忽视的点是网络和外部依赖。TerminalWorld 会模拟网络延迟和失败。如果你的智能体设计是遇到curl下载超时就不断重试可能会在延迟很高的场景下耗尽步骤限制。它需要学会设置超时参数、寻找镜像源、或者判断网络是否根本不可用并给出相应提示。6. 未来展望超越基准测试走向通用终端智能TerminalWorld 作为一个基准测试其终极目的不是创造一个在特定测试集上得高分的“应试AI”而是推动整个领域朝着构建真正通用、可靠的终端智能体迈进。我认为下一步的发展会集中在以下几个方向任务泛化与零样本学习未来的智能体应该能在TerminalWorld上看到一类任务如“配置Web服务器”然后将其能力泛化到全新的、但同类的真实世界任务中。这要求模型具备更深层的原理性理解而不是简单的指令-动作映射。多模态终端交互终端工作不仅仅是文本命令。有时需要处理图形化TUI文本用户界面工具如htop,ncdu, 或vim。更高级的智能体可能需要理解屏幕上的布局、焦点位置并模拟键盘事件进行交互。这将是另一个维度的挑战。与人协同的混合智能最实用的场景不是完全自主的智能体而是作为人类的增强副驾。智能体需要更好地理解用户的意图即使是模糊的主动提出澄清性问题提供多个备选方案并解释利弊并在获得授权后才执行高风险操作。评测体系也需要加入对人机协作效率的衡量。安全与伦理的深度集成随着智能体能力变强其潜在风险也越大。未来的基准测试必须包含更复杂的安全和伦理场景例如当被要求执行一个合法但可能泄露隐私信息的命令时智能体应该如何应对这需要将伦理准则和安全策略更深地编码到智能体的决策逻辑中。从我个人的实践来看TerminalWorld 这类基准的出现就像给狂奔的AI智能体领域安装了一个“仪表盘”。它让我们从炫酷的演示中冷静下来用客观的数据看清差距所在。开发一个能在干净实验室里通过测试的智能体或许不难但打造一个能在你我那台装着各种历史遗留问题、配置千奇百怪的开发机上真正提供帮助的伙伴还有很长的路要走。而这条路正是由一个个像TerminalWorld这样严谨、真实的基准测试铺就的。

相关新闻

从零转型AI大模型:学习路径与求职实战指南

从零转型AI大模型:学习路径与求职实战指南

1. 从传统行业到AI大模型的转型之路 去年这个时候,我还在某互联网公司做着与AI毫不相关的工作。每天面对重复性的业务需求,越来越感受到职业发展的瓶颈。直到偶然接触到大模型技术,那种"原来还能这样"的震撼感,彻底改变…

2026/8/21 4:15:36 阅读更多 →
Springboot中使用Elasticsearch(部署+使用+讲解 最完整)

Springboot中使用Elasticsearch(部署+使用+讲解 最完整)

目录引言一、docker中安装Elasticsearch1、创建es专有的网络2、开放端口3、在es-net网络上安装es和kibana4、可能出现的问题5、测试6、安装IK分词器7、测试IK分词器二、结合业务实战1、准备依赖2、配置yml3、读取yml配置4、准备es配置类5、编写测试代码6、使用mq异步修改es的表…

2026/8/21 4:15:36 阅读更多 →
计算机二级WPS Office真题精讲:从核心考点到实战通关

计算机二级WPS Office真题精讲:从核心考点到实战通关

大家好,我是专注于办公软件技能分享的技术博主。最近很多同学在准备计算机二级WPS Office考试,面对动辄十几套的真题,常常感到无从下手,不知道重点在哪,也不知道如何高效练习。本文将围绕“计算机二级WPS Office真题精…

2026/8/21 4:15:36 阅读更多 →

最新新闻

2026年Java面试核心知识点与高频考点解析

2026年Java面试核心知识点与高频考点解析

1. 项目概述"Java面试题及答案整理(2026年牛客网最新版,持续更新)"这个项目是面向Java开发者的一份系统性面试准备资料。作为在技术面试领域深耕多年的从业者,我深知一份优质的面试题库对求职者的重要性。这份资料不仅涵…

2026/8/21 4:54:47 阅读更多 →
30天落地零售经营分析驾驶舱:从选型到验收的全流程实战

30天落地零售经营分析驾驶舱:从选型到验收的全流程实战

## 导语当前零售行业已经进入精细化运营的深水区,经营分析驾驶舱本应成为企业从老板到一线统一目标、监控业务、快速决策的核心抓手,但多数企业在落地过程中都踩过共性的坑,三个普遍痛点尤其突出:一是项目推进周期严重失控&#x…

2026/8/21 4:54:47 阅读更多 →
Salesforce校招OA回文子串算法解析与备考策略

Salesforce校招OA回文子串算法解析与备考策略

1. 项目概述最近在准备2026年Salesforce校招OA(Online Assessment)的同学们注意了,这次90分钟2题的在线测评中,回文子串类算法题成为了高频考点。作为过来人,我整理了最新真题解析和备考策略,帮助大家高效攻…

2026/8/21 4:54:47 阅读更多 →
足浴行业智能招聘解决方案与成本优化

足浴行业智能招聘解决方案与成本优化

1. 足浴行业招聘痛点与解决方案在足浴行业摸爬滚打多年,见过太多同行在招聘技师时踩坑。传统招聘渠道存在三大致命伤:一是虚假简历泛滥,二是中介抽成过高(普遍达到技师首月工资的30-50%),三是匹配效率低下。…

2026/8/21 4:54:47 阅读更多 →
华为OD机试:黑白棋合法移动算法实现与优化

华为OD机试:黑白棋合法移动算法实现与优化

1. 项目背景与问题定义黑白棋(又称翻转棋)是一种经典的策略性棋盘游戏,在华为OD机试中常作为考察编程能力的题目出现。这类题目通常要求考生在NN的棋盘上模拟棋子移动规则,并计算特定条件下的合法移动范围。这个问题的核心在于理解…

2026/8/21 4:53:47 阅读更多 →
深度解析QCA8334-AL3C:高通4端口工业级千兆二层交换芯片架构与应用

深度解析QCA8334-AL3C:高通4端口工业级千兆二层交换芯片架构与应用

QCA8334-AL3C:高通4端口二层千兆以太网交换芯片深度解析 在工业交换机、企业级网关以及物联网边缘设备等网络硬件设计中,以太网交换芯片的选择直接决定了整机的端口密度、转发性能以及长期可靠性。传统的软件桥接方案在带宽和延迟方面存在明显瓶颈&…

2026/8/21 4:53:47 阅读更多 →

日新闻

机场边检旅客定位系统国产化白皮书:算法、硬件、底座平台全程自主

机场边检旅客定位系统国产化白皮书:算法、硬件、底座平台全程自主

前言随着国家数字基础设施信创替代、关键技术自主可控战略持续深化,口岸智慧安防、边检智能管控领域正全面进入国产化、自主化、安全可控升级周期。当前国内机场边检旅客识别与定位体系长期依赖国外商用视觉算法、进口成像硬件、闭源通用计算平台,存在核…

2026/8/21 0:00:42 阅读更多 →
别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱

别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱

别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱当下数字化建设浪潮中,很多项目将三维可视化、视频贴图叠加的数字孪生等同于空间智能。传统数字孪生更多停留在三维场景复刻,擅长把物理世界“画出来、展示出来”,…

2026/8/21 0:00:42 阅读更多 →
105、车载温度范围-40°C到85°C的影像质量一致性——ISP参数温漂补偿与产线标定策略

105、车载温度范围-40°C到85°C的影像质量一致性——ISP参数温漂补偿与产线标定策略

105、车载温度范围-40C到85C的影像质量一致性——ISP参数温漂补偿与产线标定策略 去年冬天在北方某车厂做A样评审,凌晨四点的黑河试验场,零下三十三度。客户拿了一台冷启动的车,中控屏上倒车影像全是雪花噪点,暗部细节直接糊成一片。我第一反应是sensor温度没上来,暗电流…

2026/8/21 0:00:42 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/21 3:21:33 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/21 0:02:09 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/19 11:55:16 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/20 6:11:08 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/20 21:46:49 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/21 0:14:22 阅读更多 →