VTAgent:基于智能体关键帧锚定的证据感知视频问答技术
1. 项目缘起当视频问答遇上“证据”难题如果你做过视频内容理解相关的项目尤其是那种需要从一段视频里回答问题的任务你肯定遇到过一种让人头疼的情况模型给出的答案听起来头头是道逻辑自洽但仔细一核对视频内容发现它要么是“脑补”出来的要么是基于视频里某个不重要的片段做的过度推理。比如你问“视频里这个人最后把钥匙放在哪里了”模型可能根据人物走向柜子的趋势就自信地回答“放在了抽屉里”而实际上视频结尾清晰地显示钥匙被挂在了门后的挂钩上。这种“幻觉”问题在纯文本或图像问答中已经很难缠了到了时序更长、信息更冗余的视频领域简直就是灾难。这就是我们做VTAgent这个项目的直接动因。我们想解决的核心痛点是让视频问答Video TextVQA变得“有据可查”。传统的视频问答模型无论是基于密集采帧然后用视觉语言大模型VLMs处理还是用视频Transformer抽取特征本质上都是在学习从海量视频帧特征到答案文本的统计映射。模型很容易学到一些“捷径”比如某些物体、动作或场景文本经常与某些答案共现从而忽略了在当前这段具体视频中支撑某个答案的关键视觉证据究竟出现在哪一帧、哪个位置。“VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA”这个标题拆开来看就是我们的技术蓝图。“Agentic”暗示了我们引入了一种具备自主决策能力的智能体机制“Keyframe Anchoring”是我们的核心方法即对关键帧进行锚定最终目标是实现“Evidence-Aware”即证据感知的视频问答。简单说我们设计了一个智能体它像侦探一样主动在视频时序中巡弋、定位最终将答案牢牢“锚定”在那些包含决定性证据的关键帧上从而让每个答案都有清晰的视觉出处。2. 核心思路拆解从“黑盒”映射到“白盒”推理链在深入代码和实验之前理解我们与传统方法的思维差异至关重要。大多数现有方法可以看作一个“黑盒”映射函数输入所有帧或采样帧的视觉特征和问题文本经过复杂的神经网络变换直接输出答案概率。模型内部如何关联问题与特定帧是隐式的、难以追溯的。VTAgent的思路是将其转化为一个“白盒”的、多步的决策过程。我们受启发于人类观看视频答题的过程先快速浏览视频对内容有个大概印象全局理解然后根据问题在脑海中回放定位到可能相关的几个关键时刻关键帧提议接着仔细审视这些时刻的画面寻找文字、物体、动作等直接证据证据检索与验证最后综合这些证据形成答案答案生成。我们将这个过程抽象为一个智能体Agent的执行流程观察Observation智能体获取当前对视频和问题的理解状态。行动Action基于当前状态智能体决定下一步做什么例如“移动到第t帧进行细粒度观察”或“收集第i帧的某块文本作为证据”。锚定Anchoring当智能体认为找到了足够证据它将执行“锚定”动作把当前聚焦的证据片段可能是某一帧的某个区域与一个正在形成的答案假设关联起来。终止Termination当智能体认为证据充足可以回答问题时它选择生成最终答案。这个框架的关键在于“关键帧锚定”不是预先选好帧然后做问答而是问答过程动态驱动了关键帧的发现与证据的收集。智能体为了回答问题“主动地”去寻找和利用关键帧。2.1 为什么是“Agentic”智能体你可能会问用个强化学习RL智能体不就行了这里有个重要的设计考量。经典的RL智能体在类似任务中其行动空间如跳转到某帧和奖励信号最终答案是否正确之间存在漫长的延迟训练非常不稳定且难以解释。我们的“Agentic”更侧重于设计一种具有自主循环控制能力的模块化架构它借鉴了智能体的“感知-决策-行动”循环思想但用更稳定、可导的方式进行实现。具体来说我们使用了一个基于Transformer的控制器它根据当前累积的上下文循环地决定是继续探索定位新关键帧还是对已锚定的证据进行推理或是生成答案。它的“行动”被设计为可微的注意力操作和特征读写操作从而整个系统可以进行端到端的训练。注意这里的“智能体”并非一个独立的、与环境交互的RL实体而是一个内嵌在模型中的、具有循环决策能力的控制机制。这避免了传统RL训练的高方差问题更适合需要精确证据定位的任务。3. 模型架构深度剖析三阶段锚定推理VTAgent的模型架构是其灵魂我们将其称为“三阶段锚定推理”管道。下面我结合一个具体例子来拆解。假设视频内容是“一个人走进厨房从冰箱上取下便签纸读了一下然后打开冰箱取出牛奶”问题是“便签纸放在哪里”。3.1 阶段一全局感知与关键帧提议输入整个视频的均匀采样帧序列例如每秒1帧和问题文本。 处理视频编码使用一个预训练的视频编码器如TimeSformer、VideoSwin提取每帧的全局特征。同时使用OCR工具如PaddleOCR、EasyOCR抽取每一帧中出现的所有文本及其边界框坐标。文本也被编码为特征。问题编码使用文本编码器如BERT得到问题特征。协同注意力问题特征与每一帧的视觉文本特征进行交叉注意力计算生成一组初步的“帧-问题”相关度分数。这相当于智能体的第一次快速扫视找出所有可能与问题相关的帧。在我们的例子中人物“读便签纸”的帧相关度会很高。关键帧提议根据相关度分数我们不是简单选Top-K帧而是通过一个轻量级提案网络输出若干段视频区间segment以及每段的重要性分数。这些区间就是候选的关键帧段。这一步输出可能包括“走进厨房”、“读便签纸”、“开冰箱”等区间。技术细节与避坑OCR的质量至关重要。模糊、倾斜、艺术字体的文本检出率直接影响后续证据检索。我们实践中采用了对视频帧进行轻度超分辨率预处理并融合了多个OCR引擎的结果再进行去重和纠错。均匀采样 vs 自适应采样在全局感知阶段均匀采样足以覆盖全局上下文。但在后续阶段我们需要对提议的关键帧段进行更高密度的采样例如在“读便签纸”这个2秒的区间内采样5帧以捕捉细节。这个多粒度采样策略是效果提升的关键。3.2 阶段二细粒度证据检索与动态锚定这是VTAgent最核心、最具创新性的部分。智能体开始进入提议的关键帧段进行“仔细勘察”。证据检索循环控制器以当前累积的上下文问题、已锚定的证据、当前聚焦的帧为输入。控制器输出一个“阅读”动作计算注意力权重聚焦于当前帧的某个特定空间区域可能包含一个物体或一段文本和某段问题词。从聚焦的区域提取视觉特征和文本特征如果有的话。进行“证据验证”计算该区域特征与问题相关部分的匹配度。如果匹配度高例如区域是“冰箱门”文本是“便签纸”问题是“便签纸放在哪里”则该区域特征被标记为“候选证据”。动态锚定机制当候选证据的置信度超过一个可学习的阈值时控制器触发“锚定”动作。“锚定”意味着a) 将该证据特征存入一个专门的“证据记忆池”b) 在该证据与某个答案选项或生成答案的某个token之间建立一个软链接soft link这个链接的权重在训练中学习。在我们的例子中智能体可能在“读便签纸”的帧中先锚定“手拿着便签纸”这个证据但这不足以回答“放在哪里”。于是它继续检索最终在更早的帧中锚定了“便签纸贴在冰箱门上”这一关键证据。这个过程是循环的。智能体可以在一帧内检索多个证据也可以在不同的关键帧之间跳转。控制器根据证据记忆池的饱和度和问题复杂度决定何时停止检索。3.3 阶段三证据聚合与答案生成当证据检索循环终止后模型拥有了一个“证据记忆池”里面存储着多个锚定的证据特征每个都或多或少与最终答案相关。证据聚合使用一个注意力层让问题特征去查询整个证据记忆池从而聚合出与问题最相关的证据信息。这相当于综合所有线索。答案生成/选择对于开放式的生成任务我们将聚合后的证据特征与问题特征拼接输入一个语言解码器如GPT-2架构生成答案单词序列。对于多项选择题任务我们计算每个选项特征与聚合证据的匹配分数选择最高分。关键在生成答案的每个步骤或计算每个选项得分时模型都可以通过之前建立的软链接追溯到主要贡献了该决策的具体证据即哪一帧的哪个区域。这提供了宝贵的可解释性。4. 训练策略与损失函数设计让这样一个复杂的、包含循环决策的系统端到端地学习需要精心设计的损失函数。4.1 三大损失函数答案预测损失L_ans最标准的损失衡量生成答案或选择答案与真实标签的差异。对于生成任务用交叉熵对于选择任务用二分类交叉熵。证据锚定监督损失L_anchor这是实现“证据感知”的关键。我们需要弱监督信号来指导智能体锚定正确的证据。来源我们利用数据集中问题-答案对通过反向查找自动生成伪证据标签。例如对于答案“冰箱门上”我们在所有帧中寻找包含“冰箱”和“门”视觉概念的帧以及包含“冰箱”、“门”或相关OCR文本的帧将这些区域标记为正样本。这是一个噪声很大的标签但足以提供引导。形式我们使用对比损失让模型学习将问题-答案对与正确的证据区域在特征空间拉近同时与随机区域推远。决策正则化损失L_reg为了防止控制器陷入无效循环如不停锚定同一证据我们引入了正则化。多样性鼓励鼓励锚定的证据在时间和空间上具有多样性。稀疏性鼓励鼓励控制器在做出“锚定”决策时是稀疏的、确定的避免每个区域都有一点权重。总损失为L L_ans α * L_anchor β * L_reg。α和β是超参数通过验证集调整。4.2 训练技巧与踩坑实录分阶段预热训练直接端到端训练很难收敛。我们的策略是第一阶段冻结控制器和锚定模块只用答案预测损失L_ans训练特征编码器和答案生成器。这相当于训练一个基础版的VQA模型。第二阶段解冻控制器引入证据锚定监督损失L_anchor但用一个很小的权重β。让模型先学会在“有答案”的前提下去关联那些可能是证据的区域。第三阶段逐步增加L_anchor的权重并加入L_reg进行完整训练。这个过程需要耐心调整学习率。OCR噪声处理自动生成的证据标签噪声极大。我们采用了“噪声容忍学习”策略在计算L_anchor时对每个批次内置信度最低的若干样本可能是错误标签进行梯度裁剪或降低其损失权重。控制器初始化控制器的初始状态对训练稳定性影响很大。我们采用了一种“模仿学习”的思路用第一阶段训练好的基础模型对验证集样本进行推理记录下那些最终回答正确的样本其内部注意力权重较高的帧和区域作为控制器初始训练的“专家示范”数据。5. 实验设置、结果分析与可解释性展示我们在主流的Video TextVQA数据集上进行了实验例如TextVQA的视频版扩展、以及ST-VQAScene Text VQA中涉及视频序列的数据。5.1 定量结果对比我们与几种基线模型进行了对比模型类型核心方法准确率 (%)证据对齐度 (EA-Score)基准模型基于CLIP的密集帧问答58.20.31基准模型OCR融入OCR文本特征62.70.35基于SLATE的方法稀疏潜在Transformer65.40.40VTAgent (Ours)Agentic Keyframe Anchoring68.90.72准确率VTAgent在答案预测准确率上取得了显著提升这证明了基于证据的推理的有效性。证据对齐度 (EA-Score)这是我们设计的一个新评估指标用于量化模型答案是否基于视频中真实存在的证据。具体来说我们使用一个预训练的视觉-语言匹配模型计算模型在推理过程中锚定的Top-3证据区域与人工标注的“支撑答案的关键帧区域”之间的相似度平均值。VTAgent的EA-Score远高于基线说明我们的模型确实更倾向于从视频中寻找答案依据。5.2 定性分析与可解释性这是VTAgent最大的亮点。我们可以可视化智能体的整个决策轨迹。案例问题“视频中男子用来付款的卡片是什么颜色的”视频男子从钱包里抽出一张卡片在刷卡机上操作。VTAgent轨迹全局感知提议了“抽卡”、“刷卡”两个关键段。智能体首先聚焦“刷卡”段但未能清晰看到卡片颜色可能被手遮挡。智能体回溯到“抽卡”段在某一帧锚定了“手指捏着一张蓝色卡片”的区域作为证据。证据记忆池中存入该蓝色卡片特征。答案生成器输出“蓝色”并且我们可以通过链接追溯到“抽卡”帧的具体区域。这种可追溯性对于模型调试和用户信任至关重要。我们可以清楚地知道模型为什么对更重要的是知道它为什么错——是因为OCR漏检了关键文本还是智能体锚定了错误的证据抑或是证据聚合时权重分配不合理6. 局限性与未来工作没有任何工作是完美的VTAgent也有其局限计算开销循环的证据检索过程增加了推理时间相比前馈式模型更慢。尽管我们使用了关键帧提议来减少搜索空间但对于超长视频5分钟仍具挑战。对OCR的强依赖对于文本密集型的Video TextVQAOCR是瓶颈。如果视频中文本模糊、扭曲或语言生僻系统性能会下降。未来需要探索更鲁棒的端到端文本理解模块。弱监督证据学习我们依赖自动生成的噪声标签来学习锚定。虽然噪声容忍策略有帮助但性能上限受限于此。如何利用更廉价的方式获取更精确的证据监督如点击反馈是一个方向。动作与因果推理当前模型主要关注静态的视觉和文本证据。对于需要理解连续动作序列和因果关系的复杂问题如“为什么他之后又返回了房间”VTAgent的时序推理能力还有待加强。可以考虑引入更强大的时序动作识别模块。7. 实战心得与项目复现建议如果你对这个方向感兴趣想复现或基于VTAgent的思路进行改进以下是我从项目实践中总结的几点心得环境与数据准备OCR是第一步不要吝啬在OCR预处理上的时间。尝试不同的OCR引擎Tesseract, PaddleOCR, MMOCR根据你的视频特点分辨率、字体、背景进行调整和融合。建立一个本地的OCR缓存系统避免每次推理都重复运行。数据集选择从相对简单的、静态场景文本较多的数据集开始如TextVQA的图片数据先做实验再迁移到视频数据。理解数据集中问题和答案的分布模式。模型实现关键点控制器设计控制器不必过于复杂。我们实验发现一个3-4层的Transformer解码器层作为控制器其输入是问题特征和上一个循环的隐藏状态输出是注意力权重和停止概率效果和效率比较平衡。证据记忆池使用一个固定大小的可学习内存矩阵。使用注意力机制进行读写比简单的拼接或RNN更有效。停止准则除了控制器预测的停止概率我们还设置了一个最大循环步数如10步作为硬性限制防止无限循环。训练调参学习率策略使用Warmup和Cosine衰减。在第三阶段完整训练时学习率要设得比第一阶段小一个数量级。损失权重α和β从非常小的值开始如0.01每隔几个epoch观察验证集上的EA-Score和准确率缓慢增加。通常α锚定损失权重最终在0.1-0.5之间β正则化权重在0.01-0.05之间。可视化调试尽早建立训练过程的可视化流水线。定期抽样一些样本查看智能体提议的关键帧、锚定的证据区域是否合理。这是发现模型早期错误行为的最快方式。VTAgent项目给我们最大的启示是对于视频问答这类复杂任务将答案生成过程“白盒化”、“步骤化”不仅可能提升性能更能带来可解释性这一宝贵副产品。它不再是一个神秘的黑箱而是一个可以一步步跟踪其推理链条的智能系统。这种设计思想对于追求可靠性和透明度的AI应用场景具有重要的参考价值。

相关新闻

数学建模国赛72小时高效团队协作SOP:从分工到时间管理的实战指南

数学建模国赛72小时高效团队协作SOP:从分工到时间管理的实战指南

1. 从“单打独斗”到“精密协作”:国赛的本质是团队项目如果你点开这篇文章,大概率是第一次或者第二次参加全国大学生数学建模竞赛(简称“国赛”)。在准备过程中,你可能听过无数遍“团队合作很重要”,但这句…

2026/8/18 6:27:23 阅读更多 →
Mathor Cup数学建模竞赛备赛指南:从通知解读到实战策略

Mathor Cup数学建模竞赛备赛指南:从通知解读到实战策略

1. 竞赛全景与核心价值解析又到了一年一度让无数理工科学子既兴奋又头疼的时节——Mathor Cup数学建模竞赛的通知发布了。对于在校大学生,尤其是数学、计算机、金融、工程等相关专业的朋友来说,这个名字绝不陌生。它不像一些纯理论的数学竞赛那样曲高和寡…

2026/8/18 6:02:15 阅读更多 →
从零搭建Cheat Engine练习环境:掌握内存修改与逆向工程核心技能

从零搭建Cheat Engine练习环境:掌握内存修改与逆向工程核心技能

1. 项目概述:为什么需要一个CE练习环境?如果你对游戏修改、软件调试或者逆向工程感兴趣,那么你一定听说过 Cheat Engine(简称 CE)。它是一款功能强大到令人惊叹的内存扫描与调试工具,但它的强大也伴随着极高…

2026/8/17 5:53:06 阅读更多 →

最新新闻

SDR++ 免费跨平台软件无线电完整入门指南:30 分钟从安装到听到第一个信号

SDR++ 免费跨平台软件无线电完整入门指南:30 分钟从安装到听到第一个信号

SDR 免费跨平台软件无线电完整入门指南:30 分钟从安装到听到第一个信号 【免费下载链接】SDRPlusPlus Cross-Platform SDR Software 项目地址: https://gitcode.com/GitHub_Trending/sd/SDRPlusPlus SDR 是一款免费开源、横跨 Windows、Linux、macOS 与 BSD …

2026/8/18 9:10:31 阅读更多 →
城市应急新力量:迷你消防车设计原理与实战应用全解析

城市应急新力量:迷你消防车设计原理与实战应用全解析

1. 项目缘起:一次偶然的街头发现 那天我正走在一条老城区的巷子里,耳边传来一阵清脆的“叮铃铃”声,不是自行车的铃铛,也不是电动车的喇叭。循声望去,一辆涂着鲜亮红色、造型却异常小巧的“玩具车”正缓缓驶过&#xf…

2026/8/18 9:10:31 阅读更多 →
绝区零一条龙保姆级实战指南:全自动框架从安装到进阶避坑的完整攻略

绝区零一条龙保姆级实战指南:全自动框架从安装到进阶避坑的完整攻略

绝区零一条龙保姆级实战指南:全自动框架从安装到进阶避坑的完整攻略 【免费下载链接】ZenlessZoneZero-OneDragon 绝区零 一条龙 | 全自动 | 自动闪避 | 自动每日 | 自动空洞 | 支持手柄 项目地址: https://gitcode.com/gh_mirrors/ze/ZenlessZoneZero-OneDragon …

2026/8/18 9:10:31 阅读更多 →
3分钟让游戏吃满最新DLSS性能:DLSS Swapper一键版本切换上手指南

3分钟让游戏吃满最新DLSS性能:DLSS Swapper一键版本切换上手指南

3分钟让游戏吃满最新DLSS性能:DLSS Swapper一键版本切换上手指南 【免费下载链接】dlss-swapper 项目地址: https://gitcode.com/GitHub_Trending/dl/dlss-swapper 你花大价钱买的新显卡,可能正被游戏里的旧 DLSS 文件"封印"着性能。我…

2026/8/18 9:10:31 阅读更多 →
神经网络结构图绘制不用从零开始:10分钟快速上手Neural-Network-Architecture-Diagrams

神经网络结构图绘制不用从零开始:10分钟快速上手Neural-Network-Architecture-Diagrams

神经网络结构图绘制不用从零开始:10分钟快速上手Neural-Network-Architecture-Diagrams 【免费下载链接】Neural-Network-Architecture-Diagrams Diagrams for visualizing neural network architecture 项目地址: https://gitcode.com/gh_mirrors/ne/Neural-Netw…

2026/8/18 9:10:31 阅读更多 →
Wallpaper Engine 素材太封闭?repkg 一键解包 PKG、批量转换 TEX,新手也能快速上手

Wallpaper Engine 素材太封闭?repkg 一键解包 PKG、批量转换 TEX,新手也能快速上手

Wallpaper Engine 素材太封闭?repkg 一键解包 PKG、批量转换 TEX,新手也能快速上手 【免费下载链接】repkg Wallpaper engine PKG extractor/TEX to image converter 项目地址: https://gitcode.com/gh_mirrors/re/repkg 从创意工坊拖下来的壁纸&…

2026/8/18 9:09:31 阅读更多 →

日新闻

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF 【免费下载链接】extract-video-ppt extract the ppt in the video 项目地址: https://gitcode.com/gh_mirrors/ex/extract-video-ppt 如果你还停留在"看网课 不停暂停 截图 …

2026/8/18 0:00:57 阅读更多 →
思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查

思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查

思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查 【免费下载链接】source-han-serif-ttf Source Han Serif TTF 项目地址: https://gitcode.com/gh_mirrors/so/source-han-serif-ttf 你是不是也经历过这种时刻:设计稿里…

2026/8/18 0:00:58 阅读更多 →
华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate

华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate

华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate 【免费下载链接】g-helper Lightweight Armoury Crate alternative for Asus laptops with nearly the same functionality. Works with ROG Zephyrus, Flow, TUF, Strix, Scar, ProArt, …

2026/8/18 0:00:59 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/17 2:58:27 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/18 9:06:28 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/18 9:04:56 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/17 18:54:37 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/17 18:55:16 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/17 18:55:55 阅读更多 →