本地AI部署实战:从硬件需求到模型运行,手把手教你跑通大模型
在实际项目中将大型AI模型部署到本地环境尤其是个人电脑或开发服务器上是一个充满挑战但又极具吸引力的目标。很多开发者最初都认为只要内存够大、硬盘够快就能跑起来但真正动手时遇到的第一个拦路虎往往是CPU。当看到“CUDA out of memory”或者推理速度慢如蜗牛时很多人会下意识地怀疑难道是我的CPU不行阻止了我部署AI其实CPU的角色远比“行”或“不行”要复杂。它更像是一个总指挥决定了整个部署流程的基调和效率上限而GPU如果有的话则是执行具体计算任务的“特种部队”。本文旨在为希望将AI大模型部署到本地环境进行学习、开发或轻量级应用的开发者提供一份从零开始的实战指南。我们将不局限于讨论CPU或GPU的硬件限制而是系统地梳理从环境准备、模型选择、工具链配置到最终运行和优化的完整流程。你将了解到在资源有限的情况下如何通过合理的配置和工具选择让AI模型在你的本地机器上成功“跑起来”并理解每一步背后的技术原理和常见陷阱。1. 理解本地AI部署的核心挑战与硬件角色在云端调用API和本地部署模型是两种截然不同的范式。本地部署意味着你需要独自承担从计算、内存到软件栈的所有责任。因此理解硬件资源如何被消耗是成功的第一步。1.1 CPU、GPU与内存的分工在AI推理尤其是大语言模型的上下文中各硬件组件扮演着不同的角色CPU (中央处理器)负责通用逻辑控制、任务调度、数据加载与预处理、以及模型推理流程的整体协调。对于某些轻量级模型或特定优化后的框架CPU也可以直接承担推理计算。它的核心限制在于并行计算能力弱不适合处理矩阵乘加这类海量并行计算。GPU (图形处理器)拥有数千个计算核心专为高吞吐量的并行计算设计。现代大模型Transformer架构的核心运算如注意力机制、前馈网络极度依赖GPU的并行计算能力。显存GPU Memory的大小直接决定了你能加载的模型参数规模。内存 (RAM)作为CPU和GPU之间的数据中转站存放模型权重如果GPU显存放不下、输入数据、中间变量以及操作系统和应用程序本身。内存不足会导致系统频繁使用硬盘交换Swap性能急剧下降甚至进程被系统终止。硬盘 (存储)用于持久化保存模型文件通常为几个GB到几十个GB。固态硬盘SSD能显著加快模型加载速度。一个常见的误解是“CPU差就跑不了AI”。实际上CPU性能不足更多体现在整体流程的瓶颈上例如数据预处理跟不上GPU的计算速度或者在使用纯CPU推理时速度无法接受。而“跑不了”的根因更多时候是内存RAM或显存VRAM不足无法容纳模型本身。1.2 模型参数与硬件需求的粗略估算模型参数数量如7B、13B、70B是评估硬件需求的首要指标。参数主要以float162字节或float324字节精度存储。仅加载模型权重所需内存参数量 * 每参数字节数。例如一个7B70亿参数的float16模型仅权重就需要约7 * 10^9 * 2 bytes ≈ 14 GB。推理时额外开销除了权重推理过程还需要空间存储中间激活值Activation、键值缓存KV Cache等。这部分开销与序列长度输入的文本长度的平方相关可能非常巨大。一个经验法则是流畅运行模型所需的内存/显存通常是模型权重大小的1.5到2倍甚至更多。基于此我们可以得到一个粗略的硬件门槛表模型规模 (参数)最低RAM要求 (估算)流畅运行推荐RAMGPU显存门槛 (推理)适用场景7B (70亿)16 GB32 GB8 GB (量化后)个人电脑入门级学习轻量对话13B (130亿)32 GB64 GB16 GB (量化后)高性能PC/工作站深度开发测试70B (700亿)64 GB128 GB48 GB (量化后)高端服务器专业研究小型服务注意这里的“量化后”指使用如GPTQ、AWQ、GGUF等量化技术将模型权重从float16压缩至int4或int8可以大幅降低内存占用但会轻微损失精度。这是在消费级硬件上运行大模型的关键技术。2. 环境准备构建本地AI的软件地基在开始下载模型之前一个稳定、兼容的软件环境至关重要。混乱的依赖关系是部署失败的主要原因之一。2.1 Python环境与包管理推荐使用conda或venv创建独立的Python虚拟环境避免污染系统环境。# 使用 conda (假设已安装Anaconda或Miniconda) conda create -n local-ai python3.10 conda activate local-ai # 或者使用 venv python3.10 -m venv local-ai-env source local-ai-env/bin/activate # Linux/macOS # local-ai-env\Scripts\activate # Windows确定Python环境后安装核心的AI框架。PyTorch是目前最主流的选择你需要根据是否有GPU以及CUDA版本来选择安装命令。# 访问 https://pytorch.org/get-started/locally/ 获取最准确的安装命令 # 示例安装支持CUDA 11.8的PyTorch pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 # 如果只有CPU pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cpu2.2 模型加载与推理框架选择直接使用原始的PyTorch (torch.nn)加载和运行大模型极其复杂。社区涌现了多个优秀的推理框架它们提供了模型加载、量化、对话模板等高级功能极大简化了流程。Transformers (by Hugging Face)生态最丰富支持模型最多是事实上的标准。适合研究和灵活开发。vLLM专为高吞吐量、低延迟的推理服务设计采用了高效的PagedAttention等技术。适合生产环境API服务。llama.cpp使用C编写通过量化技术极致优化对CPU推理非常友好甚至可以在没有GPU的Macbook上运行百亿模型。它提供了Python绑定(llama-cpp-python)。Ollama开箱即用的命令行工具内置模型管理、拉取和运行用户体验极简适合快速体验和原型验证。LM Studio图形化桌面应用无需命令行拖拽式运行模型对新手极其友好。对于本地部署的初学者建议从Ollama或LM Studio开始以最低的学习成本验证硬件是否满足基本要求。掌握原理后再使用Transformers或llama.cpp进行更深入的定制。2.3 硬件与驱动检查在安装GPU相关库之前必须确保驱动和CUDA工具包已正确安装。# 检查NVIDIA GPU驱动和CUDA版本 nvidia-smi该命令会输出GPU信息、驱动版本和最高支持的CUDA版本如CUDA 12.4。你安装的PyTorch CUDA版本应不高于此版本。对于CPU用户虽然无需CUDA但可以检查CPU是否支持一些加速指令集如AVX2 AVX512这会影响llama.cpp等框架的性能。# Linux 查看CPU flags lscpu | grep -i avx3. 实战使用Ollama部署并运行一个7B模型我们以Ollama为例展示最快捷的本地部署流程。Ollama会自动处理模型下载、转换和运行。3.1 安装与运行Ollama访问Ollama官网下载对应操作系统的安装包并安装。安装完成后服务会自动启动。# 在终端中拉取并运行一个模型例如 Llama 3.2 的 7B 指令微调版本 ollama run llama3.2:7b首次运行会下载约4GB的模型文件已量化。下载完成后会自动进入交互式对话界面。3.2 与模型交互在出现的提示符后直接输入问题。 请用Python写一个快速排序函数模型会开始生成回答。你可以进行多轮对话。3.3 进阶使用作为API服务Ollama默认也提供了本地API服务通常在http://localhost:11434方便其他程序调用。# 在后台运行指定的模型 ollama serve # 启动服务通常安装后已自启 ollama run llama3.2:7b # 在后台加载模型 # 使用curl测试API curl http://localhost:11434/api/generate -d { model: llama3.2:7b, prompt: 为什么天空是蓝色的, stream: false }API会返回一个JSON格式的响应包含生成的文本。3.4 管理模型# 列出本地已下载的模型 ollama list # 删除一个模型 ollama rm llama3.2:7b # 查看可用模型列表 (在 Ollama 模型库中) # 需要去官网查看或通过运行不存在的模型触发提示通过以上步骤你已经在本地成功运行了一个大语言模型。这个过程屏蔽了底层复杂性让你专注于体验和验证。4. 深入原理使用Transformers库手动加载与推理为了理解背后的机制我们使用Hugging Face Transformers库来手动完成一次加载和推理。这能让你更清晰地看到模型、Tokenizer和硬件之间的关系。4.1 安装依赖与下载模型首先在你的虚拟环境中安装必要的库。pip install transformers accelerate # accelerate 库可以帮助优化模型加载自动处理设备放置CPU/GPU我们以Meta的Llama-3.2-1B这个小规模模型为例便于演示。需要在Hugging Face Hub上先同意许可协议。4.2 编写加载与推理脚本创建一个Python脚本例如run_model.py。from transformers import AutoTokenizer, AutoModelForCausalLM import torch # 1. 指定模型名称 model_id meta-llama/Llama-3.2-1B # 1B参数对硬件要求低 # 2. 加载分词器 (Tokenizer) # Tokenizer负责将文本转换为模型能理解的数字ID print(Loading tokenizer...) tokenizer AutoTokenizer.from_pretrained(model_id) # 3. 加载模型 # device_map 参数让 accelerate 自动决定将模型层放在哪个设备上 # 如果GPU内存不够它会自动将部分层卸载到CPU但速度会变慢 print(Loading model...) model AutoModelForCausalLM.from_pretrained( model_id, device_mapauto, # 自动分配设备 torch_dtypetorch.float16, # 使用半精度以节省内存 low_cpu_mem_usageTrue, # 优化CPU内存使用 ) # 4. 准备输入 prompt 请解释一下人工智能。 inputs tokenizer(prompt, return_tensorspt).to(model.device) # 将输入张量放到模型所在的设备 # 5. 生成文本 print(Generating...) with torch.no_grad(): # 推理时不计算梯度节省内存和计算 outputs model.generate( **inputs, max_new_tokens100, # 最多生成100个新token do_sampleTrue, # 使用采样而非贪婪搜索使输出更多样 temperature0.7, # 采样温度控制随机性 ) # 6. 解码输出 generated_text tokenizer.decode(outputs[0], skip_special_tokensTrue) print(Generated text:\n, generated_text)4.3 运行脚本与观察资源运行这个脚本python run_model.py在运行时打开系统资源监视器如htop,nvidia-smi, 任务管理器观察CPU、内存和GPU显存的使用情况。你会看到加载模型时内存/显存占用急剧上升。推理时CPU或GPU利用率会升高。如果device_map”auto”且GPU显存不足日志可能会提示部分模块被放到了CPU上。这就是本地部署的核心框架试图将巨大的模型“塞进”有限的硬件资源中。当资源不足时框架会尝试妥协如CPU卸载但这会以性能为代价。5. 性能优化与常见问题排查当模型运行缓慢或无法加载时需要系统性地排查。5.1 性能优化策略模型量化这是最有效的优化手段。将模型权重从float16转换为int4或int8可以减少50%-75%的内存占用对速度影响相对较小。GGUF格式 (用于llama.cpp)社区提供了大量预量化的GGUF模型文件可直接使用。GPTQ/AWQ (用于Transformers)需要加载特定的量化模型分支或使用auto-gptq等库。使用更高效的推理引擎对于CPU推理llama.cpp的性能远优于原生PyTorch。对于GPU服务vLLM的吞吐量更高。调整生成参数减少max_new_tokens生成长度、降低temperature、使用do_sampleFalse贪婪解码都能加快速度。硬件层面确保使用SSD加载模型确保内存充足避免Swap确保GPU驱动和CUDA版本匹配。5.2 常见问题与解决方案问题现象可能原因检查与解决方案CUDA out of memoryGPU显存不足以容纳模型权重和中间状态。1. 使用更小的模型。2. 使用量化模型如int4。3. 在from_pretrained中设置device_map”auto”和low_cpu_mem_usageTrue让框架自动卸载到CPU。4. 减少max_new_tokens和batch_size。加载模型时系统内存耗尽/进程被杀死RAM不足无法将模型文件从硬盘加载到内存。1. 检查可用内存 (free -h或任务管理器)。2. 使用量化模型减小体积。3. 增加系统虚拟内存Swap空间但这会极大降低性能。4. 升级物理内存。推理速度极慢CPU模式模型过大CPU计算能力不足。1. 确认是否真的在使用CPU推理检查nvidia-smi或代码中设备设置。2. 换用针对CPU优化的llama.cpp。3. 确保Python环境安装的是支持CPU加速的PyTorch (torchwith MKL)。4. 在BIOS中确认CPU的虚拟化技术如Intel VT-x已开启这对某些虚拟化环境有益。RuntimeError: ... expected scalar type Float but found Half模型精度与输入数据精度不匹配。在代码中确保模型和输入数据在同一精度下。例如如果模型是float16输入也应是torch.float16。使用model.to(dtypetorch.float16)和inputs.to(dtypetorch.float16)。无法从Hugging Face下载模型网络问题或未登录/未同意协议。1. 对于需要认证的模型如Llama需先huggingface-cli login登录并在网站同意协议。2. 配置网络环境或使用镜像源。Ollama运行时提示unavailable或not found模型名称错误或Ollama服务未启动。1. 检查模型名拼写使用ollama list查看本地模型。2. 重启Ollama服务 (ollama serve)。3. 查看Ollama日志寻找具体错误。5.3 资源监控命令在Linux/macOS下这些命令有助于实时监控# 监控总体CPU、内存、Swap htop # 监控GPU使用情况 (NVIDIA) watch -n 1 nvidia-smi # 监控进程级别的资源使用 top -p $(pgrep -f “python run_model.py”)6. 从学习到生产进阶路径与最佳实践成功在本地跑通模型只是第一步。若想用于更严肃的开发或提供稳定服务需要考虑更多。6.1 进阶工具链集成LangChain / LlamaIndex用于构建基于大模型的复杂应用如检索增强生成RAG、智能体Agent。它们提供了连接本地模型与外部数据、工具的框架。Text Generation WebUI或FastChat为你的本地模型提供一个类似于ChatGPT的Web图形界面方便测试和演示。Docker将模型运行环境容器化确保环境一致性便于分发和部署。6.2 生产环境考量稳定性与可用性使用systemd或supervisor管理推理服务进程实现开机自启和崩溃重启。API设计与监控使用FastAPI或Flask封装模型推理为HTTP API。集成Prometheus、Grafana等工具监控API延迟、吞吐量、错误率和硬件资源使用情况。安全对API接口实施认证和限流。谨慎处理用户输入防止提示词注入攻击。版本管理对模型文件、推理代码和配置文件进行版本控制。成本与性能权衡持续评估量化带来的精度损失是否在业务可接受范围内。对于高并发场景评估是否需要升级硬件或使用多卡推理。6.3 持续学习方向本地AI部署是一个快速发展的领域。要保持竞争力可以关注新的模型架构与小型化技术如MoE混合专家模型、更高效的注意力机制。推理优化技术如FlashAttention、持续批处理Continuous Batching、张量并行。硬件生态除了NVIDIA关注AMD ROCm、Intel XPU以及Apple SiliconM系列芯片的AI生态进展。多模态本地部署尝试在本地运行视觉-语言模型VLMs或文生图模型。回到最初的问题“难道CPU可以阻止我部署AI吗”答案是CPU本身很少是“无法部署”的唯一原因但它确实是整个系统性能的基石和潜在瓶颈。部署失败的核心通常是内存RAM/VRAM不足。通过量化技术、高效的推理框架如llama.cpp和合理的参数配置即使在仅有CPU和中等内存的机器上运行一个经过量化的7B或更小模型也是完全可行的。本地AI部署的本质是一场在有限资源、模型能力和应用需求之间寻求最佳平衡的技术实践。理解硬件分工、掌握工具链、学会排查问题你就能跨越硬件的表象限制真正驾驭本地AI的能力。

相关新闻

2026龙岩危房鉴定检测怎么选?老旧房危房鉴定靠谱机构 TOP 结构安全检测+ 报告可查 电话汇总

2026龙岩危房鉴定检测怎么选?老旧房危房鉴定靠谱机构 TOP 结构安全检测+ 报告可查 电话汇总

龙岩老旧房屋与自建房数量众多,危房鉴定机构在市场上鳞次栉比、鱼龙混杂。老旧小区业主、乡镇自建房住户、商铺经营者、园区厂房及学校医院,无不亟需权威可靠的危房安全评估。市面上不少无资质机构出具的报告无法通过住建审核,令人头疼。小编…

2026/8/18 8:57:20 阅读更多 →
安全启动加载程序:从信任根到工程实践的技术解析

安全启动加载程序:从信任根到工程实践的技术解析

1. 项目概述:一次关于安全启动加载程序的深度技术研讨 2017年11月29日,一场围绕“安全启动加载程序”的技术网络研讨会悄然举行。对于当时乃至现在的嵌入式系统、物联网设备以及任何对系统安全有严苛要求的领域从业者而言,这个主题都像是一把…

2026/8/18 8:56:20 阅读更多 →
更换新的元器件,更新pcb,AD中出现unknown pin

更换新的元器件,更新pcb,AD中出现unknown pin

1、检查好器件的封装都还在,然后像图片那样清理网格,再重新更新pcb就行了;

2026/8/18 8:56:20 阅读更多 →

最新新闻

大模型安全的权限边界:工具调用不能越过谁

大模型安全的权限边界:工具调用不能越过谁

大模型安全的权限边界:工具调用不能越过谁 大模型安全:Prompt 注入、越狱攻击与防御评估实践的工作很少卡在“缺少一个工具”。更常见的是,权限、密钥与供应链风险的安全防线没有落到可执行的约束上。先确认不可信文本、工具权限、模型输出和…

2026/8/18 9:30:55 阅读更多 →
从车展亮相到量产上市:解析AION S Plus的纯电平台与弹匣电池技术

从车展亮相到量产上市:解析AION S Plus的纯电平台与弹匣电池技术

1. 从一张预告图到量产车:A12的亮相意味着什么? 年底上市,上海车展亮相。对于关注汽车行业,尤其是新能源赛道的朋友来说,这短短一句话背后,其实藏着一条非常清晰的产品推进时间线。广汽新能源(现…

2026/8/18 9:30:55 阅读更多 →
Java开发中那些容易忽略的代码细节与习惯

Java开发中那些容易忽略的代码细节与习惯

凌晨三点,你被电话叫醒——线上接口超时,用户无法下单。你打开日志,看到一行 NullPointerException,指向一个你两周前刚提交的方法。你揉了揉眼睛,发现那个对象明明在上一行已经做了判空。为什么还是空?你翻…

2026/8/18 9:30:55 阅读更多 →
3 分钟上手 Thief-Book:IDEA 摸鱼阅读插件完整指南

3 分钟上手 Thief-Book:IDEA 摸鱼阅读插件完整指南

3 分钟上手 Thief-Book:IDEA 摸鱼阅读插件完整指南 【免费下载链接】thief-book-idea IDEA插件版上班摸鱼看书神器 项目地址: https://gitcode.com/gh_mirrors/th/thief-book-idea 写代码的人总有一些"不能走开"的时刻:编译在跑、测试在…

2026/8/18 9:30:55 阅读更多 →
大模型基础:AdaLoRA,为什么每一层不该用一样大的秩

大模型基础:AdaLoRA,为什么每一层不该用一样大的秩

① 标准 LoRA 的粗糙之处:一刀切的秩 Transformer 里有很多不同的权重矩阵——每一层的 Attention 里有 Q、K、V、输出投影,FFN 里还有两层线性变换。标准 LoRA 给所有这些矩阵都配上同一个秩 r(比如统一设成 8)。 但对当前这个…

2026/8/18 9:30:55 阅读更多 →
2026年黑龙江能做智慧燃气安全监测管理系统的公司有哪些?

2026年黑龙江能做智慧燃气安全监测管理系统的公司有哪些?

中国最北端的省份,每年十月到次年四月长达半年的供暖季,零下三四十度的极寒天气对燃气管道而言是年复一年的压力测试。黑龙江的燃气管网格局有鲜明的历史印记:哈尔滨、齐齐哈尔等老工业城市的燃气管线最早可追溯到上世纪五六十年代的苏联援建…

2026/8/18 9:29:53 阅读更多 →

日新闻

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF 【免费下载链接】extract-video-ppt extract the ppt in the video 项目地址: https://gitcode.com/gh_mirrors/ex/extract-video-ppt 如果你还停留在"看网课 不停暂停 截图 …

2026/8/18 0:00:57 阅读更多 →
思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查

思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查

思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查 【免费下载链接】source-han-serif-ttf Source Han Serif TTF 项目地址: https://gitcode.com/gh_mirrors/so/source-han-serif-ttf 你是不是也经历过这种时刻:设计稿里…

2026/8/18 0:00:58 阅读更多 →
华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate

华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate

华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate 【免费下载链接】g-helper Lightweight Armoury Crate alternative for Asus laptops with nearly the same functionality. Works with ROG Zephyrus, Flow, TUF, Strix, Scar, ProArt, …

2026/8/18 0:00:59 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/18 9:15:35 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/18 9:06:28 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/18 9:04:56 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/17 18:54:37 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/17 18:55:16 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/17 18:55:55 阅读更多 →