基于VLLM框架本地部署DeepSeek大模型:从环境搭建到API调用的完整指南
最近在尝试将大语言模型集成到本地应用时发现很多开源方案要么部署复杂要么对硬件要求极高。直到遇到了 DeepSeek 的 VLLM 推理框架其高效的 PagedAttention 和连续批处理技术让单张消费级显卡也能流畅运行数十亿参数的大模型。本文将手把手带你从零开始在本地环境部署并运行一个基于 VLLM 的 DeepSeek 模型服务涵盖环境搭建、模型下载、服务启动、API 调用以及性能优化的完整闭环。无论你是想快速体验模型能力还是为后续的 AI 应用开发打下基础这篇实战指南都能提供清晰的路径。1. 背景与核心概念在深入实操之前我们有必要厘清几个关键概念这能帮助你更好地理解我们正在搭建的整个技术栈。1.1 什么是 DeepSeekDeepSeek 是由深度求索公司开发的一系列大型语言模型。它并非特指某一个模型而是一个家族包括了不同参数规模如 7B、67B和不同特性的版本。这些模型在多项中英文评测中表现出色并且完全开源允许研究者和开发者在合规的前提下免费商用。我们本文的目标就是在本地部署这样一个强大的开源模型。1.2 为什么选择 VLLM 作为推理引擎直接使用原始的 PyTorch 或 Transformers 库加载大模型进行推理往往会遇到显存利用率低、吞吐量小的问题。VLLM 是一个专为 LLM 推理和服务设计的高吞吐量、内存高效的推理引擎。它的核心优势在于PagedAttention灵感来自操作系统的虚拟内存和分页思想高效管理注意力机制的键值缓存KV Cache显著减少内存碎片从而在相同显存下支持更长的上下文或更大的批次。连续批处理传统的静态批处理需要等一批中最慢的请求完成后才能处理下一批。VLLM 的连续批处理可以动态地将新请求插入到正在运行的批次中极大提升了 GPU 利用率和服务吞吐量。与 OpenAI API 兼容VLLM 服务启动后会提供一个与 OpenAI API 格式完全兼容的接口。这意味着所有为 ChatGPT 开发的客户端工具、库或应用几乎可以无缝切换到你的本地 VLLM 服务。1.3 整体架构预览我们的目标架构非常简单清晰在你的本地电脑或服务器上VLLM 作为一个服务进程运行它加载 DeepSeek 模型。你的应用程序可以是 Python 脚本、Web 后端或任何能发送 HTTP 请求的工具通过向 VLLM 服务发送 HTTP 请求格式同 OpenAI API来获取模型的生成结果。这样你就拥有了一个完全受控、私有的“ChatGPT”服务。2. 环境准备与版本说明工欲善其事必先利其器。稳定的环境是成功部署的第一步。以下配置是经过验证的组合但请根据你的实际情况灵活调整。2.1 硬件与操作系统要求GPU这是获得可用推理速度的关键。推荐 NVIDIA GPU显存至少 8GB。例如RTX 3060 12GB、RTX 4070 12GB 或更高级别的显卡。显存大小决定了你能运行的模型规模7B 模型约需 14GB但通过量化技术可降低要求。CPU 与内存建议 4 核以上 CPU16GB 以上系统内存。操作系统本文以Ubuntu 22.04 LTS为例进行演示。Windows 系统可通过 WSL2 (Windows Subsystem for Linux) 获得类似的体验macOS 也可运行但主要依赖 CPU。磁盘空间预留至少 20GB 的可用空间用于存放模型和 Python 环境。2.2 软件环境准备首先确保你的系统已安装基础的编译工具和 Python。# 更新系统包列表并安装必要工具 sudo apt update sudo apt install -y python3-pip python3-venv git build-essential # 验证 Python 版本推荐 Python 3.8 - 3.11 python3 --version接下来安装 NVIDIA 显卡驱动和 CUDA 工具包。这是 GPU 加速的核心。# 检查显卡驱动是否安装 nvidia-smi如果该命令能正确输出 GPU 信息则驱动已安装。否则请通过系统附加驱动或 NVIDIA 官网安装适合你显卡的驱动。CUDA 工具包的安装相对复杂建议访问 NVIDIA 官网根据你的系统下载 runfile 或 deb 包进行安装。安装后同样使用nvidia-smi查看顶部的 CUDA Version这代表驱动支持的最高 CUDA 版本。VLLM 对 CUDA 版本有要求本文示例基于 CUDA 12.1。2.3 创建独立的 Python 虚拟环境强烈建议使用虚拟环境来隔离项目依赖避免包冲突。# 创建一个名为 vllm-env 的虚拟环境 python3 -m venv vllm-env # 激活虚拟环境 source vllm-env/bin/activate激活后你的命令行提示符前通常会显示(vllm-env)表示已进入该环境。3. 核心组件安装与配置环境就绪后开始安装核心的 VLLM。3.1 安装 VLLM在激活的虚拟环境中使用 pip 安装 VLLM。由于 VLLM 包含一些需要编译的 C/CUDA 扩展安装过程可能需要几分钟。# 安装 VLLM。这里明确指定基于 CUDA 12.1 的版本。 pip install vllm如果你的 CUDA 版本是 11.8可以尝试pip install vllm --extra-index-url https://pypi.nvidia.com。安装完成后可以验证一下python -c import vllm; print(vllm.__version__)3.2 模型下载与准备VLLM 支持从 Hugging Face Hub 直接下载模型。我们以 DeepSeek 的一个流行版本deepseek-ai/deepseek-llm-7b-chat为例。这是一个 70 亿参数的对话模型。# 你可以直接指定模型启动VLLM 会自动下载。但为了网络稳定也可以先下载到本地。 # 方法一使用 huggingface-cli (需先安装 pip install huggingface-hub) huggingface-cli download deepseek-ai/deepseek-llm-7b-chat --local-dir ./models/deepseek-7b-chat # 方法二直接启动时指定VLLM 会处理缓存推荐初次尝试 # 我们将在下一步启动服务时使用此方法。模型文件较大约 14GB请确保网络通畅和磁盘空间充足。4. 完整实战启动服务与调用这是最核心的部分我们将启动 VLLM 服务并用两种方式调用它。4.1 启动 VLLM 推理服务在终端中保持虚拟环境激活状态运行以下命令# 基本启动命令 python -m vllm.entrypoints.openai.api_server \ --model deepseek-ai/deepseek-llm-7b-chat \ --served-model-name deepseek-7b-chat \ --host 0.0.0.0 \ --port 8000参数解释--model: 指定要加载的模型路径或 Hugging Face 模型 ID。--served-model-name: 服务对外暴露的模型名称API 调用时会用到。--host 0.0.0.0: 允许任何网络接口访问如果只本地使用可改为127.0.0.1。--port 8000: 服务监听的端口。启动成功后你会看到大量输出最后会有类似INFO: Application startup complete.和INFO: Uvicorn running on http://0.0.0.0:8000的日志。这表明服务已在http://localhost:8000就绪。4.2 使用 OpenAI SDK 进行调用VLLM 服务完全兼容 OpenAI API。我们可以使用openai这个 Python 库来调用它。首先在另一个终端或新的命令行窗口中激活相同的虚拟环境并安装 OpenAI 库。source vllm-env/bin/activate pip install openai然后创建一个 Python 脚本test_vllm.py# test_vllm.py from openai import OpenAI # 初始化客户端指向本地 VLLM 服务 client OpenAI( api_keytoken-abc123, # VLLM 默认不需要验证但需提供任意非空字符串 base_urlhttp://localhost:8000/v1 # 注意是 /v1 端点 ) # 构建聊天补全请求 response client.chat.completions.create( modeldeepseek-7b-chat, # 与启动时的 --served-model-name 一致 messages[ {role: system, content: 你是一个乐于助人的助手。}, {role: user, content: 请用中文介绍一下你自己。} ], max_tokens256, temperature0.7, streamFalse # 设为 True 可以流式输出 ) # 打印结果 print(Assistant:, response.choices[0].message.content) print(\n使用令牌统计:) print(f 输入令牌: {response.usage.prompt_tokens}) print(f 输出令牌: {response.usage.completion_tokens}) print(f 总令牌: {response.usage.total_tokens})运行这个脚本python test_vllm.py你应该能看到模型生成的自我介绍以及本次交互的令牌使用统计。4.3 使用 cURL 命令进行调用除了 SDK你也可以直接使用 HTTP 请求工具如 cURL 进行调用这有助于调试和理解 API 格式。curl http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -H Authorization: Bearer token-abc123 \ -d { model: deepseek-7b-chat, messages: [ {role: user, content: 法国的首都是哪里} ], max_tokens: 100, temperature: 0.1 }执行后你会收到一个 JSON 格式的响应其中choices[0].message.content字段包含了模型的回答。5. 高级配置与性能优化基础服务跑通后我们可以通过一些参数和配置来优化性能、节省显存或适配不同需求。5.1 使用量化技术降低显存消耗70亿参数的 FP16 模型需要约 14GB 显存。如果你的显卡显存不足可以使用量化技术。VLLM 支持 AWQ 和 GPTQ 量化模型。例如Hugging Face 上可能有deepseek-llm-7b-chat-awq这样的模型。启动时VLLM 能自动识别并加载量化模型。# 假设已下载或存在 AWQ 量化模型 python -m vllm.entrypoints.openai.api_server \ --model deepseek-ai/deepseek-llm-7b-chat-awq \ --served-model-name deepseek-7b-chat \ --host 0.0.0.0 \ --port 8000 \ --quantization awq # 显式指定量化方法有时可省略量化模型能将显存需求降低至 6-8GB同时性能损失较小。5.2 调整推理参数以控制生成在 API 调用时可以通过参数精细控制生成过程max_tokens: 生成的最大令牌数。根据你的需求设置避免过长或过短。temperature: 采样温度0-2。值越低如0.1输出越确定和保守值越高如0.8输出越随机和创造性。top_p: 核采样0-1。与 temperature 通常二选一用于控制候选词的概率分布。stream: 是否启用流式响应。对于需要实时显示生成结果的 Web 应用应设为True。5.3 服务启动参数优化启动服务时也有多个参数用于优化性能和资源python -m vllm.entrypoints.openai.api_server \ --model deepseek-ai/deepseek-llm-7b-chat \ --served-model-name deepseek-7b-chat \ --host 0.0.0.0 \ --port 8000 \ --tensor-parallel-size 1 \ # 张量并行度多 GPU 时可增加 --gpu-memory-utilization 0.9 \ # GPU 内存利用率目标默认0.9 --max-num-seqs 256 \ # 最大同时处理的序列数影响并发 --max-model-len 4096 # 模型支持的最大上下文长度请根据你的 GPU 数量和内存情况调整--tensor-parallel-size和--gpu-memory-utilization。6. 常见问题与排查思路在部署过程中你可能会遇到一些典型问题。下表汇总了常见现象、原因及解决方法。问题现象可能原因排查与解决思路启动服务时报CUDA error,out of memory1. 显存不足。2. CUDA 版本与 VLLM/PyTorch 不兼容。3. 驱动问题。1. 使用nvidia-smi查看显存占用尝试关闭其他占用显存的程序。2. 尝试加载量化模型如 AWQ。3. 确认 CUDA 版本 (nvcc --version或nvidia-smi顶部)确保安装的 VLLM 版本与之匹配。4. 更新 NVIDIA 驱动至最新稳定版。服务启动成功但 API 调用返回404或连接拒绝1. 服务未成功启动或已崩溃。2. 端口被占用。3. 客户端连接的地址或端口错误。1. 检查启动服务的终端是否有错误日志。2. 使用netstat -tulnp | grep 8000查看端口占用情况更换端口或终止占用进程。3. 确认客户端代码中的base_url是否为http://localhost:8000/v1注意/v1。API 调用返回422错误请求的 JSON 体格式错误或缺少必要字段。1. 检查model字段名称是否与--served-model-name一致。2. 确保messages是一个列表且每个元素包含role和content键。3. 使用简单的 cURL 命令对比排查。生成速度非常慢1. 首次生成需要编译内核稍慢是正常的。2. 硬件性能瓶颈。3. 生成的max_tokens设置过大。1. 等待首次编译完成后续请求会变快。2. 确认是否在使用 GPU查看服务日志。3. 适当减少max_tokens或调整--max-num-seqs避免排队过长。中文输出乱码或质量差1. 模型本身的中文训练数据比例或能力问题。2. Prompt 构建不佳。1. 尝试在系统提示词systemmessage中明确要求使用中文回答。2. 可以尝试 DeepSeek 的其他版本或专门的中文模型。7. 最佳实践与工程建议将 VLLM 用于实际项目时以下几点建议能帮助你构建更稳健、高效的系统。7.1 模型与配置管理版本固化记录下成功部署的模型版本如deepseek-ai/deepseek-llm-7b-chat的 commit hash和 VLLM 版本。这能保证环境可复现。配置文件将服务启动参数写进 shell 脚本或 Dockerfile 中而不是每次手动输入长命令。# start_server.sh #!/bin/bash source /path/to/vllm-env/bin/activate python -m vllm.entrypoints.openai.api_server \ --model deepseek-ai/deepseek-llm-7b-chat \ --served-model-name deepseek-7b-chat \ --host 127.0.0.1 \ --port 8000 \ --max-model-len 8192 \ --gpu-memory-utilization 0.85然后通过bash start_server.sh启动。7.2 服务化与监控使用进程管理工具不要仅仅在终端前台运行服务。使用systemd,supervisor或pm2来管理进程实现开机自启、崩溃重启和日志轮转。健康检查为你的 VLLM 服务添加一个简单的健康检查端点虽然 VLLM 自带/health并集成到你的监控系统如 Prometheus中。日志收集将 VLLM 输出的日志访问日志、错误日志收集到 ELK 或 Loki 等日志平台便于问题追踪。7.3 应用层开发建议客户端超时与重试在网络调用中务必设置合理的连接超时和读取超时并实现重试机制最好有退避策略以应对服务端的临时压力。from openai import OpenAI, APITimeoutError import backoff client OpenAI(base_url..., timeout30.0) # 设置超时 backoff.on_exception(backoff.expo, (APITimeoutError,), max_tries3) def get_chat_response(messages): try: response client.chat.completions.create(model..., messagesmessages) return response except APITimeoutError as e: # 记录日志并重试 print(f请求超时: {e}) raise输入验证与清理永远不要将未经处理的用户输入直接发送给模型。进行长度检查、敏感词过滤防止 Prompt 注入攻击。限流与配额如果你的服务对多用户开放需要在应用层或网关层如 Nginx实施速率限制和配额管理防止单个用户耗尽资源。7.4 安全考虑网络隔离生产环境切勿使用--host 0.0.0.0公开暴露服务。应绑定到内网 IP如127.0.0.1或192.168.x.x并通过反向代理如 Nginx对外提供服务在 Nginx 上配置 SSL/TLS 和身份验证。API 密钥认证VLLM 支持通过--api-key参数启用简单的令牌认证。生产环境应使用更强大的网关级认证或 OAuth。python -m vllm.entrypoints.openai.api_server ... --api-key my-secret-token-123调用时需在请求头中携带Authorization: Bearer my-secret-token-123。通过以上步骤你不仅能在本地成功运行 DeepSeek 模型更能掌握将其工程化、产品化的关键要点。从环境搭建到服务调用从问题排查到生产实践这套流程为你在本地部署和利用大语言模型提供了坚实的基础。接下来你可以尝试集成到自己的聊天应用、知识库问答系统或自动化工作流中探索 AI 赋能的更多可能性。如果在实践中有新的发现或遇到独特的问题欢迎在社区分享你的经验。

相关新闻

小红书数据采集终极指南:基于Python的高效反爬虫技术实现与实战应用

小红书数据采集终极指南:基于Python的高效反爬虫技术实现与实战应用

小红书数据采集终极指南:基于Python的高效反爬虫技术实现与实战应用 【免费下载链接】xhs 基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/ 项目地址: https://gitcode.com/gh_mirrors/xh/xhs 在小红书这个拥有数亿用户的生活方式分享平台…

2026/8/5 9:30:03 阅读更多 →
3种实用技术方案:高效突破城通网盘下载限制的完整指南

3种实用技术方案:高效突破城通网盘下载限制的完整指南

3种实用技术方案:高效突破城通网盘下载限制的完整指南 【免费下载链接】ctfileGet 获取城通网盘一次性直连地址 项目地址: https://gitcode.com/gh_mirrors/ct/ctfileGet 在当今数字资源共享的时代,城通网盘作为国内广泛使用的文件存储平台&#…

2026/8/5 9:30:03 阅读更多 →
深度图转点云:从相机模型到工程实践的全流程解析

深度图转点云:从相机模型到工程实践的全流程解析

1. 从深度图到点云:不只是三维坐标的简单映射在三维视觉、机器人、自动驾驶乃至AR/VR领域,我们经常听到“点云”这个词。它像是一团由无数个微小光点构成的、能够精确描述物体表面形状的“数字沙尘暴”。而生成这些点云数据,一个最基础、最核…

2026/8/5 9:29:03 阅读更多 →

最新新闻

Ozon 新手选品官方服务|避坑 + 实操 + 数据,小白也能稳出单

Ozon 新手选品官方服务|避坑 + 实操 + 数据,小白也能稳出单

做 Ozon 没思路?官方选品服务帮你找准方向,新手少走弯路快起号一、核心原因:新手选品 90% 踩坑,根源在缺官方指引很多新手做 Ozon,上来就跟风卖 3C、女装,结果要么竞争激烈没流量,要么物流售后拖…

2026/8/5 13:05:51 阅读更多 →
COAWST耦合模式安装指南:从环境配置到编译运行全解析

COAWST耦合模式安装指南:从环境配置到编译运行全解析

1. 项目概述:从“单打独斗”到“协同作战”的海洋模拟革命 如果你正在研究海岸带风暴潮、海浪对泥沙输运的影响,或者想模拟海气相互作用对区域气候的反馈,那你大概率已经听说过或者正在寻找一个能把这些过程“揉”在一起计算的工具。传统的海…

2026/8/5 13:05:51 阅读更多 →
联想拯救者BIOS隐藏选项解锁终极指南:3步释放硬件全部潜能

联想拯救者BIOS隐藏选项解锁终极指南:3步释放硬件全部潜能

联想拯救者BIOS隐藏选项解锁终极指南:3步释放硬件全部潜能 【免费下载链接】LEGION_Y7000Series_Insyde_Advanced_Settings_Tools 支持一键修改 Insyde BIOS 隐藏选项的小工具,例如关闭CFG LOCK、修改DVMT等等 项目地址: https://gitcode.com/gh_mirro…

2026/8/5 13:05:51 阅读更多 →
如何3分钟完成阅读APP书源配置:免费小说资源一键获取指南

如何3分钟完成阅读APP书源配置:免费小说资源一键获取指南

如何3分钟完成阅读APP书源配置:免费小说资源一键获取指南 【免费下载链接】Yuedu 📚「阅读」自用书源分享 项目地址: https://gitcode.com/gh_mirrors/yu/Yuedu 你是否厌倦了付费阅读的烦恼?是否想拥有海量免费小说资源?阅…

2026/8/5 13:05:51 阅读更多 →
MAIGateway,魔芋企业级AI网关的FinAPI预算执行设计

MAIGateway,魔芋企业级AI网关的FinAPI预算执行设计

7月31日,OpenAI宣布GPT-5.6系列降价。入门款Luna输入价格降到0.2美元/百万Token,降幅80%。 有人算了一笔账:从2023年GPT-4到现在的GPT-5.6 Luna,Token单价跌了98%。 按理说企业该笑了。但新浪财经那篇文章的标题是:&…

2026/8/5 13:05:51 阅读更多 →
Level 4自动驾驶系统设计25——前级感知 1

Level 4自动驾驶系统设计25——前级感知 1

本文针对地下停车场复杂工况,提出了一套多模态感知系统的空间分辨率与信噪比控制策略。在地下环氧树脂地面引发的电磁多径干扰和低照度环境下,系统采用动态CA-CFAR算法和自适应去噪技术,确保4D雷达点云密度和视觉图像质量达标。通过建立对账机制,当检测到空间残差超过0.3米…

2026/8/5 13:04:50 阅读更多 →

日新闻

Java缓存框架:JetCache

Java缓存框架:JetCache

TOC 一、简介 JetCache 是一个 Java 缓存抽象框架,为不同的缓存解决方案提供了统一的使用方式。 它提供的注解比 Spring Cache 更加强大。 JetCache 的注解支持原生 TTL、两级缓存以及在分布式环境中的自动刷新功能,同时你也可以通过代码直接操作 Cach…

2026/8/5 0:00:43 阅读更多 →
AD 铺铜设置十字连接,过孔全连接,新版AD的简单设置

AD 铺铜设置十字连接,过孔全连接,新版AD的简单设置

需求:通孔焊盘 十字花;过孔 Via 实心直连;贴片焊盘按需设置 AD 测试版本AD24 很多工程师踩坑:全部统一十字,导致接地过孔阻抗高、大电流发热! 一、快捷键打开规则 PCB 界面按下:D R 展开…

2026/8/5 0:00:43 阅读更多 →
AI素描转换技术深度拆解(2024最新论文+工业级落地代码):从Stable Diffusion ControlNet到LoRA微调全链路解析

AI素描转换技术深度拆解(2024最新论文+工业级落地代码):从Stable Diffusion ControlNet到LoRA微调全链路解析

更多请点击: https://kaifayun.com 第一章:AI生成素描效果 AI生成素描效果是计算机视觉与风格迁移技术融合的典型应用,其核心在于将彩色照片或RGB图像转换为具有手绘质感、明暗对比强烈、边缘清晰的单色素描图像。该过程通常依赖于深度学习模…

2026/8/5 0:00:43 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/4 13:24:41 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/4 11:41:39 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/5 10:20:36 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/4 13:38:24 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/4 11:09:16 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/4 13:38:40 阅读更多 →