一文阐述国内网络环境下使用NIM方法
NVIDIA NIMNVIDIA Inference Microservice是一套容器化的微服务套件旨在通过优化的推理引擎和标准的 API 接口帮助企业和开发者在任何基础设施上以极低的代码开销快速、高效地部署和运行大语言模型等 AI 应用。使用步骤0.0 前提测试脚本echo 1. 操作系统版本 cat/etc/os-release|grep-EPRETTY_NAME\echo-e\n 2. 显卡驱动与 CUDA 版本 nvidia-smi\echo-e\n 3. Docker 版本 docker--version\echo-e\n 4. NVIDIA Container Toolkit 版本 nvidia-container-toolkit--version返回, 我的显卡驱动(Driver Version) 不支持CUDA 版本也不支持1. 操作系统版本PRETTY_NAMEDebian GNU/Linux 12 (bookworm)2. 显卡驱动与 CUDA 版本Wed Jul2915:26:382026-----------------------------------------------------------------------------|NVIDIA-SMI525.147.05 Driver Version:525.147.05 CUDA Version:12.0||---------------------------------------------------------------------------|GPU Name Persistence-M|Bus-Id Disp.A|Volatile Uncorr. ECC||Fan Temp Perf Pwr:Usage/Cap|Memory-Usage|GPU-Util Compute M.||||MIG M.||||0NVIDIA A40 Off|00000000:4F:00.0 Off|0||0% 31C P0 71W / 300W|4580MiB / 46068MiB|0% Default||||N/A|---------------------------------------------------------------------------|1NVIDIA A40 Off|00000000:52:00.0 Off|0||0% 29C P0 71W / 300W|0MiB / 46068MiB|0% Default||||N/A|---------------------------------------------------------------------------|2NVIDIA A40 Off|00000000:56:00.0 Off|0||0% 30C P0 74W / 300W|0MiB / 46068MiB|0% Default||||N/A|---------------------------------------------------------------------------|3NVIDIA A40 Off|00000000:D1:00.0 Off|0||0% 31C P0 73W / 300W|0MiB / 46068MiB|0% Default||||N/A|---------------------------------------------------------------------------|4NVIDIA A40 Off|00000000:D5:00.0 Off|0||0% 30C P0 70W / 300W|0MiB / 46068MiB|3% Default||||N/A|--------------------------------------------------------------------------- -----------------------------------------------------------------------------|Processes:||GPU GI CI PID Type Process name GPU Memory||ID ID Usage||||0N/A N/A4435C python 4578MiB|-----------------------------------------------------------------------------3. Docker 版本Docker version28.0.4, build b8034c04. NVIDIA Container Toolkit 版本NVIDIA Container Runtime Hook version1.14.5 commit: 9ea336070134e612145d342e495f2fc616aab063后面需要先升级才能继续自 2025 年 2 月 15 日起官方直接请求 nvcr.io 下载 NIM 镜像和模型的 API/CLI 路径对中国大陆 IP 进行了拦截与限制。官方常规文档中的注册、直接 docker login 以及默认 nvcr.io 拉取等步骤在纯国内网络环境下均会触发 unauthorized 或被拒绝下载。国内用户请直接从下文的“国内专用通道”开始操作。文中0.10.3 都是没用的可以直接跳转到1开始0.1Register:[API Key 获取]https://org.ngc.nvidia.com/setup/api-keys0.2 Login0.3 docker 拉取服务启动exportNIM_LLM_IMAGEnvcr.io/nim/meta/llama-3.1-8b-instruct:2.0.9exportLOCAL_NIM_CACHE/data/nim-cachedockerrun--gpusall\-eNGC_API_KEY$NGC_API_KEY\-v$LOCAL_NIM_CACHE:/opt/nim/.cache\-p8000:8000\${NIM_LLM_IMAGE} 如果直接按照官方然后就会出现下面的问题CND 必需 自2025年2月15日起所有来自中国 IP 地址用于下载 NIM 镜像和模型的 API/CLI 请求将被拒绝对于中国用户请使用以下链接跳转到我们中国 NIM 合作伙伴提供的地址下载 NIM 镜像和模型https://catalog.ngc.nvidia.com/china-nim-distributors1. 国内环境下使用流程所以国内情况下上面三个步骤都是踩的坑点击网址会跳转到这么个地方三个都可以选一个喜欢的选一个你可以能使用的喜欢的模型下载镜像sudotgc--usertgc$cnd***--tokenCQm****3ZQ--typec--containertgcr.turing-agi.com/cnd/nim/qwen/qwen-2.5-7b-instruct:latest设置模型缓存目录这个要设置大一点的目录df -h 看下选择一个合适的exportLOCAL_NIM_CACHE/data/nim/mkdir-p$LOCAL_NIM_CACHEsudochmod0777-R$LOCAL_NIM_CACHE拉去模型文件sudotgc--usertgc$cnd****--tokenCQ****3ZQ--typem--containertgcr.turing-agi.com/cnd/nim/qwen/qwen-2.5-7b-instruct:latest--save_dir$LOCAL_NIM_CACHE启动默认可以使用全部GPUsudodockerrun--namenim-qwen25-7b-itd\--gpusall\--ipchost\--ulimitmemlock-1\--ulimitstack67108864\-v$LOCAL_NIM_CACHE:/opt/nim/.cache\-p18000:8000\tgcr.turing-agi.com/cnd/nim/qwen/qwen-2.5-7b-instruct:latest固定使用特定GPU# 使用一张sudodockerrun--namenim-qwen25-7b-itd\--gpusdevice0\--ipchost\--ulimitmemlock-1\--ulimitstack67108864\-v/data/nim-cache:/opt/nim/.cache\-p18000:8000\tgcr.turing-agi.com/cnd/nim/qwen/qwen-2.5-7b-instruct:latest# 使用多张sudodockerrun--namenim-qwen25-7b-itd\--gpusdevice1,2\--ipchost\--ulimitmemlock-1\--ulimitstack67108864\-v/data/nim-cache:/opt/nim/.cache\-p18000:8000\tgcr.turing-agi.com/cnd/nim/qwen/qwen-2.5-7b-instruct:latest检查使用# 检查健康curlhttp://localhost:8000/v1/health/ready# 使用大模型curl-XPOST\http://localhost:8000/v1/chat/completions\-Haccept: application/json\-HContent-Type: application/json\-d{ model: qwen/qwen-2.5-7b-instruct, messages: [ { role: system, content: You are a helpful assistant. }, { role: user, content: 你好请介绍一下你自己。 } ], max_tokens: 512, temperature: 0.7 }附录 模型占用显存换算公式第一步计算模型基础权重显存Core Weight Memory这是模型躺在显存里“静止”时占用的空间公式为权重显存 (GB) 模型参数量 (B) × 每个参数字节数 10 9 \text{权重显存 (GB)} \frac{\text{模型参数量 (B)} \times \text{每个参数字节数}}{10^9}权重显存(GB)109模型参数量(B)×每个参数字节数​常见精度的字节数速查FP32 / 全精度4字节/参数FP16 / BF16半精度标准2字节/参数INT88位量化1字节/参数INT4 / AWQ / GPTQ / EXL24位量化0.5字节/参数 快速口算示例一个32B320亿参数的模型如果用FP16跑32 × 2 1 64 GB \frac{32 \times 2}{1} 64 \text{ GB}132×2​64GB基础权重。第二步乘以框架与运行时安全系数Runtime Overhead大模型跑起来时GPU 驱动、CUDA 上下文以及推理框架如 vLLM、Triton、NIM会占用额外的显存。因此需要把基础权重乘以一个安全系数通常取 1.25实际运行底座显存 (GB) 权重显存 × 1.25 \text{实际运行底座显存 (GB)} \text{权重显存} \times 1.25实际运行底座显存(GB)权重显存×1.25第三步加上上下文与并发显存KV CacheKV Cache 用于存储对话的历史上下文和长文本。它不是固定的而是随着并发请求数Batch Size和上下文长度Context Length动态变化的。简易估算经验值短文本/单用户轻量测试预留2 ~ 4 GB即可。长文本如 32k/ 高并发生产环境建议额外预留8 ~ 16 GB甚至更多。 终极通用估算公式将上述三步合二为一得出最终的总显存需求公式所需总显存 (GB) ( 参数量 (B) × 每个参数字节数 × 1.25 ) KV Cache 预留空间 \text{所需总显存 (GB)} \left( \text{参数量 (B)} \times \text{每个参数字节数} \times 1.25 \right) \text{KV Cache 预留空间}所需总显存(GB)(参数量(B)×每个参数字节数×1.25)KV Cache预留空间 常见规格对照参考表以 FP16/BF16 为例模型参数量仅加载权重 (FP16)建议最低显存跑起来推荐安全/生产显存带并发和长文本7B / 8B~14 GB18 - 20 GB24 GB(如 RTX 3090/4090)14B / 13B~28 GB35 - 38 GB48 GB(如单张 A40 / A100)32B / 34B~64 GB80 - 85 GB96 GB(如双卡 A40 / A100)70B / 72B~140 GB175 - 185 GB256 GB(如 4卡 或 8卡集群)ReferencePrerequisitesInstallation ConfigurationConfigurationNVIDIA NIM for Large Language Models-QuickStart图灵

相关新闻

学术论文研究创新点的提炼方法与实践路径解析

学术论文研究创新点的提炼方法与实践路径解析

研一新生必装 五个让你少走三年弯路的科研神器 刚进实验室的研一新生最容易陷入迷茫。不知道怎么确定研究方向,看不懂海量外文文献,不会设计合理的实验方案,数据处理和绘图一窍不通,写第一篇学术论文更是无从下手。别慌&#xff…

2026/7/30 21:01:34 阅读更多 →
VectorFlow性能优化技巧:提升向量嵌入吞吐量的5个实用方法

VectorFlow性能优化技巧:提升向量嵌入吞吐量的5个实用方法

VectorFlow性能优化技巧:提升向量嵌入吞吐量的5个实用方法 【免费下载链接】vectorflow VectorFlow is a high volume vector embedding pipeline that ingests raw data, transforms it into vectors and writes it to a vector DB of your choice. 项目地址: h…

2026/7/30 21:00:34 阅读更多 →
主数据管理平台选型有哪些常见误区?怎么避免主数据管理平台选型后无法落地?

主数据管理平台选型有哪些常见误区?怎么避免主数据管理平台选型后无法落地?

去年下半年,我们刚上线不久的主数据管理平台就捅了篓子。因为客户主数据同步任务漏配了一个校验节点,上千条客户记录被重复写入ERP,销售订单发运时系统直接报错,物流停摆了整整半天。业务部门电话打爆,我们连夜手动清洗…

2026/7/30 21:00:34 阅读更多 →

最新新闻

物联网安全防护体系构建与实战案例分析

物联网安全防护体系构建与实战案例分析

1. 物联网安全现状与挑战物联网设备数量正以惊人的速度增长,预计到2025年全球联网设备将超过750亿台。但安全防护水平却远远跟不上这种扩张速度。我在过去三年处理过的物联网安全事件中,90%以上都源于基础防护措施的缺失。常见攻击手段包括:默…

2026/7/30 21:10:36 阅读更多 →
OpenHarmony 小鸿 AI 开发实战 17:从长文本到发热量化的端到端验收

OpenHarmony 小鸿 AI 开发实战 17:从长文本到发热量化的端到端验收

一套 OpenHarmony 语音终端能完成一次问答,不等于它已经通过端到端验收。真正的验收要把问题拆成可追溯的观测点:回答文本是否完整进入设备,240240 屏幕是否按 UTF-8 边界翻页,最后一页是否停留,TTS 音频是否排空&…

2026/7/30 21:10:36 阅读更多 →
VulnOSv2靶机渗透测试实战:从Web到Root的完整攻防

VulnOSv2靶机渗透测试实战:从Web到Root的完整攻防

1. VulnOSv2靶机渗透测试概述VulnOSv2是专为网络安全学习设计的漏洞演练环境,模拟了真实系统中常见的多个安全缺陷。这个基于Debian的Linux靶机包含了从Web应用到系统层的完整漏洞链,特别适合练习综合渗透技术。我在实际测试中发现,从初始Web…

2026/7/30 21:10:36 阅读更多 →
ShaderKit核心功能解析:uniforms与attributes使用技巧大揭秘

ShaderKit核心功能解析:uniforms与attributes使用技巧大揭秘

ShaderKit核心功能解析:uniforms与attributes使用技巧大揭秘 【免费下载链接】ShaderKit A library of fragment shaders you can use in any SpriteKit project. 项目地址: https://gitcode.com/gh_mirrors/sh/ShaderKit ShaderKit是一款专为SpriteKit项目打…

2026/7/30 21:10:36 阅读更多 →
195、手机影像调优:夜景模式与多摄融合中的全链路参数协同

195、手机影像调优:夜景模式与多摄融合中的全链路参数协同

195、手机影像调优:夜景模式与多摄融合中的全链路参数协同 一个让我熬夜三天的bug 去年Q3,某旗舰机项目,夜景模式在暗光下拍路灯,主摄和超广角融合后,灯杆边缘出现“鬼影”——不是光学鬼影,是那种半透明的、像果冻一样抖动的伪像。我盯着屏幕看了两小时,以为是HDR对齐…

2026/7/30 21:09:36 阅读更多 →
Matplotlib数据可视化:从入门到科研级图表实战

Matplotlib数据可视化:从入门到科研级图表实战

1. Matplotlib入门:为什么每个数据人都需要掌握它 第一次接触Matplotlib是在研究生时期的数据可视化课程上。教授在黑板上画了一个简单的折线图,然后说:"这个库会成为你们科研路上最忠实的伙伴。"当时不以为意,直到自己…

2026/7/30 21:09:36 阅读更多 →

日新闻

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南 【免费下载链接】DriverStoreExplorer Driver Store Explorer 项目地址: https://gitcode.com/gh_mirrors/dr/DriverStoreExplorer 您是否曾因Windows系统盘空间不足而烦恼?是否遇到过设…

2026/7/30 0:00:13 阅读更多 →
如何3步掌握Video Download Helper:网页视频下载的完整实战指南

如何3步掌握Video Download Helper:网页视频下载的完整实战指南

如何3步掌握Video Download Helper:网页视频下载的完整实战指南 【免费下载链接】VideoDownloadHelper Chrome Extension to Help Download Video for Some Video Sites. 项目地址: https://gitcode.com/gh_mirrors/vi/VideoDownloadHelper 你是否曾经在浏览…

2026/7/30 0:00:13 阅读更多 →
“双减”后首个AI备课压力测试报告:覆盖32所中小学的176节AI辅助课,暴露4大隐性增负节点

“双减”后首个AI备课压力测试报告:覆盖32所中小学的176节AI辅助课,暴露4大隐性增负节点

更多请点击: https://intelliparadigm.com 第一章:AI 教师备课辅助 AI 教师备课辅助系统正逐步成为教育数字化转型的核心支撑工具,它并非替代教师,而是通过语义理解、知识图谱与多模态生成能力,将教师从重复性劳动中解…

2026/7/30 0:00:13 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/29 22:18:20 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/29 15:00:03 阅读更多 →

月新闻