VLLM部署Qwen模型
一、Qwen2.5-14B1. 环境准备# 创建并激活虚拟环境推荐 python -m venv qwen_env source qwen_env/bin/activate # 安装依赖库确保Python≥3.8 pip install vllm transformers torch2. 下载模型pip install modelscope modelscope download --model Qwen/Qwen2.5-14B-Instruct --local_dir path/to/dir如果下载模型的时候提示没有权限export MODELSCOPE_CACHE/tmp/modelscope_cache modelscope download --model Qwen/Qwen2.5-7B-Instruct3. 启动服务# 指定4张GPU根据实际GPU数量调整 export CUDA_VISIBLE_DEVICES0,1,2,3 # 设置模型路径和服务名称 MODEL_PATH./Qwen2.5-14B-Instruct SERVED_MODEL_NAMEQwen2.5_14B # 启动服务关键参数说明见注释 python -m vllm.entrypoints.openai.api_server \ --model $MODEL_PATH \ --served-model-name $SERVED_MODEL_NAME \ --tensor-parallel-size 4 \ # 使用4张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文4. 验证服务发送测试请求新终端curl http://localhost:8000/v1/models预期输出{object:list,data:[{id:qwen2.5_14B,object:model}]}5. 调用API示例​​import openai client openai.OpenAI(base_urlhttp://localhost:8000/v1, api_keynone) response client.chat.completions.create( modelqwen2.5_14B, messages[{role: user, content: 你好}] ) print(response.choices[0].message.content)6. 远程调用API示例首先本地获取IP地址ifconfig然后远程使用例如import openai client openai.OpenAI(base_urlhttp://10.233.23.133:8000/v1, api_keynone) response client.chat.completions.create( modelqwen2.5_14B, messages[{role: user, content: 你好}] ) print(response.choices[0].message.content)二、Qwen3-14B部署方式类似但需要cuda版本12.4可以nvidia-smi查看transformers版本4.51.0。1. 安装VLLM1创建 conda 环境# 创建 conda 虚拟环境环境名称为 vllmpython 的版本为 3.10 conda create -n vllm python3.102切换 vllm 环境conda activate vllm这里有可能切换失败可以尝试两种方案conda init或者source ~/.bashrc3安装 vllm 和 modelscopepip install -U vllm \ --pre \ --extra-index-url https://wheels.vllm.ai/nightly pip install modelscope2. 启动服务创建run.sh文件# 指定2张GPU根据实际GPU数量调整 export CUDA_VISIBLE_DEVICES0,1 # 设置模型路径和服务名称 MODEL_PATH./Qwen3-14B SERVED_MODEL_NAMEQwen3_14B # 启动服务关键参数说明见注释 python -m vllm.entrypoints.openai.api_server \ --model $MODEL_PATH \ --served-model-name $SERVED_MODEL_NAME \ --tensor-parallel-size 2 \ # 使用2张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文然后命令行运行sh run.sh3. 调用API示例​​import openai client openai.OpenAI(base_urlhttp://localhost:8000/v1, api_keynone) response client.chat.completions.create( modelqwen3-14B, messages[{role: user, content: /no_think 你好}] ) print(response.choices[0].message.content)三、关于虚拟环境在notebook使用conda install ipykernel python -m ipykernel install --user --name vllm四、Qwen3.5-27B部署方式类似但需要cuda版本13.0可以nvidia-smi查看Python 3.12。然后vLLM 0.27.1 transformers 5.15.0。1. 安装VLLM1创建 conda 环境# 创建 conda 虚拟环境环境名称为 vllmpython 的版本为 3.12 conda create -n vllm python3.122切换 vllm 环境conda activate vllm这里有可能切换失败可以尝试两种方案conda init或者source ~/.bashrc3安装 vllm 和 modelscopeuv pip install vllm0.27.1 --torch-backendcu130 pip install modelscope2. 启动服务创建run.sh文件# 指定2张GPU根据实际GPU数量调整 export CUDA_VISIBLE_DEVICES0,1 # 设置模型路径和服务名称 MODEL_PATH./Qwen3.5-27B SERVED_MODEL_NAMEQwen3.5_27B # 启动服务关键参数说明见注释 python -m vllm.entrypoints.openai.api_server \ --model $MODEL_PATH \ --served-model-name $SERVED_MODEL_NAME \ --tensor-parallel-size 2 \ # 使用2张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文然后命令行运行sh run.sh

相关新闻

DotNetIsolator是什么?在.NET中运行隔离.NET运行时的完整入门指南

DotNetIsolator是什么?在.NET中运行隔离.NET运行时的完整入门指南

DotNetIsolator是什么?在.NET中运行隔离.NET运行时的完整入门指南 【免费下载链接】DotNetIsolator A library for running isolated .NET runtimes inside .NET 项目地址: https://gitcode.com/gh_mirrors/do/DotNetIsolator DotNetIsolator 是一个让你在 .…

2026/8/18 15:48:03 阅读更多 →
Terraform Visual 字段级 Diff 指南:轻松对比变更前后的属性差异

Terraform Visual 字段级 Diff 指南:轻松对比变更前后的属性差异

Terraform Visual 字段级 Diff 指南:轻松对比变更前后的属性差异 【免费下载链接】terraform-visual Terraform Visual is an interactive way of visualizing your Terraform plan 项目地址: https://gitcode.com/gh_mirrors/te/terraform-visual Terraform…

2026/8/18 15:48:03 阅读更多 →
cassandra gem核心API入门:10个必会的读写操作(insert、get、remove)

cassandra gem核心API入门:10个必会的读写操作(insert、get、remove)

cassandra gem核心API入门:10个必会的读写操作(insert、get、remove) 【免费下载链接】cassandra A Ruby client for the Cassandra distributed database 项目地址: https://gitcode.com/gh_mirrors/cassan/cassandra 想用 Ruby 操作…

2026/8/18 15:48:03 阅读更多 →

最新新闻

老旧Mac如何免费升级最新macOS?OpenCore Legacy Patcher完整上手指南

老旧Mac如何免费升级最新macOS?OpenCore Legacy Patcher完整上手指南

老旧Mac如何免费升级最新macOS?OpenCore Legacy Patcher完整上手指南 【免费下载链接】OpenCore-Legacy-Patcher Experience macOS just like before 项目地址: https://gitcode.com/GitHub_Trending/op/OpenCore-Legacy-Patcher 如果你的Mac是2014年、2015年…

2026/8/18 16:30:59 阅读更多 →
5分钟快速上手Qwen3.5-9B-w4a16-asym-torchao-v0.17.0:AMD EPYC CPU推理入门教程

5分钟快速上手Qwen3.5-9B-w4a16-asym-torchao-v0.17.0:AMD EPYC CPU推理入门教程

5分钟快速上手Qwen3.5-9B-w4a16-asym-torchao-v0.17.0:AMD EPYC CPU推理入门教程 【免费下载链接】Qwen3.5-9B-w4a16-asym-torchao-v0.17.0 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen3.5-9B-w4a16-asym-torchao-v0.17.0 Qwen3.5-9B-w4a16-asym…

2026/8/18 16:30:59 阅读更多 →
Goo-Engine 安装实录:3 个里程碑、4 个专属节点,把动漫渲染工期从 3 天压到 10 分钟

Goo-Engine 安装实录:3 个里程碑、4 个专属节点,把动漫渲染工期从 3 天压到 10 分钟

Goo-Engine 安装实录:3 个里程碑、4 个专属节点,把动漫渲染工期从 3 天压到 10 分钟 【免费下载链接】goo-engine Custom build of blender with some extra NPR features. 项目地址: https://gitcode.com/gh_mirrors/go/goo-engine Goo-Engine 是…

2026/8/18 16:30:59 阅读更多 →
PullToMakeSoup:Yalantis 出品的 iOS 动画下拉刷新组件完整介绍

PullToMakeSoup:Yalantis 出品的 iOS 动画下拉刷新组件完整介绍

PullToMakeSoup:Yalantis 出品的 iOS 动画下拉刷新组件完整介绍 【免费下载链接】PullToMakeSoup Custom animated pull-to-refresh that can be easily added to UIScrollView 项目地址: https://gitcode.com/gh_mirrors/pu/PullToMakeSoup 如果你正在寻找一…

2026/8/18 16:30:59 阅读更多 →
Sorting-Algorithms-Blender 项目结构全解析:sort_circle、sort_color、sort_scale、sort_combined 四大文件夹一文读懂

Sorting-Algorithms-Blender 项目结构全解析:sort_circle、sort_color、sort_scale、sort_combined 四大文件夹一文读懂

Sorting-Algorithms-Blender 项目结构全解析:sort_circle、sort_color、sort_scale、sort_combined 四大文件夹一文读懂 【免费下载链接】Sorting-Algorithms-Blender Sorting algorithms visualized using the Blender Python API. 项目地址: https://gitcode.co…

2026/8/18 16:30:58 阅读更多 →
深度解析SingGuard-NSFA-4B:一文读懂覆盖185种攻击风险的NSFA分类体系

深度解析SingGuard-NSFA-4B:一文读懂覆盖185种攻击风险的NSFA分类体系

深度解析SingGuard-NSFA-4B:一文读懂覆盖185种攻击风险的NSFA分类体系 【免费下载链接】SingGuard-NSFA-4B 项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/SingGuard-NSFA-4B 随着AI Agent(智能体)开始自主调用工具、读写…

2026/8/18 16:29:58 阅读更多 →

日新闻

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF 【免费下载链接】extract-video-ppt extract the ppt in the video 项目地址: https://gitcode.com/gh_mirrors/ex/extract-video-ppt 如果你还停留在"看网课 不停暂停 截图 …

2026/8/18 0:00:57 阅读更多 →
思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查

思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查

思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查 【免费下载链接】source-han-serif-ttf Source Han Serif TTF 项目地址: https://gitcode.com/gh_mirrors/so/source-han-serif-ttf 你是不是也经历过这种时刻:设计稿里…

2026/8/18 0:00:58 阅读更多 →
华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate

华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate

华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate 【免费下载链接】g-helper Lightweight Armoury Crate alternative for Asus laptops with nearly the same functionality. Works with ROG Zephyrus, Flow, TUF, Strix, Scar, ProArt, …

2026/8/18 0:00:59 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/18 9:15:35 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/18 9:06:28 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/18 9:04:56 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/17 18:54:37 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/17 18:55:16 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/17 18:55:55 阅读更多 →