【大模型预备1】Ollama 本地部署指南
Qwen Ollama 本地部署指南适配机型Intel i9-13900H / 16GB DDR5 / RTX 4050 Laptop 6GB / Windows编写日期2026-07-09目录一、环境概览与模型选型二、安装 Ollama三、部署 Qwen2.5-Coder 模型四、验证模型服务五、配置 Qwen Code 本地通道六、日常使用与技巧七、常见问题排查附录命令速查表一、环境概览与模型选型1.1 你的硬件配置硬件规格说明CPUIntel Core i9-13900H14核20线程CPU 推理能力强内存16GB DDR5-4800双通道充足独显NVIDIA RTX 4050 Laptop6GB GDDR6 显存关键瓶颈系统Windows 11需启用 Hyper-V 或 WSL2Ollama 依赖1.2 Qwen2.5-Coder 模型选型根据你的6GB 显存以下是各规格模型的适配情况模型量化显存占用内存占用适配状态推荐度qwen2.5-coder:0.5bQ4~0.5 GB~1 GB✅ 轻松运行⭐⭐ 太快但能力有限qwen2.5-coder:1.5bQ4~1.2 GB~2 GB✅ 轻松运行⭐⭐⭐ 轻量任务首选qwen2.5-coder:3bQ4~2.2 GB~3.5 GB✅ 流畅运行⭐⭐⭐⭐ 性价比最高qwen2.5-coder:7bQ4_K_M~4.8 GB~6 GB✅ 可以运行⭐⭐⭐⭐⭐强烈推荐qwen2.5-coder:7bQ8~7.5 GB~9 GB❌ 显存不足—qwen2.5-coder:14bQ4~9 GB~12 GB⚠️ 需纯 CPU 模式⭐⭐ 速度较慢qwen2.5-coder:32bQ4~20 GB~22 GB❌ 内存不足—1.3 推荐方案主力模型qwen2.5-coder:7bQ4_K_M 量化显存占用约 4.8GB剩余 ~1.2GB 余量可正常运行7B 参数量的代码能力已经很强适合日常编程辅助如果长对话时出现显存不足可切换到 3b 版本备用模型qwen2.5-coder:3b显存占用低适合快速问答和简单补全长上下文场景的保底选择二、安装 Ollama2.1 下载 Ollama方式一官网下载推荐打开浏览器访问https://ollama.com/download点击Download for Windows按钮下载完成后双击OllamaSetup.exe运行安装程序按提示完成安装默认安装路径即可方式二命令行安装# 使用 winget 安装Windows 11 自带winget install Ollama.Ollama2.2 验证安装安装完成后打开PowerShell或CMD执行ollama--version预期输出类似ollama version is 0.x.x2.3 确认 Ollama 服务运行# 检查 Ollama 服务是否在运行ollama list如果显示模型列表即使为空说明服务正常运行。如果提示连接失败手动启动服务# 启动 Ollama 服务ollama serve提示安装后 Ollama 通常会自动添加到系统托盘开机自启动。检查系统托盘右下角是否有 Ollama 图标。2.4 配置 Ollama 环境变量可选但推荐为了让 Ollama 在局域网内可访问以及配置 GPU 策略# 设置 Ollama 监听所有网卡默认只监听 127.0.0.1[System.Environment]::SetEnvironmentVariable(OLLAMA_HOST,0.0.0.0:11434,User)# 设置模型存储路径默认在 C 盘用户目录可改到其他盘节省空间# [System.Environment]::SetEnvironmentVariable(OLLAMA_MODELS, D:\OllamaModels, User)# 设置 GPU 层数确保充分利用 GPU[System.Environment]::SetEnvironmentVariable(OLLAMA_NUM_GPU,99,User)# 设置并发请求数6GB 显存建议 1 个并发[System.Environment]::SetEnvironmentVariable(OLLAMA_NUM_PARALLEL,1,User)# 设置上下文窗口大小代码任务建议 8K太大占显存[System.Environment]::SetEnvironmentVariable(OLLAMA_MAX_LOADED_MODELS,1,User)设置后需重启 Ollama 服务或重启电脑生效。三、部署 Qwen2.5-Coder 模型3.1 拉取主力模型7B# 拉取 qwen2.5-coder 7B Q4_K_M 量化版本# 文件大小约 4.7GB请确保网络畅通ollama pull qwen2.5-coder:7b下载过程中会显示进度pulling manifest ... pulling model ... ████████████████████████████████ 100% verifying sha256 hash ... writing layer ... success3.2 拉取备用模型3B# 拉取轻量版本作为备用ollama pull qwen2.5-coder:3b3.3 确认模型已就绪ollama list预期输出NAME ID SIZE MODIFIED qwen2.5-coder:7b xxxxxxxxxxxx 4.7 GB Just now qwen2.5-coder:3b xxxxxxxxxxxx 1.9 GB Just now3.4 首次运行测试# 启动交互式对话ollama run qwen2.5-coder:7b进入对话模式后输入测试问题 用 Python 写一个快速排序算法模型会生成代码回复。输入/bye退出对话。3.5 自定义 Modelfile可选你可以创建自定义模型配置优化代码任务表现创建文件D:\AI_tools\Modelfiles\Modelfile-qwen-coderFROM qwen2.5-coder:7b # 设置较低的 temperature代码生成更精确 PARAMETER temperature 0.2 # 设置上下文窗口4096 适合 6GB 显存不会 OOM PARAMETER num_ctx 4096 # 设置系统提示词 SYSTEM 你是一个专业的编程助手擅长代码编写、调试和优化。 请用简洁清晰的方式回答问题代码示例优先使用 Python。 如果用户没有指定语言默认使用 Python。创建自定义模型ollama create qwen-coder-dev-fD:\AI_tools\Modelfiles\Modelfile-qwen-codergathering model componentsusingexisting layer sha256:60e05f2100071479f596b964f89f510f057ce397ea22f2833a0cfe029bfc2463usingexisting layer sha256:1e65450c30670713aa47fe23e8b9662bdf4065e81cc8e3cbfaa98924fcc0d320usingexisting layer sha256:832dd9e00a68dd83b3c3fb9f5588dad7dcf337a0db50f7d9483f310cd292e92e creating new layer sha256:bd1b96a1e7ccedeb4e0d70746424a5af6dd9b940fad03baaa9c0aab08a1b2c72 creating new layer sha256:b6547438cc91533750125e8064db03ab33731d6af2e0eae4341db7136b76a1f0 writing manifest success使用自定义模型ollama run qwen-coder-dev写个快排四、验证模型服务4.1 命令行验证# 单次提问非交互模式ollama run qwen2.5-coder:7b用 Python 写一个二分查找4.2 API 接口验证Ollama 默认在http://localhost:11434提供 REST API。方式一PowerShell 测试# 测试 API 是否可用Invoke-RestMethod-Urihttp://localhost:11434/api/tags|ConvertTo-Json方式二curl 测试需安装 curl# 列出所有模型curlhttp://localhost:11434/api/tags# 发送对话请求curlhttp://localhost:11434/api/chat-d{ model: qwen2.5-coder:7b, messages: [{role: user, content: 写一个 Python Hello World}], stream: false }方式三浏览器测试打开浏览器访问http://localhost:11434看到Ollama is running即表示服务正常。4.3 OpenAI 兼容接口验证Ollama 同时提供 OpenAI 格式的 API方便各类工具接入基础地址http://localhost:11434/v1 模型名称qwen2.5-coder:7b API Key任意填写如 ollama# 测试 OpenAI 兼容接口curl http://localhost:11434/v1/chat/completions-HContent-Type: application/json-d{ model: qwen2.5-coder:7b, messages: [{role: user, content: 你好}], temperature: 0.7 }4.4 GPU 使用情况监控在另一个终端窗口中监控 GPU 使用# 实时监控 GPU 状态nvidia-smi-l 1运行模型推理时应看到GPU-Util 升高显存占用增加约 4-5GB进程列表中出现ollama或llama-server五、配置 Qwen Code 本地通道Qwen Code 支持通过配置连接本地 Ollama 模型作为 AI 推理后端。5.1 找到 Qwen Code 配置文件Qwen Code 的配置文件位于C:\Users\Administrator\.qwen\settings.json5.2 配置本地 Ollama 模型打开settings.json添加或修改以下配置{ai:{model:ollama/qwen2.5-coder:7b,provider:ollama,baseUrl:http://localhost:11434/v1,apiKey:ollama}}字段说明字段值说明modelollama/qwen2.5-coder:7b模型标识格式为provider/model-nameproviderollama指定使用 Ollama 作为提供者baseUrlhttp://localhost:11434/v1Ollama 的 OpenAI 兼容 API 地址apiKeyollamaOllama 本地不需要真实 Key任意填写即可5.3 使用 Qwen Code CLI 配置替代方式如果你更习惯命令行配置可以使用 Qwen Code 的设置命令# 在 Qwen Code 中输入斜杠命令/qc-helper configurelocalollama model5.4 配置多模型切换可选如果你想在不同场景使用不同模型可以创建多个配置配置 1主力编程7B{ai:{model:ollama/qwen2.5-coder:7b,provider:ollama,baseUrl:http://localhost:11434/v1,apiKey:ollama}}配置 2轻量快速3B{ai:{model:ollama/qwen2.5-coder:3b,provider:ollama,baseUrl:http://localhost:11434/v1,apiKey:ollama}}5.5 验证 Qwen Code 连接配置完成后在 Qwen Code 中执行简单任务测试 1 1 等于多少如果能正常回复说明本地通道配置成功。六、日常使用与技巧6.1 常用 Ollama 命令# 查看已安装的模型ollama list# 下载新模型ollama pull model-name# 运行模型交互模式ollama run model-name# 运行模型单次提问ollama run model-name你的问题# 删除模型释放磁盘空间ollamarmmodel-name# 复制模型ollamacpsource target# 查看模型信息ollama show model-name# 查看运行中的模型ollamaps# 停止运行中的模型ollama stop model-name6.2 性能优化建议针对你的RTX 4050 6GB配置# 1. 推理前清理显存 —— 停止不需要的模型ollama stop qwen2.5-coder:3b# 2. 确保只有一个模型加载到显存# 环境变量已设置 OLLAMA_MAX_LOADED_MODELS1# 3. 如果 7B 出现 OOM降低上下文长度# 在 Modelfile 中设置PARAMETER num_ctx 2048# 4. 利用 CPU 核心优势 —— 设置合理的 CPU 线程数# 环境变量[System.Environment]::SetEnvironmentVariable(OLLAMA_NUM_THREADS,14,User)6.3 搭配 Web UI 使用可选如果你想要一个聊天界面可以安装 Open WebUI# 使用 Docker 安装需先安装 Docker Desktopdocker run-d-p 3000:8080 ^--add-hosthost.docker.internal:host-gateway ^-vopen-webui:/app/backend/data^--nameopen-webui^ ghcr.io/open-webui/open-webui:main然后浏览器访问http://localhost:3000即可使用 Web 聊天界面。6.4 搭配 VS Code 使用可选如果你使用 VS Code 编写代码可以安装Continue扩展VS Code 中搜索安装Continue扩展在 Continue 配置中添加 Ollama 提供者模型qwen2.5-coder:7bAPI 地址http://localhost:11434即可在 VS Code 中获得代码补全和对话功能七、常见问题排查7.1 显存不足OOM现象运行 7B 模型时报错out of memory或CUDA out of memory解决方案# 方案 1切换到 3B 模型ollama run qwen2.5-coder:3b# 方案 2减小上下文窗口# 编辑 Modelfile设置更小的 num_ctxPARAMETER num_ctx 2048# 方案 3强制使用部分 GPU 部分 CPU# 设置环境变量限制 GPU 层数[System.Environment]::SetEnvironmentVariable(OLLAMA_NUM_GPU,20,User)# 重启 Ollama 后生效7.2 模型下载慢现象ollama pull速度很慢或超时解决方案# 方案 1使用代理$env:HTTPS_PROXY http://127.0.0.1:7890# 替换为你的代理地址ollama pull qwen2.5-coder:7b# 方案 2从 ModelScope 手动下载后导入# 1. 访问 https://modelscope.cn/models/qwen/Qwen2.5-Coder-7B-Instruct-GGUF# 2. 下载 GGUF 文件# 3. 创建 Modelfile 导入# FROM ./qwen2.5-coder-7b-instruct-q4_k_m.gguf# 4. ollama create qwen2.5-coder:7b -f Modelfile7.3 Ollama 服务无法启动现象ollama serve报错或无响应# 检查端口是否被占用netstat-ano|findstr11434# 如果有进程占用杀掉对应进程taskkill/PID 进程ID/F# 检查 Windows 防火墙是否阻止# 控制面板 → Windows Defender 防火墙 → 允许应用通过防火墙 → 添加 Ollama7.4 Qwen Code 连接失败现象配置后 Qwen Code 无法获取 AI 回复# 1. 确认 Ollama 在运行ollama list# 2. 确认 API 可访问curl http://localhost:11434/api/tags# 3. 检查 settings.json 格式是否正确JSON 语法# 确保没有多余的逗号、引号匹配等# 4. 检查 baseUrl 是否正确# 应该是 http://localhost:11434/v1注意 /v1 后缀7.5 回复速度很慢# 1. 检查是否在用 GPU 推理nvidia-smi# 如果 GPU-Util 很低说明可能在用 CPU# 2. 确认 CUDA 正常nvidia-smi--query-gpuname,driver_version,memory.used--formatcsv# 3. 减少输出长度# 在请求中设置 max_tokens 参数# 4. 关闭其他占用 GPU 的程序游戏、浏览器硬件加速等附录命令速查表快速启动流程# 第一次使用完整安装流程 # 1. 安装 Ollamawinget install Ollama.Ollama# 2. 拉取模型ollama pull qwen2.5-coder:7b ollama pull qwen2.5-coder:3b# 3. 测试运行ollama run qwen2.5-coder:7b你好# 4. 验证 APIcurl http://localhost:11434/api/tags# 5. 配置 Qwen Code编辑 settings.json# 然后重启 Qwen Code日常使用# 开始编程对话ollama run qwen2.5-coder:7b# 快速提问ollama run qwen2.5-coder:7b解释这段代码的作用# 查看 GPU 占用nvidia-smi# 查看运行中的模型ollamaps# 释放显存ollama stop qwen2.5-coder:7b维护管理# 更新 Ollamawinget upgrade Ollama.Ollama# 查看磁盘占用# 模型默认存储在C:\Users\Administrator\.ollama\models# 清理未使用的模型ollamarmmodel-name# 查看模型详情ollama show qwen2.5-coder:7b--modelfile文档版本v1.0适用环境Windows 11 / RTX 4050 6GB / Ollama Qwen2.5-Coder最后更新2026-07-09

相关新闻

STM32 GPIO深度解析:从八种工作模式到标准库实战与避坑指南

STM32 GPIO深度解析:从八种工作模式到标准库实战与避坑指南

1. 从零开始:为什么GPIO是STM32的“第一课”? 如果你刚拿到一块STM32开发板,点亮第一个LED灯,或者读取第一个按键状态,这几乎是你与这片芯片的第一次“对话”。而完成这次对话的“翻译官”,就是GPIO。对于所…

2026/7/31 3:54:48 阅读更多 →
计算机体系结构核心思维:从指令集到并行架构的工程实践

计算机体系结构核心思维:从指令集到并行架构的工程实践

1. 从“黑盒子”到“透明机器”:为什么我们需要体系结构视角又到了期末季,对于计算机专业的同学来说,《计算机体系结构》这门课常常让人又爱又恨。爱的是,它终于开始撕开软件世界那层神秘的面纱,让你看到代码指令是如何…

2026/7/31 3:54:48 阅读更多 →
移动光猫固件备份、刷机与SN/MAC修改实战指南

移动光猫固件备份、刷机与SN/MAC修改实战指南

1. 项目概述:从备份到改写,掌控你的移动光猫手里这台移动宽带送的光猫,用久了总觉得哪里不对劲。可能是信号覆盖不够理想,也可能是后台功能被运营商锁得太死,想改个桥接模式都得四处找“超级密码”。更别提那些定制化的…

2026/7/31 3:54:48 阅读更多 →

最新新闻

Java强制类型转换全解析:从基础规则到实战避坑指南

Java强制类型转换全解析:从基础规则到实战避坑指南

1. 项目概述:为什么我们需要深入理解强制类型转换?如果你写过Java代码,大概率见过类似(int) someDouble这样的写法。这行简单的代码背后,就是Java强制类型转换(Explicit Type Casting)的典型应用。它看起来…

2026/7/31 4:27:59 阅读更多 →
从 IDC 迁移到云原生数据库的 TCO 怎么算?去 IDC 成本分析

从 IDC 迁移到云原生数据库的 TCO 怎么算?去 IDC 成本分析

阿里云 PolarDB(云原生数据库)是企业从 IDC 自建数据库上云的推荐目标:100% 兼容 MySQL 协议让应用几乎零改造迁移,存储计算分离把硬件预留成本转为按量付费,配合 DTS 数据迁移工具实现平滑割接,是降低去 I…

2026/7/31 4:27:59 阅读更多 →
ModbusRTU功能码实战指南:从通信原理到嵌入式实现

ModbusRTU功能码实战指南:从通信原理到嵌入式实现

1. 从一次通信故障说起:为什么必须搞懂ModbusRTU功能码前段时间,我接手了一个工业现场的数据采集项目,设备是一台老旧的温控仪表,通信协议写着ModbusRTU。我信心满满地接上线,用调试助手发了条读取温度的指令&#xff…

2026/7/31 4:27:59 阅读更多 →
C++结构体实战:从学生信息到带教系统的数据结构设计

C++结构体实战:从学生信息到带教系统的数据结构设计

1. 项目概述:从“带教老师与学生”案例看C结构体的实战价值在C的学习和应用中,结构体(struct)是一个绕不开的基础概念。很多教材和教程都会用它来定义一个“学生”信息,包含学号、姓名、成绩。这个例子经典&#xff0c…

2026/7/31 4:27:59 阅读更多 →
C++高精度地理计算:GeographicLib库核心功能与工程实践指南

C++高精度地理计算:GeographicLib库核心功能与工程实践指南

1. 项目概述:为什么我们需要GeographicLib?在C项目中处理地理空间数据,尤其是涉及高精度坐标转换和大地测量计算时,开发者常常会面临一个选择:是自己从零开始实现一套复杂的椭球体模型、大地线解算和坐标转换算法&…

2026/7/31 4:27:59 阅读更多 →
DIY铅酸电池均衡器:TL431+MOS管方案解决电瓶车续航衰减

DIY铅酸电池均衡器:TL431+MOS管方案解决电瓶车续航衰减

1. 项目缘起:从一次“趴窝”说起我的那辆老电瓶车,最近是越来越不中用了。明明充电器显示绿灯已满,刚骑出去没几公里,电量表就“唰”地一下掉到红线,然后直接“趴窝”在路中间,推车推到怀疑人生。相信不少骑…

2026/7/31 4:26:59 阅读更多 →

日新闻

物理复制比逻辑复制好在哪?数据库复制原理详解

物理复制比逻辑复制好在哪?数据库复制原理详解

数据库复制是把主库数据同步到备库的机制,分为逻辑复制和物理复制两种。逻辑复制传输的是 SQL 语句或行变更事件,物理复制传输的是存储引擎底层的物理日志。阿里云 PolarDB(云原生数据库)采用物理复制,在同步延迟、数据…

2026/7/31 0:00:34 阅读更多 →
BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南 【免费下载链接】BilibiliDown (GUI-多平台支持) B站 哔哩哔哩 视频下载器。支持稍后再看、收藏夹、UP主视频批量下载|Bilibili Video Downloader 😳 项目地址: https://gitcode.com/gh_mirrors/bi/Bilib…

2026/7/31 0:00:34 阅读更多 →
有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

当前,游戏行业的“DataAI融合”已从概念验证进入价值落地阶段。根据IDC 2025年数据,中国AI游戏云市场规模已达18.6亿元;同时,游戏研发环节AI渗透率高达86%,生成式AI内容普及率超过50%。面对庞大的市场,游戏…

2026/7/31 0:00:34 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/31 1:03:03 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/31 4:19:39 阅读更多 →

月新闻