Ollama本地部署大模型:Windows与Linux安装避坑指南
1. 为什么本地跑大模型这件事Ollama 值得你花十分钟试一次很多人第一次听到“本地部署大模型”脑子里浮现的画面是一堆显卡、复杂的 Python 环境、CUDA 版本对不上、跑起来显存爆了。这个印象不算错但那是两三年前的事了。现在如果你只是想在自己电脑上跑一个能对话、能写代码、能总结文档的模型Ollama 基本把门槛压到了“会装软件就能用”的程度。Ollama 是一个开源的大模型本地运行工具核心价值就三件事下载模型、运行模型、通过命令行或 API 调用模型。它把模型权重、推理引擎、运行环境打包成一个可执行程序你不需要单独装 Python、不需要配 CUDA、不需要手动下载 GGUF 文件再折腾加载参数。装完之后一条ollama run命令就能开始对话这对小白来说是非常友好的体验。这篇文章适合谁看三类人第一类是完全没接触过本地大模型、想先跑起来看看效果的新手第二类是在 Windows 或 Linux 上装过但卡在下载慢、命令报错、服务起不来这些环节的人第三类是想把 Ollama 当成一个本地 API 服务接进自己项目里的开发者。我会把 Windows 和 Linux 两条线的安装流程都讲清楚重点放在实际会踩的坑上而不是照抄官网那几句命令。先说一个结论Ollama 的安装本身不难难的是网络环境导致的模型下载慢和不同系统下的服务启动方式差异。这两点后面会重点展开。2. 装之前先搞清楚 Ollama 到底装了什么2.1 它不是一个“模型”而是一个模型运行器这是新手最容易混淆的地方。Ollama 本身不包含任何大模型它只是一个运行框架。你装完 Ollama 之后硬盘上多出来的是推理引擎和命令行工具模型需要你另外用ollama pull去下载。所以“Ollama 安装包很大”这个说法是不准确的安装包通常几百 MB真正占空间的是你后面下载的模型一个 7B 参数的模型量化后大概 4GB 左右13B 的会到 8GB 上下。理解这一点很重要因为它决定了你的磁盘规划。如果你 C 盘空间紧张最好在安装前就把模型存储路径改到其他盘否则默认会放在系统盘的用户目录下几个模型下来几十 GB 就没了。2.2 默认端口和服务模式Ollama 安装后会在本地启动一个服务默认监听11434端口。这个服务是你所有操作的入口命令行ollama run是客户端它把请求发给本地这个服务你用 API 调用时也是请求这个端口。在 Linux 上它通常注册为 systemd 服务开机自启在 Windows 上它是一个后台进程安装完会自动运行。提示如果你之后发现ollama命令能执行但模型跑不起来第一件事就是检查 11434 端口对应的服务是否在运行而不是急着重装。2.3 硬件门槛到底在哪网上很多说法把门槛说得很玄。实际经验是内存比显卡更关键。一个 7B 的量化模型纯 CPU 加 16GB 内存就能跑只是速度慢一些大概每秒几个 token如果有 8GB 显存的独立显卡速度会明显提升。13B 模型建议 16GB 内存起步32GB 会更从容。所以如果你是一台普通的办公本16GB 内存跑 7B 模型是完全可行的不要被“必须上显卡”吓退。真正会卡住你的是磁盘空间和下载速度这两个才是新手翻车的高频点。3. Windows 上的安装别急着双击先做两件事3.1 安装前的两个准备动作Windows 安装 Ollama 最省事的方式是去官网下载OllamaSetup.exe双击一路下一步。但在双击之前我建议你先做两件事。第一件确认系统版本。Ollama 对 Windows 的要求是 Windows 10 及以上而且需要比较新的版本。如果你还在用很老的 Win10 早期版本可能会遇到安装程序直接报错或者装完服务起不来。在“设置 - 系统 - 关于”里看一眼版本号1809 以下的建议先更新系统。第二件规划模型存储路径。默认模型会下载到C:\Users\你的用户名\.ollama\models。如果你的 C 盘只剩几十 GB强烈建议先改路径。方法是设置一个系统环境变量OLLAMA_MODELS指向你想要的目录比如D:\ollama\models。这个变量要在安装前或者安装后重启服务前设置好否则已经下载的模型不会自动迁移。设置环境变量的步骤右键“此电脑” - 属性 - 高级系统设置 - 环境变量 - 在“用户变量”里新建变量名OLLAMA_MODELS变量值填你的目标路径。设完之后记得重启 Ollama 服务或者重启电脑让它生效。3.2 安装过程与验证双击安装包之后基本没有需要你选择的选项装完会在开始菜单出现 Ollama 的图标同时后台服务自动启动。验证是否装好打开 PowerShell 或者 CMD输入ollama --version能打印出版本号就说明命令行工具就位了。再输入ollama list如果返回一个空列表没有任何模型说明服务也正常在跑只是你还没下载模型。这一步很多人会看到报错“could not connect to ollama app”这通常意味着后台服务没起来可以手动去开始菜单点一下 Ollama 图标或者在任务管理器里看看有没有 ollama 相关进程。3.3 Windows 上最常见的三个坑第一个坑是安装完命令行找不到 ollama 命令。这通常是 PATH 没刷新关掉当前终端重新开一个就好如果还不行检查安装目录有没有被加进系统 PATH。第二个坑是防火墙拦截。有些安全软件会把 Ollama 的后台服务当成可疑进程拦截表现是服务反复启动失败。遇到这种情况把 Ollama 加入白名单即可。第三个坑是中文路径。虽然新版已经改善很多但如果你的用户名是中文偶尔还是会出现模型路径解析异常。稳妥做法就是把OLLAMA_MODELS指到一个纯英文路径下比如D:\ollama\models能避开很多莫名其妙的问题。4. Linux 上的安装一行命令背后的细节4.1 官方脚本安装的实际过程Linux 上最常用的安装方式就是官方提供的一行脚本curl -fsSL https://ollama.com/install.sh | sh这条命令做的事情是下载安装脚本、检测你的系统架构、下载对应版本的二进制、创建 ollama 用户、注册 systemd 服务、启动服务。看起来一步到位但实际执行时经常卡在下载环节因为二进制包是从境外服务器拉的速度可能很慢甚至超时。如果你执行这条命令后长时间没反应或者报 curl 相关的超时错误不要以为是命令写错了大概率就是网络问题。可以多试几次或者换个时间段再试。4.2 手动安装当脚本不灵时的备选方案脚本安装失败时手动安装是更可控的方式。思路是自己下载二进制压缩包解压到/usr/local/bin然后手动创建 systemd 服务文件。下载地址在 Ollama 的发布页选择对应架构的包比如ollama-linux-amd64.tgz。下载下来之后tar -xzf ollama-linux-amd64.tgz -C /usr/local解压后二进制会在/usr/local/bin/ollama。然后创建服务文件/etc/systemd/system/ollama.service内容大致如下[Unit] DescriptionOllama Service Afternetwork-online.target [Service] ExecStart/usr/local/bin/ollama serve Userollama Groupollama Restartalways RestartSec3 [Install] WantedBymulti-user.target注意这里用了一个ollama用户你需要先创建它useradd -r -s /bin/false -m -d /usr/share/ollama ollama然后重新加载 systemd 并启动systemctl daemon-reload systemctl enable ollama systemctl start ollama这套流程比脚本麻烦但好处是每一步你都知道在干什么出问题也好定位。4.3 验证服务与查看日志Linux 上验证安装是否成功除了ollama --version更重要的是看服务状态systemctl status ollama如果显示 active (running) 就正常。如果失败用journalctl -u ollama -f看实时日志报错信息通常很明确比如端口被占用、权限不足、二进制路径不对等。注意如果你之前手动跑过ollama serve可能会和 systemd 服务抢 11434 端口导致服务起不来。先pkill ollama清理掉手动进程再启动服务。5. 模型下载慢这件事有几种务实的解法5.1 先理解为什么慢模型文件动辄几个 GB从境外源拉取速度受限于国际带宽慢是常态。这不是 Ollama 的问题任何从境外拉大文件的工具都会遇到。所以与其反复重试不如换个思路解决。5.2 可用的加速思路第一种思路是使用国内镜像源。社区里有一些同步了 Ollama 模型库的镜像站点把OLLAMA_HOST或者拉取地址指向镜像速度会快很多。具体镜像地址会变动建议在相关社区搜索最新的可用地址这里不写死是因为镜像的可用性经常变化。第二种思路是手动下载模型文件再导入。Ollama 的模型本质是 GGUF 格式加一个 Modelfile。你可以从其他渠道下载到 GGUF 文件然后自己写一个 Modelfile 指向它用ollama create导入。这种方式适合网络实在拉不动、但能通过其他方式拿到模型文件的场景。第三种思路是错峰下载。深夜时段国际带宽通常更宽松如果你不急着用挂在那里慢慢下也是一种办法。ollama pull支持断点续传中断了重新执行会接着下不会从头开始。5.3 下载过程中的常见报错报错信息可能原因处理方式connection reset by peer网络中断重新执行 pull支持续传no space left on device磁盘满清理空间或改 OLLAMA_MODELS 路径manifest not found模型名写错用 ollama list 确认可用模型名timeout拉取超时换时间段或换镜像源这张表里的前两个是我自己遇到最多的。特别是磁盘满因为模型下载是静默的很多人下到一半才发现 C 盘红了。6. 跑起来之后几个立刻能用上的操作6.1 第一次对话下载完模型后直接ollama run qwen2.5:7b模型名以你实际下载的为准回车后会进入交互式对话界面直接输入问题即可。第一次加载模型会花几秒到几十秒取决于你的硬件之后就有上下文缓存了响应会快一些。退出用/bye。6.2 当成 API 服务用Ollama 默认就暴露了 HTTP API你可以直接用 curl 调用curl http://localhost:11434/api/generate -d { model: qwen2.5:7b, prompt: 用一句话解释什么是递归 }返回的是 JSON 流式数据。如果你要接进自己的程序用/api/chat接口更合适它支持多轮对话格式。这一点对开发者来说很实用相当于你本地有了一个免费的、不依赖外部服务的模型接口。6.3 常用管理命令ollama list查看已下载的模型ollama ps查看正在运行的模型ollama rm 模型名删除模型释放空间ollama show 模型名查看模型参数信息这几个命令日常用得最多尤其是ollama rm模型下多了之后磁盘管理全靠它。7. 我踩过的几个坑你可以直接绕开第一个坑是在 Windows 上改了 OLLAMA_MODELS 但没生效。原因是环境变量设完之后没有重启 Ollama 服务它还是用的旧路径。正确做法是设完变量后在任务管理器里结束 ollama 进程再重新启动或者干脆重启电脑。第二个坑是Linux 上 curl 安装脚本执行到一半断了。这种情况不要直接重跑先看看/usr/local/bin下有没有残留的 ollama 二进制有的话删掉再重来否则可能出现新旧版本混用导致服务异常。第三个坑是以为模型越大越好。新手容易一上来就拉 70B 的模型结果机器跑不动体验极差。务实的选择是从 7B 开始跑顺了再根据硬件往上试。模型效果和参数量的关系不是线性的7B 的量化模型在日常问答、写代码辅助这些场景已经够用。第四个坑是忽略内存占用。模型加载后会常驻内存如果你同时开着浏览器一堆标签页、IDE、虚拟机内存很容易吃紧表现就是系统卡顿甚至模型被系统杀掉。跑模型的时候尽量关掉不必要的大内存程序。8. 关于版本选择和后续维护的一点经验Ollama 更新比较频繁新版本会支持更多模型架构、优化推理速度。但我不建议无脑追新尤其是你已经在生产环境或者日常依赖它的时候。稳妥做法是看到新版本先看更新日志确认有你需要的新特性或者修复了你遇到的问题再升级。升级方式在 Windows 上就是重新下载安装包覆盖安装Linux 上重跑安装脚本或者替换二进制。另外模型文件是可以跨版本复用的升级 Ollama 不会导致已下载的模型失效这一点可以放心。真正需要留意的是 Modelfile 的语法偶尔会有调整如果你自己写过自定义模型升级后最好验证一下还能不能正常加载。最后说一个实际体会Ollama 最大的价值不是让你跑一个多大的模型而是把“本地模型”这件事变得足够简单简单到你愿意去试。很多人卡在第一步就是因为觉得麻烦而它恰好把麻烦的部分都封装掉了。装完之后你会发现本地有一个随时能问、不联网、不花钱的模型在很多场景下比想象中实用。

相关新闻

计算机测配色全解:从分光光度计到染料配方算法

计算机测配色全解:从分光光度计到染料配方算法

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/20 20:12:50 阅读更多 →
JWT认证核心原理与安全实践:从结构拆解到面试考点全解析

JWT认证核心原理与安全实践:从结构拆解到面试考点全解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/20 20:12:50 阅读更多 →
Windows自带硬盘管理完全指南:分区、diskpart与虚拟磁盘实操

Windows自带硬盘管理完全指南:分区、diskpart与虚拟磁盘实操

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/20 20:12:50 阅读更多 →

最新新闻

如何制作微信推送源码解析:3步搞定跑不通的代码

如何制作微信推送源码解析:3步搞定跑不通的代码

如何制作微信推送源码解析:3步搞定跑不通的代码 复制来的代码跑不通,是不是让你抓狂?报错信息像天书,调试半天没头绪。别急,今天咱们直接扒开【如何制作微信推送】的底层逻辑,用源码解析帮你理清思路。 一句话原理:回调机制与签名校验…

2026/9/21 23:48:35 阅读更多 →
3个资瓷面试必问坑,最佳实践助你通关

3个资瓷面试必问坑,最佳实践助你通关

3个资瓷面试必问坑,最佳实践助你通关 你是不是也遇到过这种情况?语法背得滚瓜烂熟,LeetCode 刷了一堆题,结果面试时面试官问:“你在实际项目中是怎么处理数据资瓷的?”你脑子一片空白。这就是典型的“学会语法却不知怎么搭项目”。很多开发者…

2026/9/21 23:48:35 阅读更多 →
3个DDNS实战项目踩坑记录:面试必问动态解析原理与代码调优

3个DDNS实战项目踩坑记录:面试必问动态解析原理与代码调优

3个DDNS实战项目踩坑记录:面试必问动态解析原理与代码调优 复制来的代码跑不通,报错信息像天书,根本不知道从哪下手调?这种绝望感在搞DDNS(动态域名解析)的实战项目里太常见了。很多开发者把开源仓库里的Demo直接搬到生产环境,结果域名死…

2026/9/21 23:48:35 阅读更多 →
长沙有哪些旅游景点:一文搞懂底层逻辑与避坑全解

长沙有哪些旅游景点:一文搞懂底层逻辑与避坑全解

长沙有哪些旅游景点:一文搞懂底层逻辑与避坑全解 看了一堆旅游攻略还是踩坑?别急,这跟咱们写代码没跑通一个道理。今天用程序员思维, 一文搞懂 【长沙有哪些旅游景点】背后的规划原理。 一句话原理:旅游即路由匹配 旅游本质是 资源-需求…

2026/9/21 23:47:34 阅读更多 →
2026最新虚拟机多少钱实测:3步搞定性能瓶颈与成本优化

2026最新虚拟机多少钱实测:3步搞定性能瓶颈与成本优化

2026最新虚拟机多少钱实测:3步搞定性能瓶颈与成本优化 很多开发者盯着语法书啃完,代码能跑,但一上手真实项目就卡壳。不知道环境怎么搭,不知道资源怎么配,更不知道 虚拟机多少钱…

2026/9/21 23:47:34 阅读更多 →
3招搞定win7关闭系统更新,面试高频考点避坑指南

3招搞定win7关闭系统更新,面试高频考点避坑指南

3招搞定win7关闭系统更新,面试高频考点避坑指南 版本升级后 API 全变了,很多老项目直接崩盘,这正是 高频面试题 里最扎心的痛点。别急着骂系统,Win7 停服后强制更新是运维噩梦。今天直接上代码,用 Python…

2026/9/21 23:47:34 阅读更多 →

日新闻

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程 【免费下载链接】agentic-awesome-skills AAS Core is the local, agent-first control plane for complete catalog discovery, agent-owned selection, stack validation, and …

2026/9/21 0:00:01 阅读更多 →
gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析

gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析

gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析 【免费下载链接】gin-vue-admin 🚀ViteVue3Gin拥有AI辅助的基础开发平台,企业级业务AI开发解决方案,内置mcp辅助服务,内置skills管理,…

2026/9/21 0:00:01 阅读更多 →
Wox 全功能插件开发实战指南:基于 Python / Node.js 宿主与 WebSocket 的持久化插件体系

Wox 全功能插件开发实战指南:基于 Python / Node.js 宿主与 WebSocket 的持久化插件体系

桌面应用AI 应用插件系统 【免费下载链接】Wox A cross-platform launcher that simply works 项目地址: https://gitcode.com/gh_mirrors/wo/Wox 点击查看 免费下载 全功能插件(Full-featured Plugin)是 Wox 三类插件实现方式中能力最完整的…

2026/9/21 0:00:01 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/21 3:13:20 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/21 2:19:36 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/21 4:51:05 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/21 15:36:51 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/21 15:36:51 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →