Ubuntu 24.04 LTS下Ollama本地大模型部署与优化指南
1. 项目概述Ubuntu 24.04 LTS下Ollama的本地大模型实践在AIGC技术爆发的2026年本地运行大语言模型已成为开发者标配能力。本文将手把手带你在Ubuntu 24.04 LTS上部署Ollama框架并实测Llama3 8B与通义千问Qwen 32B两大主流模型。不同于云端API调用本地部署能实现完全离线环境下的隐私保护自定义模型微调与扩展硬件资源的高效利用实测环境ThinkPad P16移动工作站i9-13980HX/64GB DDR5/RTX 5000 Ada 16GB系统为Ubuntu 24.04 LTS纯净安装版。选择该版本因其提供长达5年的LTS支持且默认搭载Linux 6.8内核对NVIDIA显卡驱动支持更完善。2. 环境准备与Ollama安装2.1 系统基础配置首先更新软件源并安装必备工具链sudo apt update sudo apt upgrade -y sudo apt install -y curl git python3-pip build-essential libssl-dev重要提示若使用NVIDIA显卡务必通过官方驱动安装CUDA 12.3sudo ubuntu-drivers autoinstall nvidia-smi # 验证驱动安装2.2 Ollama的三种安装方案针对国内网络环境提供以下可选方案方案一官方脚本直装适合网络通畅环境curl -fsSL https://ollama.ai/install.sh | sh方案二国内镜像加速推荐mkdir -p ~/.ollama/bin wget https://mirror.example.com/ollama-linux-amd64 -O ~/.ollama/bin/ollama chmod x ~/.ollama/bin/ollama echo export PATH$PATH:~/.ollama/bin ~/.bashrc方案三Docker容器部署docker run -d --gpusall -v ollama:/root/.ollama -p 11434:11434 ollama/ollama安装后验证服务状态systemctl status ollama # 应显示active (running)3. 模型部署实战3.1 Llama3 8B的调优运行使用量化版模型节省显存ollama pull llama3:8b-instruct-q4_0启动交互式对话ollama run llama3:8b-instruct-q4_0关键参数调整创建ModelfileFROM llama3:8b-instruct-q4_0 PARAMETER num_ctx 4096 PARAMETER temperature 0.73.2 Qwen 32B的高效部署针对大显存需求模型推荐使用--gpu-layer参数ollama pull qwen:32b-chat-v1.5 nohup ollama run qwen:32b-chat-v1.5 --gpu-layer 35 qwen.log 实测性能对比模型显存占用生成速度(tokens/s)量化方式Llama3 8B6.8GB42.7q4_0Qwen 32B21.3GB18.5q4_k4. 生产级优化技巧4.1 系统层调优编辑/etc/sysctl.conf添加vm.swappiness 10 vm.overcommit_memory 1配置CUDA MPS服务提升GPU利用率nvidia-smi -i 0 -c EXCLUSIVE_PROCESS nvidia-cuda-mps-control -d4.2 模型微调实战以Qwen为例创建微调数据集# finetune_data.jsonl {text: |im_start|user\n如何优化Python代码性能|im_end|\n|im_start|assistant\n1. 使用内置函数替代循环\n2. 利用numpy向量化操作\n3. 避免不必要的对象创建|im_end|}启动LoRA微调ollama create qwen-ft -f ./Modelfile5. 常见问题排雷指南5.1 下载中断解决方案创建~/.ollama/.curlrc文件speed-limit 1000000 speed-time 305.2 显存不足处理使用--numa参数绑定NUMA节点添加--main-gpu 0指定主显卡采用更低bit的量化版本如q2_k5.3 中文乱码修复在Modelfile中添加SYSTEM export LANGzh_CN.UTF-8 export LC_ALLzh_CN.UTF-8 6. 进阶应用场景6.1 构建REST API服务使用open-webui项目搭建管理界面docker run -d -p 3000:8080 \ -e OLLAMA_BASE_URLhttp://host.docker.internal:11434 \ -v open-webui:/app/backend/data \ ghcr.io/open-webui/open-webui:main6.2 多模型协同工作流编写pipeline脚本from ollama import Client client Client(hosthttp://localhost:11434) def qa_pipeline(question): research client.generate(modelllama3:8b, promptf检索{question}) answer client.generate(modelqwen:32b, promptf基于以下内容回答{research}\n问题{question}) return client.generate(modelllama3:8b, promptf润色{answer})实测发现在RTX 5000 Ada显卡上Qwen 32B的kvcache可压缩至原大小的30%而不显著影响输出质量。具体方法是在启动参数中添加--kvcache-compress 0.3这使32B模型能在16GB显存下稳定运行。

相关新闻

GitHub Enterprise集成教程:micro-github高级配置实战指南

GitHub Enterprise集成教程:micro-github高级配置实战指南

GitHub Enterprise集成教程:micro-github高级配置实战指南 【免费下载链接】micro-github A tiny microservice that makes adding authentication with GitHub to your application easy. 项目地址: https://gitcode.com/gh_mirrors/mi/micro-github GitHub…

2026/10/7 21:27:15 阅读更多 →
C++与OpenCV实战:图像轮廓提取完整流程与优化指南

C++与OpenCV实战:图像轮廓提取完整流程与优化指南

1. 项目概述:为什么轮廓提取是计算机视觉的基石在计算机视觉和图像处理领域,轮廓提取是一个绕不开的核心话题。无论是工业质检中识别零件的尺寸和缺陷,还是自动驾驶中感知车道线和障碍物,甚至是手机App里那个有趣的“一键抠图”功…

2026/10/8 8:47:20 阅读更多 →
Rust Vec内存优化:with_capacity预分配与shrink_to_fit收缩实战

Rust Vec内存优化:with_capacity预分配与shrink_to_fit收缩实战

1. 项目概述:为什么Rust Vec的内存管理值得深究? 如果你写过一段时间的Rust,尤其是处理过稍微有点规模的数据集合,大概率已经对 Vec 这个动态数组容器熟得不能再熟了。它几乎是Rust标准库中使用频率最高的数据结构,没…

2026/10/5 22:38:31 阅读更多 →

最新新闻

用SRE思维学Linux:不背命令,掌握系统故障排查核心

用SRE思维学Linux:不背命令,掌握系统故障排查核心

说实话,我见过太多人学Linux,第一件事就是找一份“Linux常用命令大全”,背了100个命令,然后发现自己连一台出问题的机器都救不回来。2026年了,如果还在用背单词的方式学Linux,那基本是在做无用功。不是命令…

2026/10/9 7:57:26 阅读更多 →
“审计“在方案里指什么

“审计“在方案里指什么

一、"审计"在方案里指什么 在工控和上位机语境下,"审计"不是财务意义上的查账,而是审计跟踪(Audit Trail):它是系统活动的流水记录,按事件从始至终的途径,顺序检查、审查和…

2026/10/9 7:57:26 阅读更多 →
国内用 Claude Code 终于不用折腾了:一行命令自动接 DeepSeek,TaoToken 统一 Key 实测

国内用 Claude Code 终于不用折腾了:一行命令自动接 DeepSeek,TaoToken 统一 Key 实测

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 7:57:25 阅读更多 →
EMC/China展会前瞻:微波天线与电磁兼容测试的底层逻辑

EMC/China展会前瞻:微波天线与电磁兼容测试的底层逻辑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 7:57:25 阅读更多 →
Linux DPM设备电源管理框架:从suspend异常到功耗优化实战

Linux DPM设备电源管理框架:从suspend异常到功耗优化实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 7:57:25 阅读更多 →
diskinfo监控RAID健康状态保障TensorFlow数据安全

diskinfo监控RAID健康状态保障TensorFlow数据安全

1. 项目背景与核心问题拆解1.1 这个标题到底在说什么先把标题拆开看:diskinfo、RAID阵列健康状态、TensorFlow数据安全。三个词串起来,其实描述的是一个非常具体、也非常容易被忽视的运维场景——跑深度学习训练任务的服务器,底层磁盘阵列的健…

2026/10/9 7:56:25 阅读更多 →

日新闻

Java时间API实战:LocalDate、Date与ZonedDateTime的转换与避坑指南

Java时间API实战:LocalDate、Date与ZonedDateTime的转换与避坑指南

Java时间API这个话题,隔三差五就会在群里被翻出来讨论一次。上周还有个同事线上处理一个订单超时问题,排查到最后发现是ZonedDateTime序列化后时区丢了,用户在下单当天晚上看到的时间整整差了8个小时。这类问题几乎每个做Java开发的人都遇到过…

2026/10/9 0:00:49 阅读更多 →
EasyTier实践:从NAT穿透到子网代理的异地组网部署与排错

EasyTier实践:从NAT穿透到子网代理的异地组网部署与排错

前几个月我手头有好几台机器需要互相访问:办公室台式机、家里 NAS、还有一台云主机。如果只是偶尔传个文件倒还好,问题是工作场景经常要在几处环境之间来回切换,每次都先登录跳板机再层层代理,实在折腾。我先后试过端口映射、自建…

2026/10/9 0:00:49 阅读更多 →
AI Agent工程实战:从七要素到七个决策点的系统设计指南

AI Agent工程实战:从七要素到七个决策点的系统设计指南

AI Agent 这个词在过去一年里被反复提及,但真正动手搭过一套能跑起来的 Agent 系统的人都知道,从"知道它是什么"到"让它稳定干活"之间隔着一整套工程决策。我前后参与过几个 Agent 项目的落地,从最初用现成框架拼装&…

2026/10/9 0:01:50 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:32 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:40 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 10:10:36 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 21:13:17 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:17 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 6:17:20 阅读更多 →