大模型黑话解释
大模型黑话解释听人说「上个 Q4」「别全参上 LoRA」「KV 打满了」时用。量化单独讲透其余按场景对照。1. 量化Quantization一句话用更少的比特去存模型权重换显存和速度略微牺牲精度。模型里每个参数本来是高精度小数。训练和「原版推理」常用 16 位浮点FP16 / BF16每个数 2 字节。70 亿参数7B光权重就大约7e9 × 2 字节 ≈ 14 GB消费级显卡往往只有 8GB、12GB。量化做的事就是把这些数压成 8 位、4 位甚至更低你听到的大约位宽7B 体积量级直观感觉FP16 / BF1616 bit14 GB原汁原味训练常用Q8_08 bit7–8 GB几乎无损Q5_K_M~5 bit5–6 GB质量和体积都要Q4_K_M~4 bit4–5 GB本地默认Ollama 最常见Q3 / IQ23 bit 及以下3 GB 以下能跑就行质量掉得快像照片从无损压成 JPEG日常看不出来把细节放大才有噪点。所以「Q4 就能跑」不是偷工减料是为了把模型塞进你的机器。1.1 文件名怎么读Ollama / llama.cpp 用的权重格式叫GGUF。名字里的档位例如Q4_K_M约 4bitK 表示按块混合量化比早期Q4_0细M 是 medium比 S 肥、比 XL 瘦Q8_08bit质量接近原版Q5_K_M介于 Q4 和 Q8 之间经验日常 Q4_K_M要质量升 Q5 / Q8显存不够再降 Q3。别一上来用 IQ2。1.2 量化不是这些东西黑话它在干什么和量化的差别蒸馏 Distillation另训一个小模型去模仿大模型换了一套权重不是把原权重存糙LoRA冻住原模型另贴一小层来微调是训练方法不是压缩格式QLoRA先把原模型量化再做 LoRA量化是为了训得动不是为了上线体积GPTQ / AWQGPU 上的量化方案和 GGUF 不是一条产线vLLM 常用 AWQOllama 常用 GGUF1.3 显存炸了不一定是没量化权重量化主要缩小模型文件。对话一长真正往上爬的是KV Cache注意力的缓存跟上下文长度、并发、层数有关。长文档 OOM优先怀疑 KV而不是「Q4 还不够狠」。2. 现场翻译原话人话上 Q4_K_M 的 14Bctx 32k140 亿参数、约 4bit 量化上下文开到约 3.2 万 token。812GB 显存常见能跑别全参LoRA 贴一下不要改全部权重。冻住原模型只训一小块适配器先 RAG别先微调知识会变、要可追溯就检索后回答。微调改的是习惯和技能不是权重大是 KV 打满了模型文件没超是长上下文的缓存把显存吃完了温度调低开 JSON mode少随机强制按结构吐适合抽取和接口这是 MoE激活 13B总参数更大但每次只跑一部分专家。硬盘按总量算力更接近激活量3. 模型长什么样参数量7B / 14B / 70BB Billion 十亿个可学习数字。参数多通常更强也更吃显存。比较模型时先看参数量再看量化档、上下文、是不是 MoE。稠密 vs MoE稠密每次推理走完全部权重。MoEMixture of Experts一排专家路由只叫醒其中几个。所以会听到「总参数 47B、激活 13B」——硬盘按总量算力更接近激活量。显存仍可能按总参数估别只看激活量下单。Transformer现在聊天模型几乎都是 Decoder-only Transformer从左到右一个 token 一个 token 生成。多模态 / VLM能看图、听声。能看不等于 OCR 专精发票表格、印章、小字仍可能翻车。4. 推理与部署Token模型读写的最小碎片不是「一个汉字」或「一个英文单词」。英文大约 1 token ≈ 0.75 词中文常 1 字 ≈ 12 token。计费、窗口、速度都按 token 算。上下文窗口ctx / num_ctx / 32K / 128K模型一次能「看见」的 token 上限含输入 输出。窗口越大KV Cache 越吃显存。标称 128K 不等于默认就按 128K 跑。推理 Inference用训好的模型生成答案。聊天、补全、工具调用都是推理不是训练。Prefill / Decode先一次性读完提示prefill吃算力再逐字往外吐decode吃显存带宽。长文档卡住常常慢在读入。首字延迟 TTFT / 吞吐 TPS多久开始说话以及每秒能吐多少字。产品体感差先看 TTFT。运行时 ≠ 模型Ollama / llama.cpp 是本地引擎GGUF。vLLM 是 GPU 高并发引擎。Qwen / Llama 才是模型。前者是跑步机后者是运动员。5. 训练与微调预训练 Pretrain在海量文本上学会语言得到base。base 很会续写不一定会听话聊天。SFT监督微调用「问题–答案」对把基座教成助手。数据质量比数量更重要。RLHF / DPO用「哪个更好」而不是标准答案把口味调正。DPO 工程上更常见GRPO 多出现在推理模型讨论里。LoRA不改原权重另贴一小层低秩矩阵。产出是很小的 adapter可插拔。细节见《LoRA 微调原理与实战》。全参微调所有权重都训练。数据少容易过拟合还可能灾难性遗忘新的会了旧的忘了。多数业务优先 LoRA。蒸馏让小模型模仿大模型的输出把能力压缩进去。不是量化。6. 提示与生成Prompt / System prompt你喂给模型的输入。System 放身份和硬规则User 放本次任务。思维链 CoT先分步想再给结论。普通模型靠提示诱发推理模型会自己长考。多花 token。温度 Temperature / Top-p控制「有多敢花样」。00.3 求稳抽取、JSON0.71.0 求活写作。先动温度别两个一起乱拧。幻觉 Hallucination流畅、自信但事实是假的。模型在补「最像真的」的下一句不是在查资料。对策RAG、要求引用、低温、允许说不知道、工具查真源。7. 检索增强RAGRAG先查资料再生成把私有知识临时塞进上下文。适合会变的知识库。微调改行为RAG 更新知识。Embedding把文本变成向量相近意思在空间里靠近。对话模型负责写embedding 模型负责找。两者不是同一个模型。切块 Chunking长文切成检索单元。太大检索糙太小语义断。重叠是为了避免关键句落在切口上。切块策略往往比换模型更影响效果。混合检索关键词BM25抓订单号、SKU向量抓同义改写。Rerank向量先粗召回一堆再用更准的模型把真正相关的顶上来。常见召回 20精排留 5再塞给 LLM。8. Agent 与工具Agent不只回答还会规划、调工具、看结果再继续。可靠性取决于工具边界和停止条件不取决于把提示词写得更像人。工具调用 Function calling模型输出「调哪个函数、参数是什么」由你的程序真去执行。模型不直接碰数据库。MCP给 Agent 接工具、接数据源的一种标准协议。ReActThought → Action → Observation 循环。没观察就行动容易幻觉调用没停止条件会死循环。9. 评测与对齐对齐 Alignment让模型听人话、少作恶而不只是会续写。base没对齐chat/instruct对齐过。Guardrail 是外挂过滤。跑分 / 榜MMLU 偏知识HumanEval 偏代码GSM8K 偏数学Arena 偏人气。刷榜和你的业务场景不是一回事。以自己的评测集为准。10. 容易搅在一起的几对甲乙别混的原因量化蒸馏量化压同一套权重蒸馏是另训一个小模型微调RAG微调改模型行为RAG 临时塞资料Token字 / 词计费和窗口按 token不是按汉字个数参数量上下文长度7B 是脑子大小32K 是一次能看多长Embedding 模型对话模型一个负责找相似段落一个负责写回答OllamaQwen / Llama前者是跑步机后者才是运动员AgentChatbotAgent 会调工具、多步循环聊天机器人通常一问一答FP16Q4都是精度档。FP16 接近原版Q4 是本地默认压缩档和本仓库其它文的关系LoRA 原理与实战《LoRA 微调原理与实战》本地选型和显存表《Ollama 开源大模型推荐》检索链路RAG / GraphRAG 相关文本文只负责把黑话翻译成人话。

相关新闻

从汉诺塔问题彻底搞懂递归算法:可视化推导与Python实战

从汉诺塔问题彻底搞懂递归算法:可视化推导与Python实战

最近在整理算法笔记时,发现很多同学对递归的理解停留在“自己调用自己”的层面,一到具体问题就无从下手。尤其是经典的汉诺塔问题,虽然代码只有几行,但背后的递归逻辑和状态转移过程却让不少人感到困惑。本文将以汉诺塔为切入点&a…

2026/8/25 3:02:36 阅读更多 →
从流量增长到价值变现:互联网商业模式转型与市值重构分析

从流量增长到价值变现:互联网商业模式转型与市值重构分析

三十亿日活,市值不变。这八个字,像一句来自未来的判词,精准地戳中了当下互联网行业最隐秘的痛点。我们早已习惯了“用户增长驱动估值”的叙事逻辑,仿佛DAU(日活跃用户数)的每一次跳动,都必然牵引…

2026/8/26 4:56:41 阅读更多 →
最疯狂的平台:用太极八卦搓宇宙代码(7.5 暗能井底座)

最疯狂的平台:用太极八卦搓宇宙代码(7.5 暗能井底座)

残差引擎与时间账:暗能量的“在途”本质 ——暗能井篇 V1.0:用新数学框架解答教授的疑问 【距离大会:8天】 一、需求提出 老李的手机又响了,还是那位教授。“老李,我看了你写的《暗能井篇》,有个问题&#…

2026/8/25 3:01:36 阅读更多 →

最新新闻

Qt QTableView样式定制全解析:从QSS到委托的深度实践

Qt QTableView样式定制全解析:从QSS到委托的深度实践

1. 从“能用”到“好看”:为什么QTableView的样式值得深究在Qt开发中,QTableView几乎是处理表格数据的首选控件。很多开发者,包括我自己在早期,都满足于一个“能用”的表格:数据能显示,行能选中&#xff0c…

2026/8/26 4:57:30 阅读更多 →
金仓数据库Ksql命令行工具:从基础连接到自动化运维实战指南

金仓数据库Ksql命令行工具:从基础连接到自动化运维实战指南

1. 从命令行到数据库:理解 Ksql 的核心定位如果你接触过金仓数据库 KingbaseES,那么ksql这个工具大概率是你绕不开的第一个“伙伴”。它不是图形界面里那些花花绿绿的按钮,而是一个朴实无华却功能强大的命令行客户端。简单来说,ks…

2026/8/26 4:57:30 阅读更多 →
Qwen3.7 Max开源大模型:本地部署、性能评测与应用实战指南

Qwen3.7 Max开源大模型:本地部署、性能评测与应用实战指南

1. 项目概述:Qwen3.7 Max的发布与开源生态新格局最近,AI圈子里最让人兴奋的消息,莫过于通义千问团队正式开源了Qwen3.7 Max模型。这不仅仅是一个新版本的发布,更像是在当前大模型开源赛道上投下了一颗重磅炸弹。作为一名长期关注和…

2026/8/26 4:57:30 阅读更多 →
利用LibreOffice命令行实现Word转PDF的自动化与批量处理

利用LibreOffice命令行实现Word转PDF的自动化与批量处理

1. 项目概述:从Word到PDF,一个看似简单却暗藏玄机的需求在日常办公和文档处理中,将Word文档转换为PDF格式,几乎是一个人人都会遇到的基础操作。无论是为了格式固定、便于分发,还是提交正式报告,PDF都是那个…

2026/8/26 4:57:30 阅读更多 →
电容式传感与电感式传感:原理、选型与实用对比

电容式传感与电感式传感:原理、选型与实用对比

做硬件这几年,我经手过不少传感器选型项目,每次遇到“检测某个东西有没有、离多远、是不是金属”这类需求时,最终都会绕回两个老对手身上:Capacitive Sensing 和 Inductive Sensing。电容式传感和电感式传感听起来都是“非接触检测…

2026/8/26 4:57:30 阅读更多 →
Milvus实战指南:从RAG向量检索到生产部署与面试要点

Milvus实战指南:从RAG向量检索到生产部署与面试要点

当你在做 RAG 应用时,最头疼的问题往往不是“大模型回答得准不准”,而是“知识库里的文档越来越多,到底应该用什么来查”。传统的关键词检索在精确匹配上表现尚可,但遇到同义词、语义接近、口语化表达就束手无策。而把文档全部交给…

2026/8/26 4:56:30 阅读更多 →

日新闻

Python random 模块常用函数详解:从入门到实战

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 0:00:40 阅读更多 →
《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》索引目录: 《Microsoft Sql server 2008 Internals》读书笔记--目录索引 在上篇文章中,主要介绍了创建数据库的基本语法和FileGroup的初步知识。需要注意的是: 关于FileGroup 如果你的系统是用Raid设备直接存…

2026/8/26 1:18:18 阅读更多 →
政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体已经从概念试点阶段,转入了政务服务的常态化落地应用;在实际使用过程中,它能自主理解办事需求、辅助完成填报申报、开展材料预审,并联动多个系统协同作业,真正嵌入到政务办理的全流程当中。但在落地推进过…

2026/8/26 1:18:18 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/25 3:38:12 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/25 3:38:18 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/25 3:38:23 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/26 3:50:20 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/25 10:31:12 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/26 1:24:05 阅读更多 →