Kimi K3 都一百万 token 了,我说 RAG 可以拆了直接塞全文,面试官翻开推理账单:“塞一次多少钱?大海捞针还捞得着吗?”
面试日记 第 22 天面试官把手机推过来屏幕上是 Kimi K3 的发布稿。“一百万 token 上下文。”她看着我“你们那套 RAG是不是该进垃圾桶了”我说不急先把基础分拿了把 RAG 的两大阶段完整讲了一遍离线索引做知识入库清洗、切块、转向量、进 Milvus在线问答处理请求问题向量化、相似度检索、Rerank、拼进 Prompt 让模型生成。她点点头没追问流程把问题推了回来“流程你背得挺熟。那回答我刚才的问题——既然模型自己装得下一百万 token你们为什么还要维护向量库这一套”“其实我们已经不维护了。”我说“上个月就把 RAG 拆了文档直接塞全文。链路短不用调 top_k又快又省事。”她打开自己的笔记本转过来屏幕上是一份推理成本监控。“塞一次全文多少钱”我没答上来。“我替你算。”她指着账单“你们的知识库八十万 token按现在旗舰模型的输入价塞一次全文两块多。一天几千次问答每一轮都把八十万 token 重新塞一遍。省的是你的事费的是公司的钱。”她往下划了一屏是一条召回率曲线。“再看效果。大海捞针测试做过吗上下文塞到几十万 token模型对中间段落的命中率明显往下掉。文档虽然进了上下文关键时刻就是捞不出来。”我辩解“K3 不是号称长上下文很强吗”“强所以人家才把缓存命中做到九成以上。”她把发布稿里那行字圈出来“你猜为什么因为真在用长上下文的团队都在想办法复用已经塞过的内容、少做重复灌入——跟你说的每轮全量重塞恰恰是反的。”我握着笔半天只写出一句“那我把向量库装回来。”“先把题答完整。”她把电脑合上RAG 的完整流程是怎么样的这一次我答的不只是流程名还有每一步省的是什么钱、防的是什么坑。回答重点RAG 的核心就是“先搜后答”整个流程分成离线索引和在线问答两大阶段。离线索引阶段做的是知识入库1把原始文档清洗干净、切成 300-500 字的小块 2用嵌入模型把每个文本块转成向量 3向量存进 Milvus 这类向量数据库建好索引等着被搜在线问答阶段处理用户请求1用户提问进来先把问题也转成向量 2拿这个向量去数据库里做相似度检索捞出最相关的 5-10 个文档块 3对检索结果做重排序把最相关的排前面 4把用户问题和检索到的上下文一起塞给大模型让它基于这些材料生成回答整个流程的精髓在于大模型不再“裸奔”回答问题而是带着检索到的知识去生成既能减少幻觉又能让回答有据可查。扩展知识一百万上下文时代RAG 为什么反而省不掉先算成本账。八十万 token 的知识库按 K3 输入价 3 美元/百万 token 估算每轮问答全量塞入一次约 2.4 美元而走 RAG 每轮只送检索出的 5-10 个块、几千 token两者差着三个数量级。再算效果账大海捞针类测试普遍显示上下文拉长后模型对中间段落的召回会明显衰减“装得下”和“捞得着”是两回事。真正的反常识点在这里上下文窗口越大无脑塞全文越亏。K3 依托 Mooncake 分离式推理架构把编程场景的缓存命中率做到 90% 以上财新报道口径恰恰说明工程上的主力方向是复用已经塞过的上下文、避免重复灌入而不是取消检索。长上下文解决的是轮次之间重复内容的复用RAG 解决的是从百万级语料里选出这次该看的几千 token两者是分工谁也没替代谁。文档分块策略分块是 RAG 效果的关键块太大检索不精准块太小又丢失上下文。常见的三种切法1语义切分用 SemanticSplitter 这类工具保证每个块语义完整独立比如一个问答对不会被切成两半2结构切分HTML、PDF 这种有层级的文档按标题层级切割像 HTMLHeaderTextSplitter 就能保留文档结构3递归切分RecursiveCharacterTextSplitter 先按大的分隔符切切不动了再按小的切兼顾连贯性和长度限制实际项目里300-500 字一块是比较通用的起点具体要根据业务场景调。检索阶段的优化手段单纯靠向量检索其实不够用生产环境通常会做多路召回混合检索特别适合那种用户可能用专业术语搜索的场景纯向量检索容易漏掉精确匹配的结果。11464. 什么混合检索在基于大模型的应用开发中混合检索主要解决什么问题Prompt 组装技巧检索完拿到一堆文档块怎么塞给大模型也有讲究# 典型的 RAG Prompt 模板prompt基于以下参考资料回答用户问题。如果资料中没有相关信息请说明无法回答。 参考资料 {context} 用户问题{query} 回答上下文太长会影响模型效果超过 4000 token 的时候可以考虑做摘要压缩RAPTOR 这类树状摘要方案就是干这个的。面试官追问追问如果检索出来的文档和用户问题不太相关大模型生成的答案会怎样有什么办法缓解回答大模型会硬着头皮用这些不相关的内容去凑答案结果就是回答跑偏或者出现幻觉。缓解手段主要有三个 1加一个相关性打分的环节低于阈值的直接丢掉不给模型 2在 Prompt 里明确告诉模型“如果资料不相关就直接说不知道” 3用 Reranker 做二次排序把真正相关的顶上来追问向量检索和传统的关键词检索各有什么优缺点回答向量检索擅长语义理解用户说“怎么退款”能搜到“退货流程”这种同义词的文档但对精确匹配不敏感搜“iPhone 15”可能漏掉带这个精确词的文档。关键词检索正好反过来精确匹配很强但不懂语义“退款”搜不到“退货”。所以生产环境一般两个一起用取长补短。追问文档块之间有上下文依赖怎么办比如前一段说“它”指的是更前面的某个概念。回答这是分块策略的经典问题。常用的解法是加 overlap相邻的块之间重叠 50-100 字保证上下文不丢。更高级的做法是用 Parent-Child 结构检索的时候匹配小块返回给模型的时候带上它的父块这样既精准又有上下文。回去我把成本监控调出来重新看了一遍RAG 那套离线索引看着笨其实每轮只把最相关的几千 token 送进模型剩下的钱和注意力都省下来了。这道题容易被“上下文窗口”这个数字带偏窗口装得下不等于装得划算、看得过来。完整题解和原始追问已经整理在面试鸭准备大模型应用方向的同学可以顺手把 RAG 这一组题过一遍。

相关新闻

Windows 常用命令大全:从入门到精通,提升效率必备

Windows 常用命令大全:从入门到精通,提升效率必备

前言无论是系统管理员、开发人员还是普通用户,掌握 Windows 命令行工具都能极大提升工作效率。本文系统整理了 Windows 系统中最常用、最实用的命令,涵盖文件管理、网络诊断、系统信息、进程服务等核心场景,助你从“小白”进阶为“高手”。一…

2026/8/14 5:35:09 阅读更多 →
通义千问 + 魔珐星云落地身交互智能 | 从0-1数学辅导 Agent 实战

通义千问 + 魔珐星云落地身交互智能 | 从0-1数学辅导 Agent 实战

摘要 我上学那会儿,错题本是一本纸质本子:抄题、写正解、偶尔翻翻。工作后做教育产品,我想把"错题本"这件事用 AI 重做一遍——不是做一个会聊天的题库,而是做一个能盯着你的错题、给你一步步讲明白的具身交互智能数字人…

2026/8/18 12:55:02 阅读更多 →
马鞍山五大全屋定制源头工厂推荐

马鞍山五大全屋定制源头工厂推荐

马鞍山五大全屋定制源头工厂推荐 筛选标准:马鞍山本地自有生产车间、自产自销工厂直营、厂房 3000㎡以上,覆盖高端原木、平价板式、批量工装全品类,适配刚需、改善、别墅不同户型 坤城高端整木定制(别墅原木高定首选) …

2026/8/18 14:07:36 阅读更多 →

最新新闻

番茄小说永久保存攻略:fanqienovel-downloader离线下载全流程详解

番茄小说永久保存攻略:fanqienovel-downloader离线下载全流程详解

番茄小说永久保存攻略:fanqienovel-downloader离线下载全流程详解 【免费下载链接】fanqienovel-downloader 下载番茄小说 项目地址: https://gitcode.com/gh_mirrors/fa/fanqienovel-downloader 你有没有过这样的时刻:追了半年的小说&#xff0c…

2026/8/18 14:49:16 阅读更多 →
如何把 ECDICT 免费英汉词典数据库变成你的专属查词引擎:76 万词条实战指南

如何把 ECDICT 免费英汉词典数据库变成你的专属查词引擎:76 万词条实战指南

如何把 ECDICT 免费英汉词典数据库变成你的专属查词引擎:76 万词条实战指南 【免费下载链接】ECDICT Free English to Chinese Dictionary Database 项目地址: https://gitcode.com/gh_mirrors/ec/ECDICT 你有没有遇到过这种尴尬:写读书工具时&am…

2026/8/18 14:49:16 阅读更多 →
二刷hot100-33.搜索旋转排序数组

二刷hot100-33.搜索旋转排序数组

在二分查找的基础上加了一些判断&#xff0c;因为数组并非单纯的有序&#xff1b;class Solution {public int search(int[] nums, int target) {int left -1;int right nums.length;while(left 1 < right){int mid left (right - left) / 2;if(f(nums,target,mid)){ri…

2026/8/18 14:49:16 阅读更多 →
窗口大小调整工具不折腾攻略:免费开源 Window Resizer,任意窗口 3 秒强制改尺寸

窗口大小调整工具不折腾攻略:免费开源 Window Resizer,任意窗口 3 秒强制改尺寸

窗口大小调整工具不折腾攻略&#xff1a;免费开源 Window Resizer&#xff0c;任意窗口 3 秒强制改尺寸 【免费下载链接】WindowResizer 一个可以强制调整应用程序窗口大小的工具 项目地址: https://gitcode.com/gh_mirrors/wi/WindowResizer 你有没有过这种时刻&#x…

2026/8/18 14:49:16 阅读更多 →
SnowflakeId [NTP = Network Time Protocol]

SnowflakeId [NTP = Network Time Protocol]

UUID & SnowflakeId 主键生成策略基本都是基于uuid改造规则业务编码code package further.zwf;import java.util.HashSet; import java.util.Set;/*** 简陋雪花算法实现【没有时钟回拨检测】* 用来演示&#xff1a;时钟回拨 → ID重复* * 41位时间戳 10位机器ID 12位序列…

2026/8/18 14:49:16 阅读更多 →
Glance测试工程解析:FileTree单元测试与测试样例设计的匠心

Glance测试工程解析:FileTree单元测试与测试样例设计的匠心

Glance测试工程解析&#xff1a;FileTree单元测试与测试样例设计的匠心 【免费下载链接】glance &#x1f50e; All-in-one Quick Look plugin 项目地址: https://gitcode.com/gh_mirrors/glance1/glance Glance 是一款开源的 All-in-one Quick Look 插件&#xff0c;让…

2026/8/18 14:48:16 阅读更多 →

日新闻

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF

告别逐帧截图&#xff1a;用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF 【免费下载链接】extract-video-ppt extract the ppt in the video 项目地址: https://gitcode.com/gh_mirrors/ex/extract-video-ppt 如果你还停留在"看网课 不停暂停 截图 …

2026/8/18 0:00:57 阅读更多 →
思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查

思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查

思源宋体TTF一站式上手&#xff1a;7个字重免费商用&#xff0c;从下载到上线的完整走查 【免费下载链接】source-han-serif-ttf Source Han Serif TTF 项目地址: https://gitcode.com/gh_mirrors/so/source-han-serif-ttf 你是不是也经历过这种时刻&#xff1a;设计稿里…

2026/8/18 0:00:58 阅读更多 →
华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate

华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate

华硕笔记本控制权回收指南&#xff1a;GHelper 如何用一个 10MB 文件替代 Armoury Crate 【免费下载链接】g-helper Lightweight Armoury Crate alternative for Asus laptops with nearly the same functionality. Works with ROG Zephyrus, Flow, TUF, Strix, Scar, ProArt, …

2026/8/18 0:00:59 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者&#xff0c;最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent&#xff0c;从本地部署到云端API&#xff0c;我们正处在一个技术栈快速重构的节点。然而&#xff0c;面对层出不穷的模型、框架和工具&#xf…

2026/8/18 9:15:35 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/18 9:06:28 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介&#xff1a;热爱科研的Matlab仿真开发者&#xff0c;擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。&#x1f34e; 往期回顾关注个人主页&#xff1a;Matlab科研工作室&#x1f447; 关注我领取海量matlab电子书和…

2026/8/18 9:04:56 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速&#xff1a;macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/17 18:54:37 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南&#xff1a;3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗&#xff1f;ncmdump解密工具帮你轻松解决这个困…

2026/8/17 18:55:16 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片&#xff1a;为英语学习 App 打造桌面级学习助手适用平台&#xff1a;HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0&#xff08;API 26 Beta&#xff09;新增了 AgentCard 智能体卡片能力&#xff0c;这是继 HMAF&#xff08;鸿蒙智能体框架&#x…

2026/8/17 18:55:55 阅读更多 →