你的 RAG 到底答得准不准? 给它做评估 + 混合检索与重排
你兴冲冲地把 chunk 大小从 300 调到 500感觉「好像变好了」——但真的变好了吗还是错觉没有一把尺子你永远在凭感觉打转。RAG 优化的第一性原理是先能度量才谈得上改进。今天我们先造出这把尺子评估再用它验证两个最有效的升级动作——混合检索和重排。学完你就从「凭感觉调参」升级成「用数字驱动」。01RAG 分两段评估也分两段回忆 006RAG 检索生成。这两段会各自出错得分开评环节失败长什么样怎么量检索压根没找到该用的资料巧妇难为无米之炊命中率 Hit Rate、召回 Recallk、MRR生成资料对了但答案跑偏或编造忠实度 Faithfulness、答案相关性 Answer Relevancy 先诊断再下药分开评估的意义在于定位病根如果检索命中率就很低那再强的模型也救不回来——该去改切块/检索如果检索没问题但忠实度低那是 prompt 或模型的问题——去改生成。不分段你连该修哪儿都不知道。02评估检索先攒一份「金标准」评估的前提是有一份评估集golden set一批问题以及每个问题「本应命中」的文档。几十条人工标注即可起步。基于 009 的 Chroma 库每段有 id命中率就是一段简单代码# 复用 009 的 kbChroma collection。金标准问题 → 应命中的文档 id GOLD [ { q : 生鲜能退吗 , want : a2 }, { q : 退款几天到账 , want : a3 }, { q : 什么时候发货 , want : d1 }, ] def hit_rate (k 3 ): hits 0 for item in GOLD: got kb.query(query_texts[item[ q ]], n_resultsk)[ ids ][ 0 ] hits (item[ want ] in got) # 命中的正确文档在 top-k 里就算 1 分 return hits / len (GOLD) print ( fHit3 {hit_rate():.0%} ) # 例如 Hit3 67%∑ 三个常用检索指标Hit Ratek正确文档出现在 top-k 里的比例0/1最直观。Recallk一个问题有多个相关文档时top-k 命中了其中几成。MRR平均倒数排名正确文档排在第 1 名给 1 分、第 2 名给 1/2、第 3 名给 1/3……——不仅关心「找没找到」还关心「排得够不够靠前」。03评估生成让「AI 当裁判」LLM-as-judge生成质量没有标准答案可对比怎么打分主流做法是LLM-as-judge——请一个模型当裁判。最重要的一把尺子是忠实度Faithfulness答案里的每句话是不是都能在检索到的资料里找到依据这直接量化了「有没有幻觉」。import anthropic client anthropic.Anthropic() def judge_faithful (question, context, answer): prompt ( 你是严格的评审。判断【答案】是否完全由【资料】支撑、没有编造。\n 只回复一个词YES完全有据或 NO含无据/编造内容。\n\n f资料\n{context}\n\n问题{question}\n\n答案{answer} ) resp client.messages.create( model claude-opus-4-8 , max_tokens 10 , messages[{ role : user , content : prompt}], ) verdict next (b.text for b in resp.content if b.type text ).strip().upper() return verdict.startswith( YES )另一把常用尺子是答案相关性Answer Relevancy答案切不切题、有没有答非所问同样可以让裁判打 1~5 分。把这些分数在整个评估集上一平均你就有了一块能对比不同版本的「仪表盘」。⚠️ 裁判也会看走眼LLM-as-judge 又快又便宜但不是真理。务必① 用比被测更强的模型当裁判② 给裁判清晰的评分标准和示例③人工抽检一部分裁判结果校准它是否可信。把它当「自动化初筛」而非「终审法官」。04提分利器一混合检索向量 关键词纯向量检索008/009擅长「语义相近」但有个短板专有名词、编号、代码、精确字符串它常常抓不住。你搜「订单号 SF12345」向量觉得它和一堆「订单相关」的话都挺像却未必能精准锁定那一条。**混合检索Hybrid Search**把两种检索的结果融合向量检索语义懂「意思相近」如「重置密码」↔「忘记口令」。关键词检索如 BM25字面懂「精确匹配」如「SF12345」「log4j」「第 7 条」。两路各取所长用 **RRFReciprocal Rank Fusion倒数排名融合**之类的方法把两个排名合成一个。很多向量库/框架已内置混合检索一个开关的事。 一句话向量检索管「意思像」关键词检索管「字面对」。真实问题两种都有所以混合检索几乎总比单用一种更稳——这是性价比最高的一次升级。05提分利器二重排Rerank检索为了快用的是「双塔」式的近似匹配问题、文档各自编码后比距离召回快但不够精。重排的思路是「粗召回 精排序」两段式重排器reranker通常是个cross-encoder把「问题 候选文档」一起喂进模型算一个精准的相关分。它比双塔准得多但慢——所以只用它给粗召回的一小批候选精排。代码只多几行# pip install sentence-transformers from sentence_transformers import CrossEncoder reranker CrossEncoder( cross-encoder/ms-marco-MiniLM-L-6-v2 ) def retrieve_rerank (q, k 3 , pool 20 ): cand kb.query(query_texts[q], n_resultspool)[ documents ][ 0 ] # ① 粗召回 20 条 scores reranker.predict([(q, c) for c in cand]) # ② 逐条精排打分 order sorted ( range ( len (cand)), key lambda i: -scores[i]) return [cand[i] for i in order[:k]] # ③ 取精排后的 top-306把它跑成一个闭环数字驱动优化有了尺子和两个升级动作正确的工作方式是一个迭代闭环1建评估集攒一批有代表性的真实问题 金标准答案/应命中文档。2跑基线先测出当前系统的 Hitk 与忠实度记下来当对照。3只改一个变量比如「加重排」或「换混合检索」——一次只动一处。4重跑评估、看分数分数涨了就留下没涨/退步就回滚。用数字说话。eval.py — 对比实验$ python eval.py ━━ 基线纯向量 top-3━━ Hit3 0.67 忠实度 0.80 ━━ 重排粗召回20 → 精排3━━ Hit3 0.92 ▲ 0.25 忠实度 0.93 ▲ 0.13 ✅ 重排带来明显提升采纳。关键纪律一次只改一个变量。同时改切块、换嵌入、又加重排分数变了你也不知道是谁的功劳——科学实验的基本功在这里同样适用。07常见坑⚠️ 评估里最容易翻车的地方①评估集不代表真实问题都是你自己顺手编的、太简单分数虚高上线现原形。要收集真实用户问题覆盖长尾和刁钻情况。②只看平均分均值会掩盖灾难性坏例。一定要翻出得分最低的几条逐个看——真正的洞察都在坏例里。③裁判偏见LLM 裁判可能偏爱长答案、或偏爱和自己风格像的答案。抽检 明确评分标准来对冲。④评估集泄漏进 prompt别把金标准答案不小心塞进上下文那是自欺欺人。08今日小测验Q1 为什么 RAG 评估要把「检索」和「生成」分开评**答**为了定位病根。检索没找对再强的模型也答不好该去改切块/检索检索对了但答案跑偏/编造那是生成层(prompt/模型)的问题。不分段就不知道该修哪儿。Q2 忠实度Faithfulness衡量的是什么它对应哪个老毛病**答**衡量答案里的每句话是否都能在检索到的资料中找到依据。它直接量化「有没有幻觉」——忠实度低 模型在编造资料没说的内容。Q3 混合检索为什么常比纯向量检索更稳**答**向量擅长语义相近但不擅长精确匹配编号、专名、代码关键词(BM25)正好相反。混合把两路结果融合各取所长覆盖更全。Q4 重排为什么要「先粗召回再精排」而不直接用重排器搜全库**答**重排器是 cross-encoder把问题文档一起算准但慢无法对全库每条都跑。所以先用快的向量检索粗召回一小批(如 top-50)再用重排器只对这批精排——快与准兼得。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

一套漫画看懂什么是 RAG

一套漫画看懂什么是 RAG

很多人第一次接触 RAG 时,都会有同一种感觉: 这个词在 AI 圈里很常见,但真正解释清楚时,往往又容易变得很技术、很抽象。 所以这次我换一种方式——直接用一套知识漫画,把 RAG 讲明白。 如果先用一句最直白的话概括&am…

2026/8/9 1:58:37 阅读更多 →
告别模组混乱:AML启动器带你轻松管理XCOM 2与奇美拉小队模组

告别模组混乱:AML启动器带你轻松管理XCOM 2与奇美拉小队模组

告别模组混乱:AML启动器带你轻松管理XCOM 2与奇美拉小队模组 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mir…

2026/8/9 1:57:36 阅读更多 →
OpenClaw全平台安装与AI开发框架部署指南

OpenClaw全平台安装与AI开发框架部署指南

1. OpenClaw全平台安装指南:从零到精通的完整方案 OpenClaw作为一款新兴的AI智能体开发框架,凭借其模块化设计和多模型支持能力,正在开发者社区快速走红。我最近在三个不同平台(Windows 11、Ubuntu 22.04和macOS Ventura&#xff…

2026/8/9 1:57:36 阅读更多 →

最新新闻

GEO 是什么意思?企业做 GEO 能提升多少转化?AI 时代营销新引擎全解析

GEO 是什么意思?企业做 GEO 能提升多少转化?AI 时代营销新引擎全解析

GEO 是什么意思?企业做 GEO 能提升多少转化?AI 时代营销新引擎全解析在 AI 大模型全面渗透搜索场景的当下,GEO(生成式引擎优化) 已成为企业营销领域的核心热词,它不仅是传统 SEO 的迭代升级,更是…

2026/8/9 3:00:03 阅读更多 →
EnvBoard v2.0.0 正式发布:PWA 离线可用、中英双语、CLI 三连,320 用例护航

EnvBoard v2.0.0 正式发布:PWA 离线可用、中英双语、CLI 三连,320 用例护航

EnvBoard v2.0.0 正式发布:PWA 离线可用、中英双语、CLI 三连,320 用例护航 从 v1.0.0 到 v2.0.0,EnvBoard 又走了 6 个版本。这一版没有继续堆解析格式,而是把开发重心放在了**「让工具更可用」**上:PWA 离线安装、全…

2026/8/9 3:00:03 阅读更多 →
NSDBO算法在微电网优化调度中的应用与Matlab实现

NSDBO算法在微电网优化调度中的应用与Matlab实现

1. 项目概述:微电网优化调度与NSDBO算法 微电网作为分布式能源系统的核心单元,其优化调度直接关系到供电可靠性和经济性。传统调度方法在处理风光出力不确定性、负荷波动性等多目标优化问题时往往捉襟见肘。我们团队提出的基于非支配排序蜣螂优化算法&am…

2026/8/9 3:00:03 阅读更多 →
Python数据质量实战:从矛盾点探查到自动化监控

Python数据质量实战:从矛盾点探查到自动化监控

1. 背景与核心概念:数据背后的“矛盾”意味着什么?在数据驱动的时代,无论是数据分析师、产品经理还是后端开发者,我们每天都在与海量数据打交道。当我们拿到一份看似权威的宏观数据报告,例如“全国案件年增数据”&…

2026/8/9 3:00:03 阅读更多 →
Verity概念解析与Spring Boot验证模块实战指南

Verity概念解析与Spring Boot验证模块实战指南

最近在开发一个需要验证用户输入的场景时,发现很多开发者对verity这个单词感到困惑。它看起来像verify,但又不太一样,网上资料也多是零散的讨论。其实,verity在技术领域,尤其是在一些框架、库或特定上下文中&#xff0…

2026/8/9 3:00:03 阅读更多 →
08-模型调优实战:超参、数据增强、分辨率、batch优化

08-模型调优实战:超参、数据增强、分辨率、batch优化

模型调优实战:超参、数据增强、分辨率、batch优化 作者:黒漂技术佬 一、调优的基本心法 调参这事,新手最爱干的是对着超参列表一顿乱改,跑一晚上训练,第二天发现mAP纹丝不动。调参的正确姿势是:先看数据,再调参数。 模型不是魔法,它只能从你给的数据里学到东西。数据不…

2026/8/9 2:59:02 阅读更多 →

日新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/8 17:02:44 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/9 0:45:04 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/8 17:02:44 阅读更多 →