RAG知识库 B评估实验结果报告
数据库 B实验结果报告第一章 实验概述1.1 实验背景与目标本实验面向论文检索场景评估不同检索策略在给定语料库共171 篇学术文献上的检索质量。语料按主题分为三类漏洞修复20 篇、漏洞检测93 篇、LLM 安全58 篇三类论文数之和恰为 171 篇构成完整的测试语料。1.2 测试查询测试集包含 3 条英文查询分别与上述三个主题类别一一对应序号测试查询英文对应主题类别相关文献数1State-of-the-art source code automatic repair methods漏洞修复20篇202Summarize automated vulnerability mining frameworks漏洞检测93篇933Future trends of LLM security researchLLM安全58篇581.3 评估指标定义检索正例在返回结果TOP-K中被判定为与查询相关的文献数。RecallK召回率 检索正例数 ÷ 该类别相关文献总数。衡量“该找的找到了多少”。PrecisionK准确率 检索正例数 ÷ TOP-K实际返回数。衡量“返回的结果有多少是对的”。F1K 2 × Recall × Precision ÷ (Recall Precision)。综合权衡召回与准确作为核心择优指标。第二章 实验设计与配置实验覆盖 4 种检索方式并在每种方式下扫描多组超参数重排序模型 / 融合权重、TOP-K、Score 阈值检索方式重排序 / 融合策略配置组数TOP-K 取值Score 阈值取值全文检索重排序模型 bge-reranker-v2-m3123 / 5 / 8 / 100 / 0.5 / 0.8向量检索bge-reranker-v2-m3123 / 5 / 8 / 100 / 0.5 / 0.8混合检索-Rerank重排序模型 bge-reranker-v2-m3123 / 5 / 8 / 100 / 0.5 / 0.8混合检索-权重设置语义:关键词 权重 0:100% ~ 100%:0 共12档443 / 5 / 8 / 100 / 0.5 / 0.8第三章 核心指标汇总下表给出各检索方式在全部超参数组合中的最优配置及其核心指标F1K 最高者检索方式最优配置召回率准确率F1K均值F1全文检索变体bge-rerankerTOP-K10Score阈值0.06.43%36.67%10.95%3.34%向量检索变体bge-rerankerTOP-K10Score阈值0.016.96%96.67%28.86%8.68%混合检索-Rerank变体bge-rerankerTOP-K10Score阈值0.012.87%73.33%21.89%7.47%混合检索-权重设置变体0.40.6TOP-K10Score阈值0.017.54%100.00%29.85%18.08%第四章 各检索方式性能表现4.1 全文检索配置组数12最优配置变体bge-rerankerTOP-K10Score阈值0.0。整体指标最优配置RecallK 6.43%PrecisionK 36.67%F1K 10.95%。分主题类别表现主题类别相关文献检索正例RecallKPrecisionKF1K漏洞修复20735.00%70.00%46.67%漏洞检测9344.30%40.00%7.77%LLM安全5800.00%0.00%—整体平均全配置Recall 1.90%Precision 15.79%F1 3.34%。4.2 向量检索配置组数12最优配置变体bge-rerankerTOP-K10Score阈值0.0。整体指标最优配置RecallK 16.96%PrecisionK 96.67%F1K 28.86%。分主题类别表现主题类别相关文献检索正例RecallKPrecisionKF1K漏洞修复201050.00%100.00%66.67%漏洞检测9399.68%90.00%17.48%LLM安全581017.24%100.00%29.41%整体平均全配置Recall 4.09%Precision 36.06%F1 8.68%。4.3 混合检索-Rerank配置组数12最优配置变体bge-rerankerTOP-K10Score阈值0.0。整体指标最优配置RecallK 12.87%PrecisionK 73.33%F1K 21.89%。分主题类别表现主题类别相关文献检索正例RecallKPrecisionKF1K漏洞修复201050.00%100.00%66.67%漏洞检测9366.45%60.00%11.65%LLM安全58610.34%60.00%17.65%整体平均全配置Recall 4.24%Precision 36.04%F1 7.47%。4.4 混合检索-权重设置配置组数44最优配置变体0.40.6TOP-K10Score阈值0.0。整体指标最优配置RecallK 17.54%PrecisionK 100.00%F1K 29.85%。分主题类别表现主题类别相关文献检索正例RecallKPrecisionKF1K漏洞修复201050.00%100.00%66.67%漏洞检测931010.75%100.00%19.42%LLM安全581017.24%100.00%29.41%整体平均全配置Recall 10.23%Precision 89.89%F1 18.08%。4.5 混合检索-权重设置的权重敏感度B库在 TOP-K10、Score阈值0 条件下不同语义:关键词权重下的 F1K 峰值配置权重(语义:关键词)召回率准确率F1K0.40.617.54%100.00%29.85%0.30.716.96%96.67%28.86%0.20.816.37%93.33%27.86%0.50.516.37%93.33%27.86%0.60.416.37%93.33%27.86%第五章 关键发现Score 阈值对召回存在显著负向影响。所有检索方式下Score 阈值取 0.5 或 0.8 的配置其召回率与 F1 普遍大幅低于阈值0 的配置全部最优指标均出现在 Score 阈值0 处。建议在保证准确率可接受的前提下将阈值设为 0。TOP-K 与检索质量正相关。以最优配置集中的 TOP-K10 为例其召回率与 F1 明显高于 TOP-K3/5/8增大返回窗口能提升相关文献被覆盖的概率但需权衡下游重排序/阅读成本。“混合检索-权重设置”在本库中综合表现最佳。其峰值 F1K 达 29.85%整体均值 F118.08%显著高于其余三种方式全文/向量/混合-Rerank 均值均低于 10%44 组细粒度权重扫描提供了最大寻优空间在 A 库中其峰值 F1 与“向量检索”持平在 B 库中则明显优于“向量检索”。主题类别间表现严重不均衡。漏洞检测类93 篇相关文献基数大、语义分散各方式召回普遍偏低LLM 安全类在部分配置下召回为 0如 B 库全文检索最优配置未检索到任何 LLM 安全文献是检索质量的短板。稳定性方面“混合检索-权重设置”方式的 F1K 变异系数最小对超参数扰动最不敏感工程落地风险最低。第六章 结论与建议首选方案综合 F1 与寻优空间推荐以“混合检索-权重设置”最优权重TOP-K10Score 阈值0作为本库默认检索策略。参数基线默认 TOP-K10、Score 阈值0在准确率要求极高时可适度引入阈值但需以召回损失为代价进行评估。短板治理针对 LLM 安全类与漏洞检测类召回不足建议扩充该类语料、优化嵌入模型或引入查询改写对类别不均衡问题可采用分主题独立检索与加权融合。

相关新闻

【VLM】Qwen3.8-Omni-Flash长音视频理解Agentic模型

【VLM】Qwen3.8-Omni-Flash长音视频理解Agentic模型

note Qwen-MM-Plugins视频问答:给视频问答加了三类工具 记忆建设:omni-memory / video-memory(建结构化记忆再检索)模型驱动的时间区间定位 粗看/细看:omni_av_grounding perceive_media直接一次性感知:…

2026/10/5 15:13:44 阅读更多 →
AI时代,为何软件工程基础依旧重要?

AI时代,为何软件工程基础依旧重要?

AI时代,为何软件工程基础依旧重要? 摘要 在AI编程工具快速发展的背景下,一种观点认为"代码可以变得廉价",软件开发流程应当从传统的"设计-编码-测试"转向"规格描述-AI生成代码"的范式。然而&#x…

2026/10/5 15:13:44 阅读更多 →
Warp 编排卡片内联创建 API Key:Orchestration Cards 的 Create-API-Key Flow 设计与实现解析

Warp 编排卡片内联创建 API Key:Orchestration Cards 的 Create-API-Key Flow 设计与实现解析

桌面应用开发者工具人工智能AI 应用AI Agent代码智能体 【免费下载链接】warp Warp is an agentic development environment, born out of the terminal. 项目地址: https://gitcode.com/GitHub_Trending/wa/warp 点击查看 免费下载 导读 本文解析 Warp 终端中&qu…

2026/10/5 15:12:43 阅读更多 →

最新新闻

Prometheus监控系统从零部署实战:安装、告警与可视化全解析

Prometheus监控系统从零部署实战:安装、告警与可视化全解析

如果你做过几年运维,大概率经历过这种场景:半夜两点被电话叫醒,说服务挂了,你睡眼惺忪地登录服务器,CPU、内存、磁盘状态全靠一条命令一条命令去敲,等查出来是磁盘写满,业务已经中断了半小时。这…

2026/10/5 15:55:23 阅读更多 →
OpenShell完全指南:从安装到企业部署,彻底救活Windows开始菜单

OpenShell完全指南:从安装到企业部署,彻底救活Windows开始菜单

1. 为什么这么多年我还在折腾开始菜单 1.1 OpenShell到底是什么来头 如果你是从Windows 7时代过来的老用户,对“开始菜单”这三个字肯定有种特殊情结。微软从Windows 8开始砍掉传统开始菜单,到现在Windows 11上那个居中的、像平板一样的开始菜单&#x…

2026/10/5 15:55:23 阅读更多 →
Delta-Sigma调制器设计精讲:过采样、噪声整形与工程实践

Delta-Sigma调制器设计精讲:过采样、噪声整形与工程实践

1. 从ADC开始认识DSM,一个靠“算”而不是靠“比”的调制器做数据转换器这行的人,几乎绕不开Delta-Sigma调制。无论是音频芯片里24bit/192kHz的ADC,还是高精度工业测量仪器里的低速ADC,甚至我们天天用的手机基带里那个看似不起眼的…

2026/10/5 15:55:23 阅读更多 →
OpenShell 完全指南:告别臃肿,恢复高效 Windows 开始菜单

OpenShell 完全指南:告别臃肿,恢复高效 Windows 开始菜单

1. 项目概述:OpenShell 是什么,为什么它还有存在的意义先说结论:OpenShell 是经典 Windows 开始菜单工具 Classic Shell 的社区继任版本,项目的目标只有一个——把你被系统“夺走”的开始菜单,用更好用的方式还给你。我…

2026/10/5 15:55:23 阅读更多 →
西门子S7-1500 PLC在物流分拣线中的KepServer通信配置实战

西门子S7-1500 PLC在物流分拣线中的KepServer通信配置实战

前阵子刚结束一个物流分拣线的升级项目,整套系统用的就是西门子S7-1500PLC做主控。说实话,干这行十几年,从S7-300、S7-1200一路用过来,1500在物流分拣这种节拍快、IO点多、通信要求高的场景里,确实能感觉到明显差异。这…

2026/10/5 15:55:23 阅读更多 →
维普查重和AIGC疑似度双双超标怎么整篇高效修改

维普查重和AIGC疑似度双双超标怎么整篇高效修改

维普查重和AIGC疑似度双双超标怎么整篇高效修改在高校学术规范审查中,不少使用维普系统进行送审前抽检的同学遭遇了一种极其棘手的“双高”困境:打印出来的检测报告上,传统的文字复制比(查重率)高达 28%,而…

2026/10/5 15:54:22 阅读更多 →

日新闻

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:22 阅读更多 →
AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

1. 从“plugins”这个词说起:它到底在解决什么问题如果你最近在折腾 AI 编程工具,尤其是 Cursor、Codex CLI、Claude Code 这类带 CLI 的编辑器或命令行助手,那你大概率绕不开一个词——plugins。这个词本身不新鲜,从浏览器到 IDE…

2026/10/5 0:00:23 阅读更多 →
第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:23 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 5:06:42 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 1:10:22 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 3:06:17 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 11:40:45 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 9:43:54 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 20:14:29 阅读更多 →