Embedding模型怎么选——BGE、GTE、Jina我跑了中文检索实测,差距比想象大
做RAG的兄弟应该都有这个痛苦明明文档里就有答案就是召回不来。用户问这个API的rate limit是多少检索系统给你翻出几十条无关紧要的配置说明就是没有那条关键的限制说明。问题出在哪90%是embedding模型没选对。上周我实在忍不住了干脆把市面上主流的几个embedding模型都拉出来测了一圈——BGE、GTE、Jina用我自建的中文问答测试集跑了个遍。结果说实话差距比我想象的大得多。我为什么要做这个测试其实起因很简单。我们在做一个内部文档的RAG系统用的是OpenAI的text-embedding-3-small。召回效果怎么说呢凑合但远不够好。经常要命中3-5条才能找到真正有用的那一条用户体验很差。而且用国外模型还有个现实问题速度慢、成本高、还要考虑数据合规。我们内部文档都是中文用中文优化过的模型理论上应该效果更好、速度更快。但我搜了一圈发现网上评测大多是英文的或者就是C-MTEB榜单上的那些分数。榜单分数好看但实战效果怎么样没人说。没人测那我就自己测。怎么测的测试集我搞了个自建的大概500条中文问答对。都是真实场景的技术文档问答、常见问题、配置说明、API使用指南。指标我选了两个召回率k前k个结果里有没有正确答案k1,3,5,10MRR正确答案在第几个位置越靠前分数越高跑分环境是本地MacBook ProM1芯片用sentence-transformers加载模型。数据切分是简单的问答对用问题作为query用对应的答案段落作为candidate。核心代码长这样from sentence_transformers import SentenceTransformer加载模型model SentenceTransformer(‘BAAI/bge-large-zh-v1.5’)encodequery_embedding model.encode(query)doc_embeddings model.encode(documents)计算相似度用cosine similarityfrom sklearn.metrics.pairwise import cosine_similarityscores cosine_similarity([query_embedding], doc_embeddings)[0]不想折腾环境的话用OpenAI API也行但那个我这里不展开说了。测试结果差距真的很明显先说结论BGE在中文检索上确实有统治力GTE是均衡选手Jina是多语言和长文本的专家。具体跑分是这样的注意这是我自建小规模测试集的结果仅供参考精确数据请看C-MTEB官方榜单▪ BGE-large-zh-v1.5召回率172%召回率589%MRR0.78这表现是真能打。我们在内部系统上线后命中准确率直接提升了15个百分点。原本要翻3-5页才能找到答案现在基本上第一条就是对的。BGE是国内团队做的BAAI专门优化了中文语料。从C-MTEB榜单来看它在中文检索任务上确实处于第一梯队这点和我的实测结果是一致的。缺点也有模型尺寸大推理速度相对慢内存占用高。如果你资源有限这个可能不太友好。▪ GTE系列我测的是gte-base-zh召回率168%召回率585%MRR0.73GTE的表现也很稳定略逊于BGE但差距不大。它是阿里出的特点就是均衡速度、效果、模型尺寸各方面都不差。如果你要一个省心的选择GTE是不错的。不用太担心某个场景特别拉垮属于那种不会让你失望的选手。▪ Jina-embeddings-v2-base-zh召回率163%召回率581%MRR0.69纯中文检索的表现Jina确实比BGE和GTE差一截。但要注意Jina的强项是多语言和长文本。如果你要做的是跨语言检索比如英文查询找中文文档或者文档段落特别长超过512 tokenJina的优势就出来了。C-MTEB榜单也印证了这一点在多语言任务上Jina是领先选手。怎么选模型这个测试给我最大的启发就是没有最好的模型只有最适合你场景的模型。我给你整理了个对比表看完应该就有数了模型维度中文效果梯队速度适用场景BGE-large-zh-v1.51024第一慢中文RAG、问答系统、对召回率要求高的场景BGE-small-zh-v1.5512第二快中文检索、资源受限环境GTE-base-zh768第二中等通用场景、均衡需求Jina-embeddings-v2-base-zh768第三快多语言检索、长文本处理▪ 场景一纯中文RAG召回率优先选BGE-large-zh。实测效果确实好尤其对技术文档、API文档这种结构化内容。如果你资源够上large没问题如果资源有限small版本效果也还行。▪ 场景二混合语言需要跨语言检索选Jina。英文查中文、中文查英文它都行。而且它支持长上下文很适合那种段落比较长的文档。▪ 场景三资源受限要平衡效果和速度选GTE-base或者BGE-small。GTE更均衡BGE-small更偏中文。看你实际需求。▪ 场景四语义搜索不是RAG那你的选择会更自由一些。如果是产品功能搜索、内容推荐这几个模型都能用。建议选个快的比如GTE或者Jina。那些坑我替你踩了测试过程中也发现几个坑提醒一下不同模型的embedding长度不一样BGE-large是1024维GTE是768维Jina也是768。你切换模型的时候向量库要重建不然维度对不上。token长度限制大多数模型限制512 token。Jina可以到8192但如果你用sentence-transformers的默认配置还是会截断。要手动设置maxseqlength。归一化问题算cosine similarity之前建议把向量统一归一化到单位长度sentence-transformers里normalize_embeddingsTrue。有的向量库默认算的是内积归一化和不归一化的结果会差很多切换库的时候务必确认。BGE的查询要加指令前缀这是BGE官方文档里明确写的检索场景下query要加一句为这个句子生成表示以用于检索相关文章文档侧不用加。我第一次用没加召回率直接掉了几个点查了半天才发现是这个原因。最后说句实在的很多兄弟问我“到底要不要自己微调模型”我的建议是先别急着微调。选对模型、调好prompt、优化检索策略比如混合检索、rerank这些低成本的改动往往能带来更大的提升。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

SWAT模型参数率定必知:PAWN与Sobol全局敏感性分析方法对比实战

SWAT模型参数率定必知:PAWN与Sobol全局敏感性分析方法对比实战

全局敏感性分析入门:SWAT高参数化模型上PAWN与Sobol方法对比实战做水文模型的人,十有八九都被“参数敏感性分析”这件事折磨过。尤其是跑SWAT(Soil and Water Assessment Tool,水土评估工具)这类高参数化模型时&#x…

2026/10/11 7:55:05 阅读更多 →
无铅低温焊锡丝Sn42Bi58合金相图与焊接工艺参数研究

无铅低温焊锡丝Sn42Bi58合金相图与焊接工艺参数研究

摘要:本文深入研究了Sn42Bi58无铅低温焊锡丝的合金相图、显微组织、力学性能和焊接工艺参数,为电子制造行业选择和使用低温焊锡丝提供技术参考。 关键词:无铅低温焊锡丝;Sn42Bi58;合金相图;焊接工艺&#x…

2026/10/11 7:55:05 阅读更多 →
DeepSeek-V3 部署与微调实战:MoE 显存账、vLLM 与 LoRA 避坑指南

DeepSeek-V3 部署与微调实战:MoE 显存账、vLLM 与 LoRA 避坑指南

简介:面向深度学习开发者的DeepSeek-V3配套资源包,聚焦模型推理、权重转换与部署场景,也适合关注深度搜索、数据分析与机器学习方向的进阶学习者。压缩包共17个文件,包含Python脚本(模型定义、fp8精度转换、文本生成&a…

2026/10/11 7:54:04 阅读更多 →

最新新闻

2026年实时数据同步工具怎么选?GoldenGate、Striim、SeaTunnel、FineDataLink 5.0横评

2026年实时数据同步工具怎么选?GoldenGate、Striim、SeaTunnel、FineDataLink 5.0横评

实时数据同步,是这两年企业数据建设里绕不开的一环。业务对实时性的要求越来越高——库存要实时、订单要实时、设备状态要实时,T1 的离线数仓在很多场景下已经不够用了。于是选型的问题摆在了面前:GoldenGate、Striim、SeaTunnel、FineDataLi…

2026/10/11 8:51:41 阅读更多 →
拼多多反爬对抗实战:Scrapy 中间件化采集架构解析

拼多多反爬对抗实战:Scrapy 中间件化采集架构解析

1. 选型依据 PDD 公开数据分布在移动端 API(mobile.yangkeduo.com)与 H5(mobile.pinduoduo.com)。当采集规模上升,手写 requests 线程池在三个方面迅速失效: 调度:限流、重试、去重需自行实现…

2026/10/11 8:51:41 阅读更多 →
Kubeadm证书过期检查实操

Kubeadm证书过期检查实操

Kubeadm证书过期检查实操技术栈:Kubernetes v1.32.13 Rocky Linux 8.6 Containerd 1.7.x Calico v3.27.x操作环境 / 对接原理 / 详细步骤 / 完整命令 / 配置文件 / 验证流程 / 排错方案Kubeadm证书过期检查实操操作环境K8s 集群版本 v1.32.13,操作系统…

2026/10/11 8:51:41 阅读更多 →
大模型Skill技能全解析:从原理、结构到实操,让AI真正动手办事

大模型Skill技能全解析:从原理、结构到实操,让AI真正动手办事

直接抛个结论:Skill 这个词,最近在 AI 圈子里火得不像话,但你要是以为它是什么高深莫测的新算法,那就想多了。它其实是一套很朴素的工程思路:把大模型从“只会聊天”改造成“能动手办事”。我自己从最早被这个概念绕晕…

2026/10/11 8:51:41 阅读更多 →
后来,我再也没说过一句谢谢

后来,我再也没说过一句谢谢

以前,我是一个很喜欢说谢谢的人。 别人帮我拿一下东西,我说谢谢;别人替我多做了一点事情,我说谢谢;哪怕对方只是在完成自己的工作,只要态度好一些,我也会习惯性地表达感谢。 我一直觉得&#xf…

2026/10/11 8:51:41 阅读更多 →
2026软件测试面试指南:从Linux到AI测试的全栈质量保障

2026软件测试面试指南:从Linux到AI测试的全栈质量保障

1. 2026年软件测试面试到底在面什么做了这么多年软件测试,也面试过不少候选人,我越来越觉得现在的面试早就不是背几套题就能过关的时代了。前两天跟一个刚跳槽去大厂的兄弟聊天,他说现在的软件测试面试题已经卷到“既要懂八股、又要能落地、还…

2026/10/11 8:50:40 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →