RAG还没死,SmartRAG更聪明了
今天分享的是SmartRAG–把云端GraphRAG那套百亿大模型现场建图的范式拆掉改成四个轻量模块分工让1.7B量化模型在一加手机上跑多跳QA追平18倍大模型。手机端跑GraphRAG的痛点不在模型小是云端让大模型建图那套范式搬不上手机–4B都卡分钟级TTFT。让我们一起看看SmartRAG是如何克服的。四模块分工SmartRAG的核心动作是把结构化知识能力从LLM能力问题重构为系统架构问题。四个模块协同PerceptionEvoNER持续学习NER 轻量关系分类器把文本抽成entity-relation三元组MemoryMRGraph三层图持久化绑定源段落做溯源Focus混合检索图遍历词法稠密语义Thinkingon-device LLM仅做labeling/summarization/planning/answering四角色高频写图交给轻量可训练组件LLM保留给低频高价值语义操作。EvoNER三件套EvoNER是整套架构的引擎三件套让轻量NER能持续吃新实体Span-based NER字符注入枚举候选span时只从word-start走到最大宽度W10O(nW)候选而非O(n²)。每个word首subword注入字符级特征 h_t [e_t ; m_t·c(t)]m_t是首subword指示位c(t)是字符级embedding增强对错拼和罕见surface form的鲁棒性。Reserved-label机制分类器预分配固定标签容量切分为base headno-entity已部署类型和reserved rows未来类型。reserved初始化为 b≪0, W≈0 的不激活态新类型直接占位不用重训分类器输出维度不变。Teacher distillation只在base子空间增量目标 L_inc L_task λ_KD·L_KD。蒸馏gate m_rI[max softmax(ℓ_T_base/T_kd) ≥ τ]即老师在base类上峰值概率超τ才蒸馏。reserved logits不被蒸馏新类型保持可塑性老边界由老师锚定。配套三阶段参数高效更新 Θ1Θ_head - Θ2Θ_head∪Θ_topK - Θ3Θ设备预算耗尽可在任意阶段停。未识别实体先冻结轻量embedder抽向量存本地向量库攒够数量后用Ward linkage做agglomerative聚类 d(A,B) (|A|·|B|)/(|A||B|)·||µ_A-µ_B||²凝聚出大簇再交给Thinking模块打标签。MRGraph三层图MRGraph是三层溯源知识图Layer 1 Entity-paragraph graph段落是写入和检索的原子单位。段落节点存原文文档指针in-document indexembedding实体节点用稳定name hash去重关系边带observation count防图爆炸。Ingestion走evidence-first, structure-second–三元组先对齐到best-matching段落再materialize为关系边保证每条结构化事实都可追溯。Layer 2 Abstraction layer在实体之上维护语义簇centroid平滑更新anchor-centroid drift metric检测并阻止主题漂移。簇摘要在正常运行时增量维护idle-and-charging时段做高质量refinement。Layer 3 Runtime raw-text viewquery时把命中的段落证据和局部图邻居按token budget组装成context同时给Thinking模块结构化和非结构化两类证据。三阶段混合检索Thinking模块先把问题分解成retrieval plan P(e_0, {(r_h, t_h)}^H_{h1})e_0是seed entity每跳r_h是自然语言关系短语如published int_h是目标实体类型。Stage 1按plan多跳文本检索每跳把当前center entity和关系短语拼成local query用fused lexicaldense相似度召回段落MMR在token预算下选证据再用命中段落推下一跳的entity center。Stage 2Stage 1的bridge entity做图遍历种子。每个节点把自身拼接query后跟abstraction层摘要比对选top-ranked簇做top-down扩展。Personalized PageRank估节点重要性连通子图块配段落证据组装。Stage 3前两阶段证据不足时全文检索兜底解决实体跨段落切分的边界问题。最后做entity mention局部窗口抽取句子级压缩hash去重再喂给LLM。LLM稀疏叫醒on-device LLM被当作可复用语义引擎只在4个高价值语义操作上被叫醒Labeling对置信度不够的实体簇LLM提出新类型名 ∆T LLM(cluster(M))语义发散的簇被拒绝以防污染类型空间SummarizationKG周期性聚成communityLLM产出摘要重插回上层段落形成自压缩记忆环Planning复杂问题在取证据前先被分解成多跳retrieval planAnsweringLLM基于检索证据生成答案约束在结构化schema上偏抽取式grounding降低幻觉建图、关系抽取、聚类、检索这些高频操作都不走LLM。实验对比4个QA benchmark上跑Qwen3-1.7BSmartRAGQ6_K量化llama.cpp后端OnePlus 13/15真机BenchmarkSmartRAG (1.7B) Cr%Qwen3-32B LLM-only Cr%Ministral3-14B LLM-only Cr%TriviaQA50.0051.4560.70NQ66.6840.1537.80HotpotQA63.9333.2522.40MultiHopQA50.1731.5420.12NQ/HotpotQA/MultiHopQA三局1.7BSmartRAG全面反超32B和14B这两组大模型参考。TriviaQA上简单事实问题大模型parametric memory仍有优势。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

药店客流统计与行为分析的3D视觉解决方案

药店客流统计与行为分析的3D视觉解决方案

1. 项目背景与行业痛点药店连锁行业正面临从传统经验运营向数据驱动转型的关键时期。过去十年间,我参与过47家连锁药店的数字化改造项目,发现一个共性难题:90%的店长无法准确回答"周末下午3-4点该安排几名药师在岗"这类基础运营问题…

2026/10/11 13:10:36 阅读更多 →
Linux进程线程管理机制与性能优化实战

Linux进程线程管理机制与性能优化实战

1. Linux进程线程管理概述在Linux系统中,进程和线程是操作系统资源分配和调度的基本单位。理解它们的运作机制,对于系统性能优化、程序开发和故障排查都至关重要。我从事Linux系统开发运维已有八年,今天就来分享这个看似基础但实际暗藏玄机的…

2026/9/29 14:32:32 阅读更多 →
数字孪生与多模态AI融合的智慧营区实践

数字孪生与多模态AI融合的智慧营区实践

1. 项目背景与核心价值去年参与某智慧营区建设项目时,我们遇到了一个典型痛点:传统数字孪生系统对物理实体的动态认知能力不足。当营房内设备状态突变或人员行为异常时,系统往往需要人工介入判断。这促使我们探索将多模态认知能力注入数字孪生…

2026/10/10 20:19:37 阅读更多 →

最新新闻

Open Science Desktop的ACP协议详解:与Codex、Claude Code、Zed双向互通的原理与实践

Open Science Desktop的ACP协议详解:与Codex、Claude Code、Zed双向互通的原理与实践

【免费下载链接】open-science Open Science Desktop — local-first, model-agnostic AI research workbench for macOS, Windows & Linux. Open-source Claude Science desktop alternative built on Tauri MCP agent skills. 项目地址: https://gitcode.co…

2026/10/11 13:12:50 阅读更多 →
在广东试了十几个背单词小程序,我踩过的坑比你想的深

在广东试了十几个背单词小程序,我踩过的坑比你想的深

先说个背景。我在广州做了四年英语培训,带过的学员从初中生到准备出国的职场人都有。广东背单词小程序品牌这两年冒出来特别多,地铁上、电梯里、短视频里全是广告。我一开始还挺高兴,觉得工具多了是好事。结果真带着学员挨个试下来&#xff0…

2026/10/11 13:12:50 阅读更多 →
把Hope Agent部署成7x24在线的个人服务:Docker自托管NAS/云VPS与远程访问完整教程

把Hope Agent部署成7x24在线的个人服务:Docker自托管NAS/云VPS与远程访问完整教程

【免费下载链接】hope-agent 🦭 A cross-device desktop AI agent with memory, autonomous goals, dynamic workflows, and headless deployment | 会记忆、能持续推进目标、会动态编排多 Agent 的跨端桌面 AI 助手,也可服务化常驻 NAS / 云端 项目地址…

2026/10/11 13:12:50 阅读更多 →
Jmeter接口测试实战:从HTTP基础到参数化、断言与压测

Jmeter接口测试实战:从HTTP基础到参数化、断言与压测

1. 项目概述:接口测试为什么要选Jmeter先开门见山说结论:用Jmeter做HTTP接口测试,是目前中小团队和个人测试最“性价比”的选择之一。你不需要写一段复杂的Java代码,不需要维护一套平台,只要把Jmeter装好,按…

2026/10/11 13:12:50 阅读更多 →
K8s离线部署flannel镜像包全攻略:从拉取到导入避坑

K8s离线部署flannel镜像包全攻略:从拉取到导入避坑

简介:这份资源面向正在搭建 Kubernetes 集群、需要为节点配置网络插件的运维与开发人员,解决 k8s 安装过程中 flannel 网络组件镜像难以获取、离线环境拉取不便的问题。压缩包共 3 个文件,以 2 个 tar 镜像包和 1 个 yaml 清单为主&#xff0…

2026/10/11 13:12:50 阅读更多 →
面对模糊需求如何落地项目?从rea代号拆解到技术选型与实现

面对模糊需求如何落地项目?从rea代号拆解到技术选型与实现

1. 当标题只剩三个字母:一次“信息真空”下的项目复盘拿到“rea”这个标题的时候,我第一反应是愣了一下。没有项目正文,没有关键词,没有摘要描述,连热搜词和网络热词都是空的。换句话说,这是一个几乎零信息…

2026/10/11 13:11:50 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →