AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础
AI编程系列02合并知识功能给 AI 问数和 RAG 场景打基础在上一期「AI编程系列」中我们学习了如何构建一个基础的 AI 问答系统通过简单的输入输出让模型回应问题。但现实世界中的 AI 应用往往需要处理更复杂的场景比如让 AI 从多个文档中提取信息、合并不同来源的知识或者为特定领域如医疗、法律构建一个“会问问题”的智能助手。这些需求背后核心在于“合并知识功能”——让 AI 能够整合分散的数据并基于此进行推理。本文将带你从基础概念出发逐步深入到高级用法通过代码示例理解如何在 RAG检索增强生成场景下实现知识合并。我们会从简单的字符串拼接开始过渡到结构化数据的联合查询最后构建一个可运行的 RAG 原型。请跟随我的节奏一步步夯实基础。## 什么是“合并知识”在 AI 系统中“知识”通常以文本、数据库记录或向量嵌入的形式存在。合并知识功能指的是将多个来源的信息整合在一起形成一个统一的上下文供 AI 模型生成更准确、更丰富的回答。例如- 一个医疗问答系统需要从病历数据库和医学文献中合并信息。- 一个客服机器人需要从产品手册和用户历史记录中提取数据。在 RAG 场景下合并知识是检索后的关键步骤系统先从知识库中检索出相关片段然后将这些片段合并成一个上下文最后让 AI 模型基于上下文生成回答。如果合并不当可能会导致信息冗余、矛盾或丢失关键细节。## 基础实践从字符串合并开始最简单的知识合并是字符串拼接。让我们写一个基础函数它接收多个文本片段将它们合并为一个连贯的上下文。python# 基础字符串合并函数def merge_knowledge_basic(*texts): 将多个文本片段合并为一个字符串每个片段用换行分隔。 参数 *texts: 可变数量的字符串参数 返回 合并后的字符串 # 使用换行符连接所有文本 merged \n.join(texts) return merged# 测试代码knowledge_pieces [ 人工智能的核心是机器学习。, 机器学习包括监督学习和无监督学习。, 深度学习是机器学习的一个子领域。]context merge_knowledge_basic(*knowledge_pieces)print(合并后的上下文)print(context)print(---)# 输出# 合并后的上下文# 人工智能的核心是机器学习。# 机器学习包括监督学习和无监督学习。# 深度学习是机器学习的一个子领域。这个例子虽然简单但已经体现了合并的核心逻辑将分散的信息组织成有序的文本。在实际的 RAG 系统中我们通常需要处理更复杂的情况比如去重、排序或格式化。## 进阶一结构化数据合并与去重当知识来自不同数据库时合并意味着要处理结构化数据如 JSON、字典。例如一个电商问答系统需要合并用户信息、商品详情和订单状态。我们需要确保合并后的数据没有重复并且逻辑清晰。下面代码演示如何从多个字典中合并知识并去除重复的关键信息。pythondef merge_structured_knowledge(knowledge_list): 合并结构化知识列表进行去重和排序。 参数 knowledge_list: 包含多个字典的列表每个字典有 source 和 content 字段 返回 合并后的字符串上下文 # 使用集合去重避免重复内容 seen_contents set() unique_knowledge [] for item in knowledge_list: content item[content] if content not in seen_contents: seen_contents.add(content) unique_knowledge.append(item) # 按来源排序保持一致性 unique_knowledge.sort(keylambda x: x[source]) # 格式化为可读的上下文 merged_lines [] for item in unique_knowledge: line f[{item[source]}] {item[content]} merged_lines.append(line) return \n.join(merged_lines)# 示例数据来自不同来源的知识片段knowledge_data [ {source: 用户手册, content: 产品A支持蓝牙5.0连接。}, {source: FAQ, content: 如何重置产品A长按电源键10秒。}, {source: 用户手册, content: 产品A支持蓝牙5.0连接。}, # 重复项 {source: 技术文档, content: 产品A的固件版本为2.1.0。}]context merge_structured_knowledge(knowledge_data)print(合并后的结构化上下文)print(context)# 输出# 合并后的结构化上下文# [FAQ] 如何重置产品A长按电源键10秒。# [技术文档] 产品A的固件版本为2.1.0。# [用户手册] 产品A支持蓝牙5.0连接。通过去重和排序我们避免了冗余信息并且让上下文更有条理。这为后续的 AI 问答提供了干净的数据基础。## 进阶二给AI“问数”——实现 RAG 场景的合并现在进入核心如何在 RAG 场景中让 AI 能够“问数”即基于合并的知识进行问答。RAG 的基本流程是1. 用户提问。2. 系统从知识库中检索相关片段。3. 系统合并这些片段为上下文。4. 系统将上下文和问题一起发送给 AI 模型。下面我们构建一个简易的 RAG 原型用本地文本模拟知识库并实现合并功能。pythonimport random# 模拟知识库一个简单的字典键是知识ID值是文本knowledge_base { k1: 太阳是太阳系的中心天体直径约139万公里。, k2: 地球是太阳系八大行星之一距离太阳约1.5亿公里。, k3: 月球是地球唯一的天然卫星直径约3474公里。, k4: 太阳系形成于约46亿年前由星际物质凝聚而成。, k5: 地球的年龄约为45.4亿年。,}def retrieve_knowledge(query, top_k2): 模拟检索根据关键词从知识库中检索相关片段。 这里使用简单的关键词匹配。 参数 query: 用户查询字符串 top_k: 返回的片段数量 返回 检索到的知识片段列表 # 简单实现将查询拆分为词然后匹配知识库中的文本 query_words query.lower().split() scored_items [] for key, text in knowledge_base.items(): score sum(1 for word in query_words if word in text.lower()) scored_items.append((score, key, text)) # 按得分排序取top_k个 scored_items.sort(reverseTrue) top_items scored_items[:top_k] return [item[2] for item in top_items] # 返回文本列表def merge_and_answer(query): 合并知识并生成回答。 参数 query: 用户问题 返回 生成回答的字符串 # 步骤1检索相关知识 retrieved_texts retrieve_knowledge(query, top_k2) # 步骤2合并知识为上下文 context \n.join(retrieved_texts) # 步骤3模拟AI生成回答实际应用中会调用大模型 # 这里我们根据合并的上下文直接生成简单回答 if context: # 模拟回答逻辑从上下文中提取关键信息 answer_parts [] for text in retrieved_texts: # 简单提取假设每个文本的第一句就是答案 first_sentence text.split(。)[0] 。 answer_parts.append(first_sentence) answer 根据以下知识\n context \n\n我的回答是\n .join(answer_parts) else: answer 没有找到相关知识。 return answer# 测试用户询问关于太阳的问题user_query 太阳是什么result merge_and_answer(user_query)print(result)# 输出示例# 根据以下知识# 太阳是太阳系的中心天体直径约139万公里。# 太阳系形成于约46亿年前由星际物质凝聚而成。# # 我的回答是# 太阳是太阳系的中心天体直径约139万公里。 太阳系形成于约46亿年前由星际物质凝聚而成。在这个例子中我们模拟了 RAG 的完整流程。retrieve_knowledge函数根据关键词检索知识merge_and_answer将检索结果合并后生成回答。虽然这里的“生成”只是简单拼接但实际应用中你可以把合并后的上下文传递给一个大语言模型如 GPT-4让模型基于上下文生成更自然的回答。## 高级用法动态权重与多源合并在实际项目中知识源可能具有不同的重要性。例如权威文献的权重高于用户评论。我们可以引入动态权重机制在合并时调整知识片段的优先级。pythondef merge_with_weights(knowledge_list, weights): 根据权重合并知识权重高的片段排在前面。 参数 knowledge_list: 知识片段列表每个元素是字典 {source: ..., content: ...} weights: 字典键是来源值是权重浮点数 返回 合并后的字符串 # 为每个片段计算权重 scored_items [] for item in knowledge_list: source item[source] weight weights.get(source, 0.5) # 默认权重0.5 scored_items.append((weight, item)) # 按权重降序排序 scored_items.sort(reverseTrue) # 合并 merged_lines [] for weight, item in scored_items: line f[{item[source]}(权重{weight})] {item[content]} merged_lines.append(line) return \n.join(merged_lines)# 示例不同来源的权重weights_dict { 技术文档: 0.9, 用户手册: 0.8, FAQ: 0.6, 用户评论: 0.3}knowledge_data [ {source: 用户手册, content: 产品A支持蓝牙5.0连接。}, {source: FAQ, content: 如何重置产品A长按电源键10秒。}, {source: 技术文档, content: 产品A的固件版本为2.1.0。}, {source: 用户评论, content: 产品A的电池续航很好。}]context merge_with_weights(knowledge_data, weights_dict)print(按权重合并后的上下文)print(context)# 输出# [技术文档(权重0.9)] 产品A的固件版本为2.1.0。# [用户手册(权重0.8)] 产品A支持蓝牙5.0连接。# [FAQ(权重0.6)] 如何重置产品A长按电源键10秒。# [用户评论(权重0.3)] 产品A的电池续航很好。通过权重排序AI 模型在生成回答时会更关注高权重的知识源从而提高回答的准确性和权威性。## 总结本文从基础概念出发带你逐步掌握了“合并知识功能”在 AI 编程中的应用。我们从简单的字符串拼接开始学习了结构化数据的去重与排序构建了一个完整的 RAG 原型并探索了动态权重的合并策略。这些技术是构建智能问答系统、专业领域助手如医疗、法律 RAG的基础。核心要点回顾- 合并知识是将分散信息整合为统一上下文的过程。- 在 RAG 场景中合并是检索和生成之间的关键桥梁。- 实现合并时要考虑去重、排序、权重等因素以提升回答质量。下一期我们将继续深入 RAG 的核心技术比如向量检索与语义理解。请保持实践动手运行本文的代码尝试修改参数或扩展知识库看看合并功能如何影响 AI 的回答。编程之路贵在坚持。

相关新闻

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/9/21 11:48:39 阅读更多 →
研发 / 运营通用轻量化 AI 办公工作流搭建方案,5 类工具一站式统一管理

研发 / 运营通用轻量化 AI 办公工作流搭建方案,5 类工具一站式统一管理

在日常开发文档撰写、项目汇报、行业资料调研、短视频素材制作场景中,我们都会借助各类线上 AI 工具降低重复工作量。目标:搭建极简、闭环、可复用的标准化办公工作流,一套工具覆盖 90% 文职、研发、自媒体内容生产场景。🎯个人小…

2026/9/19 13:37:41 阅读更多 →
3分钟开启本地AI对话:TextGen桌面应用完整指南

3分钟开启本地AI对话:TextGen桌面应用完整指南

3分钟开启本地AI对话:TextGen桌面应用完整指南 【免费下载链接】textgen Open-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private. 项目地址: https://gitcode.com/GitHub_Trending/te/textgen …

2026/9/19 10:33:33 阅读更多 →

最新新闻

STM32软件SPI驱动1.8寸TFT-LCD完整教程

STM32软件SPI驱动1.8寸TFT-LCD完整教程

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/21 10:22:15 阅读更多 →
PCIe 5.0交换芯片如何破解AI集群GPU互联瓶颈

PCIe 5.0交换芯片如何破解AI集群GPU互联瓶颈

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/21 10:22:15 阅读更多 →
2026跨部门协同研发管理系统选型指南:避开踩坑实战解析

2026跨部门协同研发管理系统选型指南:避开踩坑实战解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/21 10:22:14 阅读更多 →
外贸建站用什么平台好?新手入门避坑指南

外贸建站用什么平台好?新手入门避坑指南

外贸建站用什么平台好?新手入门避坑指南 网站做好了没人访问,这是90%外贸新手最崩溃的时刻。你花了几万块定制开发,页面精美得像杂志,但打开百度或谷歌搜产品,根本找不到你。别慌,这通常不是内容的问题,而是 技术选型 从一开始就错了。…

2026/9/21 9:45:18 阅读更多 →
一个服务器上有两个网站要备案两次吗?源码下载避坑指南

一个服务器上有两个网站要备案两次吗?源码下载避坑指南

一个服务器上有两个网站要备案两次吗?源码下载避坑指南 别再死磕那些丑得令人发指的模板网站了,真的,看着都尴尬。很多新手为了省事,直接去搜“源码下载”,结果装出来的页面配色像上世纪的网吧,布局挤得像早高峰的地铁,客户一眼就能看穿你的不专业。更头疼的是,当你终于搞定两个网站,准备绑上服务器时,卡在了备案…

2026/9/21 9:30:07 阅读更多 →
个人博客网页设计论文选题怎么选,3个维度避开域名服务器坑

个人博客网页设计论文选题怎么选,3个维度避开域名服务器坑

个人博客网页设计论文选题怎么选,3个维度避开域名服务器坑 域名解析报错 502,服务器内存爆满,这种“代码写得好,上线就抓瞎”的尴尬,是不是你写个人博客网页设计论文时的真实写照?很多同学在选题和实操阶段,死磕 CSS 动画或 JS 交互,却对最底层的域名绑定和服务器配置一知半解。…

2026/9/21 9:16:31 阅读更多 →

日新闻

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程 【免费下载链接】agentic-awesome-skills AAS Core is the local, agent-first control plane for complete catalog discovery, agent-owned selection, stack validation, and …

2026/9/21 0:00:01 阅读更多 →
gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析

gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析

gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析 【免费下载链接】gin-vue-admin 🚀ViteVue3Gin拥有AI辅助的基础开发平台,企业级业务AI开发解决方案,内置mcp辅助服务,内置skills管理,…

2026/9/21 0:00:01 阅读更多 →
Wox 全功能插件开发实战指南:基于 Python / Node.js 宿主与 WebSocket 的持久化插件体系

Wox 全功能插件开发实战指南:基于 Python / Node.js 宿主与 WebSocket 的持久化插件体系

桌面应用AI 应用插件系统 【免费下载链接】Wox A cross-platform launcher that simply works 项目地址: https://gitcode.com/gh_mirrors/wo/Wox 点击查看 免费下载 全功能插件(Full-featured Plugin)是 Wox 三类插件实现方式中能力最完整的…

2026/9/21 0:00:01 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/21 3:13:20 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/21 2:19:36 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/21 4:51:05 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/19 23:01:36 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/19 17:50:38 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →