【多模态】19-基于Nomic Embed和Anthropic的多模态RAG系统
案例目标本案例展示如何使用LlamaIndex、Nomic Embed和Anthropic构建一个多模态RAG检索增强生成系统。该系统能够同时处理文本和图像数据实现跨模态的信息检索和生成为用户提供更全面、更准确的答案。技术栈与核心依赖LlamaIndex: 用于构建多模态索引和检索系统Nomic Embed Text v1.5: 用于文本嵌入的模型Nomic Embed Vision v1.5: 用于图像嵌入的模型Anthropic Claude 3: 用于多模态推理和生成Qdrant: 向量数据库用于存储文本和图像嵌入Wikipedia API: 用于获取维基百科文章和图像环境配置%pip install llama-index-vector-stores-qdrant llama-index-multi-modal-llms-anthropic llama-index-embeddings-nomic %pip install llama-index ftfy regex tqdm %pip install matplotlib scikit-image %pip install -U qdrant_client %pip install wikipedia需要设置以下环境变量import os os.environ[NOMIC_API_KEY] your_nomic_api_key os.environ[ANTHROPIC_API_KEY] your_anthropic_api_key案例实现步骤1: 下载维基百科文章文本从维基百科API获取指定主题的文章文本并保存到本地文件夹。from pathlib import Path import requests wiki_titles [ batman, Vincent van Gogh, San Francisco, iPhone, Tesla Model S, BTS, ] data_path Path(data_wiki) for title in wiki_titles: response requests.get( https://en.wikipedia.org/w/api.php, params{ action: query, format: json, titles: title, prop: extracts, explaintext: True, }, ).json() page next(iter(response[query][pages].values())) wiki_text page[extract] if not data_path.exists(): Path.mkdir(data_path) with open(data_path / f{title}.txt, w) as fp: fp.write(wiki_text)步骤2: 下载维基百科图像从维基百科页面下载相关图像并为每个图像分配唯一ID。import wikipedia import urllib.request from pathlib import Path import time image_path Path(data_wiki) image_uuid 0 image_metadata_dict {} MAX_IMAGES_PER_WIKI 30 wiki_titles [ San Francisco, Batman, Vincent van Gogh, iPhone, Tesla Model S, BTS band, ] if not image_path.exists(): Path.mkdir(image_path) for title in wiki_titles: images_per_wiki 0 print(title) try: page_py wikipedia.page(title) list_img_urls page_py.images for url in list_img_urls: if url.endswith(.jpg) or url.endswith(.png): image_uuid 1 image_file_name title _ url.split(/)[-1] image_metadata_dict[image_uuid] { filename: image_file_name, img_path: ./ str(image_path / f{image_uuid}.jpg), } req urllib.request.Request( url, dataNone, headers{ User-Agent: Mozilla/5.0 (Linux; Android 10; K) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Mobile Safari/537.36 }, ) with urllib.request.urlopen(req) as response, open( image_path / f{image_uuid}.jpg, wb ) as out_file: out_file.write(response.read()) images_per_wiki 1 if images_per_wiki MAX_IMAGES_PER_WIKI: break time.sleep(1) except Exception as e: print(e) print(f{images_per_wiki}) continue步骤3: 构建多模态向量存储使用Qdrant创建向量数据库并分别存储文本和图像嵌入。import qdrant_client from llama_index.core import SimpleDirectoryReader from llama_index.vector_stores.qdrant import QdrantVectorStore from llama_index.core import VectorStoreIndex, StorageContext from llama_index.core.indices import MultiModalVectorStoreIndex from llama_index.embeddings.nomic import NomicEmbedding # Create a local Qdrant vector store client qdrant_client.QdrantClient(pathqdrant_db) text_store QdrantVectorStore( clientclient, collection_nametext_collection ) image_store QdrantVectorStore( clientclient, collection_nameimage_collection ) storage_context StorageContext.from_defaults( vector_storetext_store, image_storeimage_store ) embedding_model NomicEmbedding( model_namenomic-embed-text-v1.5, vision_model_namenomic-embed-vision-v1.5, ) # Create the MultiModal index documents SimpleDirectoryReader(./data_wiki/).load_data() index MultiModalVectorStoreIndex.from_documents( documents, storage_contextstorage_context, embed_modelembedding_model, image_embed_modelembedding_model, )步骤4: 创建图像显示函数定义一个函数来显示检索到的图像。import matplotlib.pyplot as plt import os from PIL import Image def plot_images(image_paths): images_shown 0 plt.figure(figsize(16, 9)) for img_path in image_paths: if os.path.isfile(img_path): image Image.open(img_path) plt.subplot(2, 3, images_shown 1) plt.imshow(image) plt.xticks([]) plt.yticks([]) images_shown 1 if images_shown 9: break步骤5: 执行多模态检索使用查询检索相关文本和图像。test_query Who are the band members in BTS? # generate retrieval results retriever index.as_retriever(similarity_top_k3, image_similarity_top_k5) retrieval_results retriever.retrieve(test_query)步骤6: 显示检索结果显示检索到的文本和图像。retrieved_image [] for res_node in retrieval_results: if isinstance(res_node.node, ImageNode): retrieved_image.append(res_node.node.metadata[file_path]) else: display_source_node(res_node, source_length200) plot_images(retrieved_image)步骤7: 初始化多模态查询引擎使用Anthropic的多模态模型创建查询引擎。from llama_index.multi_modal_llms.anthropic import AnthropicMultiModal query_engine index.as_query_engine( llmAnthropicMultiModal(), similarity_top_k2, image_similarity_top_k1 )步骤8: 执行多模态查询使用查询引擎执行查询并获取结果。response query_engine.query( What are Vincent van Goghs famous paintings and popular subjects? ) print(str(response))案例效果系统能够根据用户查询同时检索相关文本和图像并使用Claude 3进行多模态推理。例如当查询梵高的著名画作和流行主题时系统能够检索到相关文本和图像并生成以下回答根据提供的上下文文森特·梵高的一些最著名的画作和流行主题包括- 以大胆的颜色和戏剧性的笔触为特色的风景画、静物画、肖像画和自画像。这促进了现代艺术中表现主义的兴起。- 在他的早期作品中他主要描绘静物和农民劳动者。- 1888年搬到法国南部的阿尔勒后他的画作变得更加明亮他开始关注描绘自然世界包括当地的橄榄林、麦田和向日葵。- 他一些售价超过1亿美元按当今等价价格计算的最昂贵的画作包括《加歇医生的肖像》、《约瑟夫·鲁林的肖像》和《鸢尾花》。- 大都会艺术博物馆于1993年以5700万美元收购了他的画作《麦田与柏树》。总而言之梵高尤其以他居住过的地方如阿尔勒的充满活力、表现力强的风景画、肖像画以及向日葵、橄榄林和麦田等主题的静物画而闻名。他对色彩的大胆运用和厚重、戏剧性的笔触对后来的艺术运动产生了深远影响。案例实现思路数据准备: 从维基百科获取多个主题的文本和图像数据构建多模态数据集。嵌入模型: 使用Nomic Embed的文本和视觉模型分别对文本和图像进行嵌入将它们转换为向量表示。向量存储: 使用Qdrant向量数据库分别存储文本和图像嵌入创建两个不同的集合collection。多模态索引: 使用LlamaIndex的MultiModalVectorStoreIndex创建多模态索引将文本和图像关联起来。检索机制: 根据查询同时检索相关文本和图像使用不同的嵌入模型对查询进行编码。多模态推理: 将检索到的文本和图像传递给Claude 3进行多模态推理和生成。扩展建议更多数据源: 扩展到其他数据源如新闻文章、科学论文、产品目录等。高级检索策略: 实现更复杂的检索策略如重排序、混合检索等。多语言支持: 添加对多语言文本和图像的支持。实时更新: 实现索引的实时更新机制支持动态添加新数据。用户界面: 开发友好的用户界面支持图像上传和交互式查询。性能优化: 优化嵌入和检索过程提高系统响应速度。评估指标: 开发专门的评估指标来衡量多模态RAG系统的性能。总结本案例展示了如何使用LlamaIndex、Nomic Embed和Anthropic构建一个高效的多模态RAG系统。该系统能够同时处理文本和图像数据实现跨模态的信息检索和生成。通过将文本和图像嵌入存储在Qdrant向量数据库中并使用Claude 3进行多模态推理系统能够提供更全面、更准确的答案。这种多模态RAG方法在知识检索、内容分析和智能问答等领域具有广泛的应用前景。

相关新闻

储水式电热水器选购与使用全攻略:从防电墙技术到一级能效解析

储水式电热水器选购与使用全攻略:从防电墙技术到一级能效解析

最近在帮朋友家装修选家电,热水器这块真是让人纠结——既要考虑容量够不够用,又要看加热快不快、省不省电,安全更是头等大事。朋友家四口人,点名要大容量,还要速热,预算还得控制。市面上型号眼花缭乱&#…

2026/8/13 13:19:17 阅读更多 →
LLM智能体分层架构:从任务规划到无人机自主巡检的工程实践

LLM智能体分层架构:从任务规划到无人机自主巡检的工程实践

1. 项目概述:当智能体从代码走向天空最近在工业自动化和AI领域,一个趋势越来越明显:大型语言模型(LLM)驱动的智能体(Agent)不再满足于在数字世界里处理文本、生成代码或分析数据,它们…

2026/8/13 13:19:17 阅读更多 →
Unlock-Music 免费实测:不装软件不传文件,3 分钟把加密歌单解锁成 MP3

Unlock-Music 免费实测:不装软件不传文件,3 分钟把加密歌单解锁成 MP3

Unlock-Music 免费实测:不装软件不传文件,3 分钟把加密歌单解锁成 MP3 【免费下载链接】unlock-music 在浏览器中解锁加密的音乐文件。原仓库: 1. https://github.com/unlock-music/unlock-music ;2. https://git.unlock-music.de…

2026/8/13 13:19:17 阅读更多 →

最新新闻

3个关键步骤,让你从零开始掌握OBS Studio专业直播录制

3个关键步骤,让你从零开始掌握OBS Studio专业直播录制

3个关键步骤,让你从零开始掌握OBS Studio专业直播录制 【免费下载链接】obs-studio OBS Studio - Free and open source software for live streaming and screen recording 项目地址: https://gitcode.com/GitHub_Trending/ob/obs-studio 想象一下&#xff…

2026/8/13 16:21:46 阅读更多 →
3分钟快速掌握:I.Ming传承字形字体完整使用指南

3分钟快速掌握:I.Ming传承字形字体完整使用指南

3分钟快速掌握:I.Ming传承字形字体完整使用指南 【免费下载链接】I.Ming I.Ming ( I.明體 / 一点明朝体 / 一點明體 ) 项目地址: https://gitcode.com/gh_mirrors/im/I.Ming I.Ming(一点明体)是一款基于《传承字形部件检校表》推荐字形…

2026/8/13 16:21:46 阅读更多 →
C语言转义字符详解:从原理到实战避坑指南

C语言转义字符详解:从原理到实战避坑指南

1. 转义字符:C语言中那些“看不见”的字符 写C语言代码,我们每天都在和字符打交道。 printf("Hello, World!"); ,屏幕上就出现了我们熟悉的问候。但有些字符,你想直接写在双引号里,编译器却不认识&#xf…

2026/8/13 16:21:46 阅读更多 →
泛程序批量绑定泛域名实操:一键配置多域名解析流程

泛程序批量绑定泛域名实操:一键配置多域名解析流程

在互联网的世界里,jtaseo泛程序批量绑定泛域名以及一键配置多域名解析流程是很多站长和技术人员关心的重点。今天就来详细介绍下这些核心操作。 首先,什么是泛程序批量绑定泛域名呢?简单来说,就是可以让一个程序同时适配多个域名&…

2026/8/13 16:21:46 阅读更多 →
泛程序站点风控预警设置,提前规避百度平台处罚风险

泛程序站点风控预警设置,提前规避百度平台处罚风险

在互联网的广阔天地中,泛程序站点犹如繁星点点。jtaseo然而,要想在百度平台这片“天空”中长久闪耀,泛程序站点的风控预警设置就显得尤为重要。合理的风控预警设置,能够帮助我们提前规避百度平台的处罚风险,让站点运营…

2026/8/13 16:21:46 阅读更多 →
PDF补丁丁:一站式PDF编辑工具使用全攻略

PDF补丁丁:一站式PDF编辑工具使用全攻略

PDF补丁丁:一站式PDF编辑工具使用全攻略 【免费下载链接】PDFPatcher PDF补丁丁——PDF工具箱,可以编辑书签、剪裁旋转页面、解除限制、提取或合并文档,探查文档结构,提取图片、转成图片等等 项目地址: https://gitcode.com/Git…

2026/8/13 16:20:45 阅读更多 →

日新闻

Visual Studio新建项目解决方案为空:系统性排查与修复指南

Visual Studio新建项目解决方案为空:系统性排查与修复指南

1. 问题现象与本质剖析如果你是一位.NET开发者,或者正准备踏入这个领域,那么Visual Studio(后面简称VS)绝对是你绕不开的伙伴。但有时候,这个伙伴会跟你开一个不大不小的玩笑:你满怀期待地点击“创建新项目…

2026/8/13 0:00:09 阅读更多 →
长春建设厅网站:普通人买房办事必看的真实指南与避坑攻略

长春建设厅网站:普通人买房办事必看的真实指南与避坑攻略

说实话,每次提起“长春建设厅网站”这几个字,我心里都挺有感触的。不是因为它有多高大上,也不是因为那里藏着什么不可告人的秘密,恰恰相反,是因为它太“接地气”了,或者说,它是咱们普通人想要在这个城市好好生活、安稳买房时,必须得翻过的一座“数据山”。很多新朋友第…

2026/8/13 0:00:09 阅读更多 →
Windows家庭版远程桌面多用户破解完整指南:RDPWrap终极解决方案

Windows家庭版远程桌面多用户破解完整指南:RDPWrap终极解决方案

Windows家庭版远程桌面多用户破解完整指南:RDPWrap终极解决方案 【免费下载链接】rdpwrap.ini RDPWrap.ini for RDP Wrapper Library by StasM 项目地址: https://gitcode.com/GitHub_Trending/rd/rdpwrap.ini 你是否曾为Windows家庭版无法支持多用户远程桌面…

2026/8/13 0:00:09 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/13 2:38:34 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/13 10:41:52 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/13 10:41:51 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/13 10:41:50 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/13 10:41:49 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/13 10:41:49 阅读更多 →