将 Embedding 模型加载到 Elasticsearch 中
本工作簿使用一个由 Elastic 博客标题组成的简单数据集在 Elasticsearch 中实现 NLP 文本搜索。你将索引博客文档并使用 ingest pipeline 生成文本 embedding。随后通过使用 NLP 模型你可以使用自然语言对这些博客文档进行查询。更多阅读Elasticsearch如何部署文本嵌入模型并将其用于语义搜索前提条件在开始之前请创建一个 Elastic Cloud deployment并启用 autoscale确保至少有一个具有足够4GB内存的机器学习ML节点。同时确保 Elasticsearch 集群正在运行。如果你还没有 Elastic deployment可以注册免费的 Elastic Cloud 试用版。安装软件包并导入模块!python3 -m pip install sentence-transformers2.7.0 eland elasticsearch transformers开始之前你需要安装所有必需的 Python 依赖项。!python3 -m pip install sentence-transformers2.7.0 eland9 elasticsearch9 transformers # 导入模块 from elasticsearch import Elasticsearch from getpass import getpass from urllib.request import urlopen import json from time import sleep部署 NLP 模型我们使用eland工具安装一个text_embedding模型。这里使用all-MiniLM-L6-v2模型将搜索文本转换为 dense vector。该模型会将你的搜索查询转换为向量用于在存储于 Elasticsearch 中的文档集合上执行搜索。安装文本 embedding NLP 模型使用eland_import_hub_model脚本下载并安装all-MiniLM-L6-v2Transformer 模型并将 NLP 的--task-type设置为text_embedding。要获取 Cloud ID请进入 Elastic Cloud在 deployment 概览页面复制 Cloud ID。为了验证请求身份你可以使用 API key。或者也可以使用 Cloud deployment 的用户名和密码。# https://www.elastic.co/search-labs/tutorials/install-elasticsearch/elastic-cloud#finding-your-cloud-id ELASTIC_CLOUD_ID getpass(Elastic Cloud ID: ) # https://www.elastic.co/search-labs/tutorials/install-elasticsearch/elastic-cloud#creating-an-api-key ELASTIC_API_KEY getpass(Elastic Api Key: )!eland_import_hub_model \ --cloud-id $ELASTIC_CLOUD_ID \ --hub-model-id sentence-transformers/all-MiniLM-L6-v2 \ --task-type text_embedding \ --es-api-key $ELASTIC_API_KEY \ --start \ --clear-previous连接到 Elasticsearch 集群使用 deployment 的 Cloud ID 和 API Key 创建一个 Elasticsearch client 实例。在本示例中我们使用上一步中的API_KEY和CLOUD_ID。你也可以使用 deployment 的用户名和密码进行身份验证。es Elasticsearch( cloud_idELASTIC_CLOUD_ID, api_keyELASTIC_API_KEY, request_timeout600 ) es.info() # 应返回集群信息创建 Ingest Pipeline我们需要创建一个文本 embedding ingest pipeline为title字段生成向量文本embedding。下面的 pipeline 定义了一个 processor用于调用 NLP 模型执行 inference。# ingest pipeline 定义 PIPELINE_ID vectorize_blogs es.ingest.put_pipeline( idPIPELINE_ID, processors[ { inference: { model_id: sentence-transformers__all-minilm-l6-v2, target_field: text_embedding, field_map: {title: text_field}, } } ], )创建带有 mapping 的索引现在在索引文档之前我们先创建一个具有正确 mapping 的 Elasticsearch 索引。我们添加text_embedding字段用于包含model_id和predicted_value以存储 embedding。# 定义索引名称 INDEX_NAME blogs # 标志用于检查创建索引前是否删除已有索引 SHOULD_DELETE_INDEX True # 定义索引 mapping INDEX_MAPPING { properties: { title: { type: text, fields: { keyword: { type: keyword, ignore_above: 256 } }, }, text_embedding: { properties: { is_truncated: { type: boolean }, model_id: { type: text, fields: { keyword: { type: keyword, ignore_above: 256 } }, }, predicted_value: { type: dense_vector, dims: 384, index: True, similarity: l2_norm, }, } }, } } INDEX_SETTINGS { index: { number_of_replicas: 1, number_of_shards: 1, default_pipeline: PIPELINE_ID, } } # 检查是否需要在创建索引前删除已有索引 if SHOULD_DELETE_INDEX: if es.indices.exists(indexINDEX_NAME): print(Deleting existing %s % INDEX_NAME) es.indices.delete(indexINDEX_NAME, ignore[400, 404]) print(Creating index %s % INDEX_NAME) es.indices.create( indexINDEX_NAME, mappingsINDEX_MAPPING, settingsINDEX_SETTINGS, ignore[400, 404] )将数据索引到 Elasticsearch现在使用 ingest pipeline 索引示例博客数据。注意在开始索引之前请确保你已经启动训练好的模型 deployment。url https://raw.githubusercontent.com/elastic/elasticsearch-labs/main/notebooks/integrations/hugging-face/blogs.json response urlopen(url) titles json.loads(response.read()) actions [] for title in titles: actions.append({index: {_index: blogs}}) actions.append(title) es.bulk(indexblogs, operationsactions) sleep(5)查询数据集下一步是执行查询搜索相关博客。下面的示例使用我们上传到 Elasticsearch 的sentence-transformers__all-minilm-l6-v2模型对model_text: how to track network connections进行搜索。整个过程只需一次查询尽管内部实际上包含两个步骤。首先查询会使用 NLP 模型为搜索文本生成一个向量然后使用该向量在数据集中执行搜索。最终输出将显示按与搜索查询接近程度排序的文档列表。INDEX_NAME blogs source_fields [id, title] query { field: text_embedding.predicted_value, k: 5, num_candidates: 50, query_vector_builder: { text_embedding: { model_id: sentence-transformers__all-minilm-l6-v2, model_text: how to track network connections, } }, } response es.search( indexINDEX_NAME, fieldssource_fields, knnquery, sourceFalse, ) def show_results(results): for result in results: print( f{result[fields][title]}\n fScore: {result[_score]}\n ) show_results(response.body[hits][hits])输出[Brewing in Beats: Track network connections] Score: 0.5917864 [Machine Learning for Nginx Logs - Identifying Operational Issues with Your Website] Score: 0.40109876 [Data Visualization For Machine Learning] Score: 0.39027885 [Logstash Lines: Introduce integration plugins] Score: 0.36899462 [Keeping up with Kibana: This week in Kibana for November 29th, 2019] Score: 0.35690257原文https://www.elastic.co/search-labs/tutorials/examples/nlp-model-vector-search-elasticsearch

相关新闻

RxJavaExtensions调试指南:3步定位复杂响应式流问题,开发效率翻倍

RxJavaExtensions调试指南:3步定位复杂响应式流问题,开发效率翻倍

RxJavaExtensions调试指南:3步定位复杂响应式流问题,开发效率翻倍 【免费下载链接】RxJavaExtensions RxJava 4.x extra sources, operators and components and ports of many 1.x companion libraries. 项目地址: https://gitcode.com/gh_mirrors/rx…

2026/8/4 23:47:38 阅读更多 →
Rofunc与Isaac Gym集成:打造高性能机器人强化学习训练平台

Rofunc与Isaac Gym集成:打造高性能机器人强化学习训练平台

Rofunc与Isaac Gym集成:打造高性能机器人强化学习训练平台 【免费下载链接】Rofunc 🤖 The Full Process Python Package for Robot Learning from Demonstration and Robot Manipulation 项目地址: https://gitcode.com/gh_mirrors/ro/Rofunc Ro…

2026/8/4 23:47:38 阅读更多 →
5分钟解锁QQ音乐加密音频:qmcdump完全使用指南

5分钟解锁QQ音乐加密音频:qmcdump完全使用指南

5分钟解锁QQ音乐加密音频:qmcdump完全使用指南 【免费下载链接】qmcdump 一个简单的QQ音乐解码(qmcflac/qmc0/qmc3 转 flac/mp3),仅为个人学习参考用。 项目地址: https://gitcode.com/gh_mirrors/qm/qmcdump 还在为QQ音乐…

2026/8/4 23:47:38 阅读更多 →

最新新闻

正则表达式——匹配单个字符

正则表达式——匹配单个字符

匹配单个字符1、匹配纯文本1.1、有多个匹配结果1.2、字母的大小写问题2、匹配任意字符3、匹配特殊字符1、匹配纯文本 Ben是一个正则表达式。因为本身是纯文本,所以看起来可能不像是一个正则表达式,但它的确是。正则表达式可以包含纯文本(甚至…

2026/8/5 1:09:28 阅读更多 →
195、TinyML实战项目:智能水产养殖与监测

195、TinyML实战项目:智能水产养殖与监测

TinyML实战项目:智能水产养殖与监测 从一次鱼塘溶氧量报警误触发说起 凌晨三点,手机突然狂震。客户鱼塘的溶氧量监测系统报警——溶氧量低于2mg/L,紧急增氧指令已下发。我揉着眼睛打开后台,数据曲线显示溶氧量在凌晨两点五十分从5.8mg/L断崖式跌到1.9mg/L。但直觉告诉我不…

2026/8/5 1:09:28 阅读更多 →
SMAPI终极指南:5分钟快速上手星露谷物语模组加载器

SMAPI终极指南:5分钟快速上手星露谷物语模组加载器

SMAPI终极指南:5分钟快速上手星露谷物语模组加载器 【免费下载链接】SMAPI The modding API for Stardew Valley. 项目地址: https://gitcode.com/gh_mirrors/smap/SMAPI SMAPI(Stardew Valley Modding API)是星露谷物语官方认可的模组…

2026/8/5 1:09:28 阅读更多 →
重庆大学LaTeX毕业论文模板终极指南:3步告别格式烦恼

重庆大学LaTeX毕业论文模板终极指南:3步告别格式烦恼

重庆大学LaTeX毕业论文模板终极指南:3步告别格式烦恼 【免费下载链接】CQUThesis :pencil: 重庆大学毕业论文LaTeX模板---LaTeX Thesis Template for Chongqing University 项目地址: https://gitcode.com/gh_mirrors/cq/CQUThesis 还在为毕业论文格式调整而…

2026/8/5 1:09:28 阅读更多 →
Depth-Anything-V2:快速上手单目深度估计的完整指南

Depth-Anything-V2:快速上手单目深度估计的完整指南

Depth-Anything-V2:快速上手单目深度估计的完整指南 【免费下载链接】Depth-Anything-V2 [NeurIPS 2024] Depth Anything V2. A More Capable Foundation Model for Monocular Depth Estimation 项目地址: https://gitcode.com/gh_mirrors/de/Depth-Anything-V2 …

2026/8/5 1:09:28 阅读更多 →
本地离线 AI 优势拉满,OpenClaw 部署设置保护办公数据不外流

本地离线 AI 优势拉满,OpenClaw 部署设置保护办公数据不外流

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性极强的本地智能工具,凭借其本地离线运行、可视化图形操作与任务自动化三大核心特性,深受用户青睐。与普通的在线对话 AI 工具不同,它是一款能够直接操控本机软硬件的智能数字员工…

2026/8/5 1:08:28 阅读更多 →

日新闻

Java缓存框架:JetCache

Java缓存框架:JetCache

TOC 一、简介 JetCache 是一个 Java 缓存抽象框架,为不同的缓存解决方案提供了统一的使用方式。 它提供的注解比 Spring Cache 更加强大。 JetCache 的注解支持原生 TTL、两级缓存以及在分布式环境中的自动刷新功能,同时你也可以通过代码直接操作 Cach…

2026/8/5 0:00:43 阅读更多 →
AD 铺铜设置十字连接,过孔全连接,新版AD的简单设置

AD 铺铜设置十字连接,过孔全连接,新版AD的简单设置

需求:通孔焊盘 十字花;过孔 Via 实心直连;贴片焊盘按需设置 AD 测试版本AD24 很多工程师踩坑:全部统一十字,导致接地过孔阻抗高、大电流发热! 一、快捷键打开规则 PCB 界面按下:D R 展开…

2026/8/5 0:00:43 阅读更多 →
AI素描转换技术深度拆解(2024最新论文+工业级落地代码):从Stable Diffusion ControlNet到LoRA微调全链路解析

AI素描转换技术深度拆解(2024最新论文+工业级落地代码):从Stable Diffusion ControlNet到LoRA微调全链路解析

更多请点击: https://kaifayun.com 第一章:AI生成素描效果 AI生成素描效果是计算机视觉与风格迁移技术融合的典型应用,其核心在于将彩色照片或RGB图像转换为具有手绘质感、明暗对比强烈、边缘清晰的单色素描图像。该过程通常依赖于深度学习模…

2026/8/5 0:00:43 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/4 13:24:41 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/4 11:41:39 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/4 5:26:40 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/4 13:38:24 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/4 11:09:16 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/4 13:38:40 阅读更多 →