使用 GPUStack 对接 MaxKB:构建本地知识库 AI 助手的完整实战指南
后端人工智能模型推理服务集群管理可观测性【免费下载链接】gpustackA GPU cluster manager for high-performance AI model serving (vLLM, SGLang) and on-demand SSH-accessible GPU instances.项目地址https://gitcode.com/gh_mirrors/gp/gpustack点击查看免费下载本文介绍如何将 GPUStack 中本地部署的大语言模型LLM、Embedding 向量模型与 Rerank 重排序模型接入 MaxKB从而为 MaxKB 知识库问答提供完全私有化的模型能力。读完本文你将掌握从模型部署、API 访问信息获取、MaxKB 部署与模型配置到创建知识库与发布 AI Agent 的完整闭环流程并理解/v2/rerank端点为何需要启用 Generic Proxy 的底层原理。集成方案总览MaxKB 是开源的智能知识库问答系统支持接入大语言模型、Embedding 模型和 Rerank 模型用于构建基于私有知识库的 AI 助手。GPUStack 作为统一的 GPU 集群管理与模型服务平台为 MaxKB 提供三个关键角色对话模型负责根据检索到的知识生成回答如qwen3.5-35b-a3bEmbedding 模型负责将知识库文档切分后的片段向量化供语义检索使用如qwen3-embedding-4bRerank 模型负责对检索结果进行重排序提升答案相关性如qwen3-reranker-4b。三者配合MaxKB 才能完成知识入库 → 语义检索 → 重排序 → 大模型生成的完整知识问答链路。第一步在 GPUStack 中部署模型进入部署页面在 GPUStack UI 中导航到Deployments部署页面点击Deploy Model部署模型按钮即可开始部署所需的模型。GPUStack 内置模型目录model-catalog.yaml其中收录了 Qwen3 系列 Embedding 与 Reranker 模型可直接从目录选择无需手工填写 Hugging Face 模型 ID。本指南以三个模型为例模型用途备注qwen3.5-35b-a3b对话生成Chat混合专家架构激活参数约 3.5B适合作为知识问答的生成模型qwen3-embedding-4b文本向量化Embedding多语言 Embedding 模型支持指令调优instruction tuningqwen3-reranker-4b相关性重排序Rerank对候选文档片段按与查询的相关性打分排序说明Embedding 与 Reranker 类模型推理资源占用较小通常会由 GPUStack 调度到与推理后端如 vLLM兼容的 GPU 节点上。从 GPUStack 调度器对模型类别的处理看参见 vllm_resource_fit_selector.pyEmbedding 与 Reranker 模型在资源适配上有专门的处理逻辑可放心部署。依次完成以下部署qwen3.5-35b-a3b在 Deploy Model 中选择该模型确认推理后端与显存配置后点击部署qwen3-embedding-4b作为 Embedding 模型部署qwen3-reranker-4b作为 Rerank 模型部署。在 Playground 中验证模型模型部署完成后建议先在 GPUStack 的Playground模型测试台中分别验证三个模型是否能正常响应确认推理服务正常后再进行 MaxKB 对接。第二步获取模型访问信息MaxKB 需要通过 OpenAI 兼容接口访问 GPUStack 上的模型因此需要从 GPUStack 获取三项关键信息Base URL、Model Name 与 API Key。获取 Base URL 与 Model Name在 GPUStack 左侧边栏打开Routes模型路由页面在对应模型路由右侧点击More actions menu更多操作菜单选择API Access InfoAPI 访问信息。记录以下信息Base URL Model Name API Key其中 Base URL 的格式为http://your-gpustack-url/v1即 GPUStack 对外提供的 OpenAI 兼容 API 入口。GPUStack 的 API 网关对/v1下的/chat/completions、/embeddings等 OpenAI 风格路径做统一路由参见 gateway/utils.py 中openai_model_prefixes的定义这也是 MaxKB 能直接填写该地址的原因。示例Base URL: http://your-gpustack-url/v1 Model Name: qwen3.5-35b-a3b qwen3-embedding-4b qwen3-reranker-4b API Key: gpustack_xxxxxxxxxxxxx创建 API Key提示如果还没有 API Key可以按照 GPUStack UI 中的引导提示创建一个 API Key。API Key 以gpustack_前缀开头是 MaxKB 访问 GPUStack 模型接口的凭证请妥善保管。第三步部署 MaxKBMaxKB 官方提供 Docker 镜像可通过一条命令完成部署docker run -d \ --name maxkb \ --restart always \ -p 8080:8080 \ -v ~/.maxkb:/opt/maxkb \ 1panel/maxkb参数说明参数含义--name maxkb容器名称--restart always容器异常退出后自动重启保证服务可用性-p 8080:8080将容器内 8080 端口映射到宿主机 8080 端口-v ~/.maxkb:/opt/maxkb将数据卷挂载到宿主机~/.maxkb目录持久化知识库与配置启动成功后访问http://your-server:8080即可进入 MaxKB 登录页面。默认登录凭证admin / MaxKB123..首次登录后请按照页面提示修改默认密码避免默认凭证暴露带来的安全风险。第四步在 MaxKB 中接入 GPUStack 模型添加对话模型在 MaxKB UI 顶部的导航栏中点击Model模型进入模型管理页面。点击Add Model添加模型配置模型信息配置要点如下Base Model基础模型必须与 GPUStack 中部署的模型名称完全一致即qwen3.5-35b-a3bAPI URL接口地址填写http://your-gpustack-url/v1API Key接口密钥填写在 GPUStack 中创建的 API Key。注意API URL和API Key两个输入框会在输入 Base Model 并按下回车键之后才出现这是 MaxKB 根据模型名称自动识别供应商类型后的正常交互流程按顺序填写即可。添加 Embedding 与 Rerank 模型用同样的方法依次添加另外两个模型qwen3-embedding-4bEmbedding 模型qwen3-reranker-4bRerank 模型在配置该模型时需要开启 Generic Proxy通用代理。为什么 Rerank 模型必须开启 Generic Proxy原因是 MaxKB 调用 Rerank 模型时使用的是以下端点/v2/rerank这与标准 OpenAI 接口路径不同。GPUStack 的 API 网关专门为 Rerank 端点做了版本兼容处理在 gateway/utils.py 中/rerank路径被声明了additional_versions[/v2]即同时支持/v1/rerank与/v2/rerank两种访问形式请求会由 rerank.py 中的POST /rerank路由接收并代理转发到对应模型实例。开启 Generic Proxy 后MaxKB 才能正确访问/v2/rerank端点完成重排序调用。校验模型列表三个模型全部配置完成后应能在模型列表中看到它们第五步创建知识库在 MaxKB 中导航到Knowledge知识页面点击Create创建选择Web Knowledge网页知识库类型。输入一个文档 URL 或其他数据源地址MaxKB 会自动爬取并解析页面内容然后使用已配置的 Embedding 模型将其向量化存入知识库。爬取完成后的知识库状态提示除了 Web KnowledgeMaxKB 还支持文档上传等其他知识库类型均可复用 GPUStack 提供的 Embedding 模型完成向量化。第六步创建并发布 AI Agent进入Agent智能体页面点击Create创建新建一个智能体。为智能体配置Chat model对话模型选择qwen3.5-35b-a3bKnowledge base知识库选择上一步创建的知识库Retrieval settings检索设置配置召回数量、相似度阈值等检索参数Rerank 模型会在此环节对召回片段重排序。配置完成后点击Publish发布激活智能体。第七步开始对话打开智能体的聊天界面即可开始与基于知识库的 AI 助手交互此时助手可以基于已连接的知识库与 GPUStack 上部署的模型回答与知识库内容相关的问题——对话生成由 LLM 完成语义检索由 Embedding 模型支撑相关性优化由 Rerank 模型负责整个问答链路完全运行在本地 GPU 集群上无需依赖外部模型服务。常见问题排查现象可能原因处理建议MaxKB 添加模型后测试报错API URL 或 API Key 填写错误核对http://your-gpustack-url/v1与gpustack_开头的 API KeyRerank 模型调用失败未启用 Generic Proxy在模型配置中开启 Generic Proxy确保可访问/v2/rerank端点知识库向量化失败Embedding 模型未部署或未在 MaxKB 中配置先在 GPUStack Playground 验证 Embedding 模型可用再确认 MaxKB 已添加对应模型问答检索结果相关性差Rerank 模型未生效或检索参数不当确认 Rerank 模型已配置并检查检索设置中的召回数量与阈值总结通过 GPUStack MaxKB 的组合可以在本地 GPU 集群上构建一套完整的私有化知识库问答系统GPUStack 负责模型部署、路由与 OpenAI 兼容 API 暴露MaxKB 负责知识库管理、检索增强与 Agent 编排。本指南涉及的三个模型角色Chat / Embedding / Rerank与/v2/rerank端点适配是集成成败的关键按照本文步骤逐一配置即可快速上线。赞分享后端人工智能模型推理服务集群管理可观测性【免费下载链接】gpustackA GPU cluster manager for high-performance AI model serving (vLLM, SGLang) and on-demand SSH-accessible GPU instances.项目地址https://gitcode.com/gh_mirrors/gp/gpustack点击查看免费下载相关推荐PrivateGPT完整部署指南构建本地AI知识库的实用教程PrivateGPT完整部署指南构建本地AI知识库的实用教程 PrivateGPT为企业级用户提供了安全可靠的本地AI知识库解决方案通过智能文档解析和向量检人工智能大模型RAG本地部署LLM 网关后端如何快速搭建企业级AI知识库MaxKB从零开始的完整指南如何快速搭建企业级AI知识库MaxKB从零开始的完整指南 在数字化转型加速的今天企业对智能知识管理的需求日益迫切。MaxKB作为一款强大易用的开源企业级智能人工智能大模型AI AgentRAG工具调用后端前端知识库Android照片管理革命从杂乱到有序的智能解决方案Android照片管理革命从杂乱到有序的智能解决方案 在数字时代我们的手机相册往往充斥着成千上万张杂乱无章的照片。重要时刻被淹没在大量相似图片中隐私照片缺后端人工智能模型推理服务集群管理可观测性上一篇4个关键步骤让老款Mac重获新生OpenCore Legacy Patcher完整指南下一篇如何快速掌握REFramework面向新手的RE引擎游戏改造终极指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

IBPS网上支付跨行清算系统:架构、业务流转与清算机制全解析

IBPS网上支付跨行清算系统:架构、业务流转与清算机制全解析

简介:这份PPT系统讲解网上支付跨行清算系统(IBPS)的基本功能与操作流程,面向金融行业从业者、银行清算人员及高校金融信息化课程学习者,帮助理解网银跨行支付实时性不足、缺乏公共清算平台等痛点问题及对应解决方案。内…

2026/10/4 14:32:27 阅读更多 →
MRAM选型实战:MR25H40CDF与STM32L442KC工业存储方案

MRAM选型实战:MR25H40CDF与STM32L442KC工业存储方案

1. 为什么我最终选了 MR25H40CDF 搭配 STM32L442KC1.1 一个真实项目场景引出的存储需求去年接手一个工业数据采集终端的项目,设备装在配电柜里,要求每 100ms 采集一次三相电流电压,断电后关键数据不能丢,而且设备要连续跑五年以上…

2026/10/4 14:32:27 阅读更多 →
【清华代码熊】DeepSeek V4.1 Flash 后训练详解

【清华代码熊】DeepSeek V4.1 Flash 后训练详解

📌 上期解析了 DeepSeek V4.1 Flash 模型架构改进,本期解析 DeepSeek V4.1 Flash 预训练/后训练技术: 🌟 预训练:45T 文本 多模态混合语料、直接训练 sparse attention(取消 DeepSeek V4 的 dense 冷启动&…

2026/10/4 14:32:27 阅读更多 →

最新新闻

写罪犯心理矫正论文,别让 AI 替你“拍脑袋”:一份按环节挑工具的实用清单 [特殊字符]

写罪犯心理矫正论文,别让 AI 替你“拍脑袋”:一份按环节挑工具的实用清单 [特殊字符]

如果你读的是公安与司法大类 / 司法技术类 / 罪犯心理测量与矫正技术,大概率会遇到一类很典型的毕业任务: 围绕监所中的某类心理问题,完成一份“心理测评 矫正方案设计”论文。 例如:《短刑犯焦虑情绪测评及认知行为团体矫正方案…

2026/10/4 15:16:56 阅读更多 →
大语言模型学习之大模型技术基础和GPT、DeepSeek模型介绍:用TaoToken统一Key跑通三类模型调用

大语言模型学习之大模型技术基础和GPT、DeepSeek模型介绍:用TaoToken统一Key跑通三类模型调用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 15:16:55 阅读更多 →
【MLLM Agent】多模态理解Agent研究进展

【MLLM Agent】多模态理解Agent研究进展

note 方案选型: 做图片输入 function call 通用多模态 Agent → 优先看DeepSeek‑Harness MTA‑Agent;做图片多轮检索求证 → DR‑MMSearchAgent;做长文档图文问答 → MDocAgent;做成本优化、工具调用节流 → ToolGate&#xf…

2026/10/4 15:16:55 阅读更多 →
MR25H40CDF+STM32F302R8工业级非易失数据存储方案

MR25H40CDF+STM32F302R8工业级非易失数据存储方案

1. 项目概述:为什么选 MR25H40CDF STM32F302R8 这对组合做工业级数据存储?在工业现场和嵌入式设备里,数据存储从来不是“随便找个 Flash 芯片焊上去”就能了事的事。我做过十几个带数据记录功能的产线控制器、边缘采集盒和智能传感器节点&am…

2026/10/4 15:16:55 阅读更多 →
渲染管线与Shader实战:从漫反射到Blinn-Phong

渲染管线与Shader实战:从漫反射到Blinn-Phong

我最早接触“着色”这个概念的时候,完全是一头雾水。那时候拿到一个图形学作业,想给一个模型加个高光,翻来覆去调了半天材质参数,结果渲染出来该黑的地方还是黑,镜面反射亮得像是打了荧光。后来才明白,问题…

2026/10/4 15:16:55 阅读更多 →
ESP32-P4+C5双芯驱动:不堆模块,这块屏自己就是网关

ESP32-P4+C5双芯驱动:不堆模块,这块屏自己就是网关

1. 这块屏凭什么敢叫自己网关第一次看到“ESP32-P4ESP32-C5双芯驱动,不用堆模块,这块屏自己就是网关”这个说法,我脑子里蹦出来的第一个念头是:又来了,又是一个把“带Wi-Fi的屏幕”包装成“网关”的营销话术。毕竟这些…

2026/10/4 15:15:55 阅读更多 →

日新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 11:40:45 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 9:43:54 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/3 9:42:36 阅读更多 →