GEV-26B-Decide 部署指南:3步为 Gemma-4 的 tied lm_head 打 LoRA 补丁,快速起决策服务
GEV-26B-Decide 部署指南3步为 Gemma-4 的 tied lm_head 打 LoRA 补丁快速起决策服务【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-DecideGEV-26B-Decide 是基于 google/gemma-4-26B-A4B-it 的开源决策模型Decision Index 0.2.1 得分 62.48一次前向即可对 2–256 个选项输出校准概率并支持自适应思考adaptive thinking。要用 vLLM 部署它必须为 Gemma-4 的 tied lm_head 打上 LoRA 补丁——本指南将完整讲解这个补丁解决什么问题、如何打补丁以及如何 3 步把POST /v1/decide决策服务跑起来。为什么必须打补丁tied lm_head 是什么 先理解背景权重共享tied weightsGemma-4 把输出层的lm_head与输入嵌入层共用同一份权重矩阵而不是各自独立。决策头需要 lm_head LoRAGEV-26B-Decide 的 System 1 决策头在 vLLM 里被实现为lm_head 上的 LoRA见 adapter_vllm/decision_head.json决策概率直接从这个 LoRA 读出的 verbalizer token 概率计算。vLLM 原生不满足两个条件原 vLLM 的 LoRA 词表上限是 258048而 Gemma-4 词表为 262,144直接报vocab size must be 258048错误Gemma-4 的模型定义里缺少embedding_modules声明PEFT 的 lm_head LoRA 目标无法映射到 vLLM 的 logits-processor LoRA 包装器。此外还有一个更隐蔽的坑Gemma-4 的层路径存在别名model.layers.N与model.self_decoder.decoder_layers.N指向同一个物理模块激活 LoRA 时后一个别名会把刚加载的权重悄悄重置——这就是补丁第二个 commit 修复的LoRA 静默失效问题。部署前的环境准备清单 ✅项目要求GPU1 张 80 GB 或更大显存的 GPU如 B200 / RTX PRO 6000vLLM带 Gemma-4 支持的开发版构建官方测试使用 2026 年 9 月的 vLLM dev build模型文件本仓库全部权重约 26B 参数、每 token 激活约 4B 的 MoE补丁文件patches/vllm-gemma4-lm-head-lora.patch3步完成部署第 1 步获取模型与部署脚本git clone https://gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide或使用 HuggingFace CLIhf download autotrust/GEV-26B-Decide --local-dir GEV-26B-Decide第 2 步为 vLLM 打补丁在你的 vLLM 源码目录下应用补丁共 2 个 commit、3 个文件、约 24 行改动cd /path/to/vllm git apply /path/to/GEV-26B-Decide/patches/vllm-gemma4-lm-head-lora.patch pip install -e . # 按你的构建方式重装/重编译第 3 步一键启动服务serve.sh 封装了全部启动参数直接运行bash GEV-26B-Decide/serve.sh # 默认监听 :8000它实际执行的是 serve_decide.py——一个标准 vLLM OpenAI 服务器外加POST /v1/decide路由关键参数包括--enable-lora --max-lora-rank 32 --lora-modules jev-decision.../adapter_vllm --max-logprobs 256。引擎只加载一次主干模型普通请求走 System 2OpenAI 接口带 LoRA 模块jev-decision的请求走 System 1决策头。补丁内容详解 补丁 vllm-gemma4-lm-head-lora.patch 由两部分组成Commit 1/2 —— 允许 lm_head LoRA在vllm/lora/layers/logits_processor.py中把 LoRA 词表上限从 258048 提高到262144与 Gemma-4 词表一致并已在 Gemma-4-26B-A4B 上验证输出一致性在vllm/model_executor/models/gemma4.py中新增声明embedding_modules { lm_head: output_embeddings, }这样 PEFT 的 lm_head LoRA 目标就能映射到 vLLM 的 logits-processor LoRA 包装器。由于 LoRA 增量只作用于输出 logits在 final-logit soft cap 之前不激活 LoRA 时输入嵌入与基础模型 logits 完全不变——System 2 不受任何影响。Commit 2/2 —— 别名模块去重在vllm/lora/model_manager.py激活逻辑中按物理模块去重优先选择有权重的路径避免别名把刚加载的 LoRA 权重重置掉上游 backport修复 Gemma-4 LoRA 静默失效。验证服务调用决策接口 服务起来后一条 curl 即可验证 System 1 自适应思考curl localhost:8000/v1/decide -H Content-Type: application/json -d { kind: choice, state: A bat and a ball cost $1.10 in total. The bat costs $1.00 more than the ball., question: How much does the ball cost?, options: [$0.10, $0.05, $1.00, $0.55], thinking: auto}返回每个选项的probabilities、choice及thinking信息GET /v1/decide/info可查看默认参数。System 2 则直接走标准/v1/chat/completions。 提示kind支持noul是/否、score0–5 评分、choice2–256 选项分类、检索、工具路由类任务建议thinking: off推理类任务用auto。可选用推测解码加速思考 如果以思考为主自适应思考/ System 2 推理加MTP1启动即可启用 Google 官方 draft 模型的推测解码MTP1 bash GEV-26B-Decide/serve.sh实测 System 2 速度提升约 1.8–1.9×单请求 247 → 438 tokens/s思考中位延迟从 13.4 s 降到 7.7 s。注意它不会改变输出分布但高并发下 System 1 吞吐会下降257 → 140 决策/秒所以大部分请求不思考的场景不要开。常见问题 FAQQ: 报错vocab size must be 258048A: 补丁 Commit 1 没有生效确认在带 Gemma-4 支持的 vLLM 开发版上应用了 补丁 并重新安装。Q: 决策概率明显不对 / LoRA 像没生效A: 很可能是补丁 Commit 2 缺失导致的别名重置问题——别名路径把刚加载的权重清空了。完整应用两个 commit 即可。Q: 一定要用 vLLM 吗A: 不。也可以走 transformers peft 路径加载 adapter/System 1 LoRA head.safetensors 决策头 judge_config.json calibration.json官方 README 有完整示例。vLLM 路径的优势是单引擎同时服务 System 1 与 System 2。Q: 为什么 vLLM 下要--max-logprobs 256A: System 1 靠读取 processed logprobs 还原完整概率分布256 足以覆盖最多 256 个选项serve.sh已内置该参数。文件速查 文件说明patches/vllm-gemma4-lm-head-lora.patch本文主角tied lm_head LoRA 补丁2 个 commitserve.sh一键启动脚本含全部 vLLM 参数serve_decide.pyvLLM 服务器 POST /v1/decide实现adapter_vllm/vLLM 用的 System 1主干 LoRA lm_head LoRA decision_head.jsonadapter/transformers/peft 路径的 System 1 LoRALoRA rank 32覆盖全部注意力与 MLP 投影层head.safetensors24-slot 决策头transformers 路径使用calibration.json / calibration_gold.json每类决策的温度系数默认 / 对照真值校准README.md完整模型卡基准成绩、延迟、使用示例按照以上步骤你就能在一台 80 GB 显存的机器上把一个引擎、两套系统、文本加图像的 GEV-26B-Decide 决策服务完整跑起来——System 1 约 45 ms 出一次决策需要深思时自动切换到 System 2 推理并折回概率。【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

微信小程序物业管理系统毕业设计:技术选型、数据库设计与论文写作全指南

微信小程序物业管理系统毕业设计:技术选型、数据库设计与论文写作全指南

简介:这份资源是面向高校计算机相关专业学生的微信小程序物业管理系统毕业设计完整项目,适合作为课程设计、毕业论文或小程序开发练手参考。项目围绕真实小区场景展开,涵盖用户认证与登录、二维码模拟开门、车牌预约审核、物业服务提交、物业…

2026/10/9 13:19:03 阅读更多 →
基于EPW与Migdal-Eliashberg方程的第一性原理超导能隙计算全流程

基于EPW与Migdal-Eliashberg方程的第一性原理超导能隙计算全流程

1. 从声子谱到超导能隙:这套流程到底在算什么第一次接触EPW和Migdal-Eliashberg方程的人,大概率会被那一长串物理名词劝退。但如果你把它拆开来看,本质上就是一件事:给定一个材料的晶格振动谱(声子谱)&…

2026/10/9 13:19:03 阅读更多 →
数据字典不是文档工具,而是团队语义协同的基础设施

数据字典不是文档工具,而是团队语义协同的基础设施

简介:这是一款面向数据库管理员、后端开发与DBA初学者的自动化数据字典生成工具,专为解决手工维护数据库文档效率低、易出错、难同步等痛点而设计。工具支持MySQL、SQL Server等主流数据库,可一键扫描表结构、字段类型、约束、注释并生成结构…

2026/10/9 13:19:03 阅读更多 →

最新新闻

Manus联合创始人拆解:Claude与阿里千问双模型驱动下的TaoToken统一API接入实践

Manus联合创始人拆解:Claude与阿里千问双模型驱动下的TaoToken统一API接入实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 13:55:48 阅读更多 →
AI实战:省token妙招之【context-mode】——用SQLite给MCP上下文做减法

AI实战:省token妙招之【context-mode】——用SQLite给MCP上下文做减法

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 13:55:48 阅读更多 →
用WPF+OpenCvSharp构建仿VisionMaster拖拉拽视觉框架:交互内核与流程调度拆解

用WPF+OpenCvSharp构建仿VisionMaster拖拉拽视觉框架:交互内核与流程调度拆解

简介:面向工业视觉与上位机开发者的仿VisionMaster通用视觉框架源码包,基于WPF、OpenCvSharp与C#实现流程图式拖拉拽流程编排,开箱即用且便于二次开发。压缩包共2000个文件,约335.39MB,以C#源码(.cs)为核心&#xff0c…

2026/10/9 13:55:48 阅读更多 →
面试中常问的 List 去重问题,你都答对了吗?

面试中常问的 List 去重问题,你都答对了吗?

一道被问烂的面试题:如果你去面试 Java 开发岗位,尤其是初级到中级岗位,十有八九会被问到:「如何对一个 List 进行去重?」很多候选人会脱口而出:「用 HashSet 啊,把 List 丢进去再拿出来不就好了…

2026/10/9 13:55:48 阅读更多 →
Seay源码审计工具实战:从环境搭建到漏洞确认与避坑指南

Seay源码审计工具实战:从环境搭建到漏洞确认与避坑指南

简介:Seay源代码审计系统是一款面向 Web 应用开发者与安全工程师的自动化代码安全审查工具,专注于发现高危函数、注入漏洞和编程错误,并提供一键审计、函数查询、自定义规则、代码高亮与调试、报告生成等核心能力。资源包为Windows环境下常用…

2026/10/9 13:55:48 阅读更多 →
人大金仓KCA/KCP认证备考:从零散题库到可复现的实操路径

人大金仓KCA/KCP认证备考:从零散题库到可复现的实操路径

简介:这份人大金仓KCA、KCP题库整理面向备考金仓数据库认证的考生与数据库运维初学者,聚焦KingbaseES v8核心考点,帮助读者在刷题中快速定位知识盲区、巩固原理细节。内容覆盖系统表存储位置、ORDER BY排序限制、后台进程、模板数据库、索引最…

2026/10/9 13:54:47 阅读更多 →

日新闻

Java时间API实战:LocalDate、Date与ZonedDateTime的转换与避坑指南

Java时间API实战:LocalDate、Date与ZonedDateTime的转换与避坑指南

Java时间API这个话题,隔三差五就会在群里被翻出来讨论一次。上周还有个同事线上处理一个订单超时问题,排查到最后发现是ZonedDateTime序列化后时区丢了,用户在下单当天晚上看到的时间整整差了8个小时。这类问题几乎每个做Java开发的人都遇到过…

2026/10/9 0:00:49 阅读更多 →
EasyTier实践:从NAT穿透到子网代理的异地组网部署与排错

EasyTier实践:从NAT穿透到子网代理的异地组网部署与排错

前几个月我手头有好几台机器需要互相访问:办公室台式机、家里 NAS、还有一台云主机。如果只是偶尔传个文件倒还好,问题是工作场景经常要在几处环境之间来回切换,每次都先登录跳板机再层层代理,实在折腾。我先后试过端口映射、自建…

2026/10/9 0:00:49 阅读更多 →
AI Agent工程实战:从七要素到七个决策点的系统设计指南

AI Agent工程实战:从七要素到七个决策点的系统设计指南

AI Agent 这个词在过去一年里被反复提及,但真正动手搭过一套能跑起来的 Agent 系统的人都知道,从"知道它是什么"到"让它稳定干活"之间隔着一整套工程决策。我前后参与过几个 Agent 项目的落地,从最初用现成框架拼装&…

2026/10/9 0:01:50 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:32 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:40 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 10:11:06 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 21:13:17 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:17 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 6:17:20 阅读更多 →