GEV-26B-Decide 视觉决策:85毫秒点击屏幕,95%成功率是如何炼成的
GEV-26B-Decide 视觉决策85毫秒点击屏幕95%成功率是如何炼成的【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-DecideGEV-26B-Decide 是一个开源的多模态视觉决策模型给它一张截图或相机画面它在单次前向推理中就能对每个动作输出带校准的概率。在真实浏览器测试里它以每步约 85 毫秒点击屏幕的速度完成了 60 个随机多步任务中的95%——与更大的视觉模型成功率相同速度却快了近 3 倍。 先认识一下GEV-26B-Decide 是什么一句话概括它不生成文本而是直接输出每个选项的概率。基座模型google/gemma-4-26B-A4B-it260 亿参数每 token 仅激活约 40 亿自带视觉编码器System 1快直觉一次前向推理就作答单张 B200 上文本决策中位数约 45 毫秒每个选项都给出校准后的概率System 2自适应思考当 System 1 的领先选项置信度低于 0.8 时才启动思考逐条推理后再把结果折回概率只在需要时思考它支持三类有类型的决策是/否noul、0–5 打分score、在 2–256 个选项中选一个choice。一套权重、一个 vLLM 服务同时覆盖文本和图像。⚡ 85 毫秒点击屏幕一次循环是怎么跑的测试环境是一个真实浏览器无头 Chromium每一步只做一次 System 1 决策页面上每个可点击元素被标上一个带编号的框System 1 在编号框 元素文本里选出下一次点击或判定任务完成浏览器执行点击循环重复在 60 个随机多步任务购物、设置、邮件各 3–7 次点击上95% 的任务被完成平均每次点击约 85 毫秒。有个细节很能说明问题页面里的颜色色板没有任何文字那几次点击纯粹靠截图本身决定。指标GEV-26B-DecideJEV-27B-VLJEV-9B电脑使用成功率60 任务95%95%95%每次点击耗时≈ 85 ms≈ 260 ms≈ 200 ms机械臂成功率20 场景40%75%50%每次机械臂决策耗时61 ms239 ms163 ms 95% 成功率的关键别只给模型框这个模型的决策头是在文本上训练的图像上的决策属于零样本能力。作者做了一组对照实验结论很直接只给带编号的框成功率仅 15%而且经常过早宣布任务完成编号框 元素文本相当于无障碍树的用法成功率 95%所以实际接入时一定要把元素文本和截图一起提供。每一集任务的概率与耗时明细都可以打开 reports/demos/cu_results.json 查看。 61 毫秒一步机械臂在真实相机回路中抓放换到机器人场景System 1 每一步看一眼顶部相机的画面只回答两个问题目标在夹爪的左边还是右边上边还是下边机械臂据此移动并在任何一次回答翻转时把步长减半——最终抓起方块、搬运、丢进托盘MuJoCo 仿真。每次决策 61 毫秒一次完整抓取放置只消耗 4–8 秒模型时间20 个随机场景完成 40%靠近目标时它的左右判断不如 JEV-27B-VL 精细所以偶尔抓空但一旦抓住9 次里有 8 次方块稳稳落进托盘逐场景数据见 reports/demos/arm_servo.json作为反面参照reports/demos/arm_direct.json 记录了让 System 1 直接从 8 条电机指令里挑一条的尝试——10 个场景 0 成功。 快速上手指南一条命令启动决策模型需要一张 80 GB 以上显存的 GPU以及支持 Gemma-4 的 vLLM 版本项目自带补丁 patches/vllm-gemma4-lm-head-lora.patch用于给 Gemma-4 共享词表挂 LoRAhf download autotrust/GEV-26B-Decide --local-dir GEV-26B-Decide bash GEV-26B-Decide/serve.sh # vLLM 服务跑在 :8000启动后除了标准 OpenAI 接口还能使用POST /v1/decide请求只需 4 个核心字段字段说明kindnoul是/否·score0–5·choice2–256 个选项state决策所依据的状态可混排文本与图像question要回答的那个问题thinkingoff默认最快·auto自适应思考·on始终思考返回的每个选项都带概率还有choice、thinking.used等字段方便你在自动化流程里按置信度把关。服务实现见 serve_decide.py启动脚本见 serve.sh。 项目关键文件一览文件作用adapter/System 1 的 LoRAtransformers 路线adapter_vllm/vLLM 路线骨干 LoRA 决策头head.safetensors24 槽决策头fp32judge_config.json槽位布局与读出方式calibration.json / calibration_gold.json每类决策的温度校准后者按真实答案校准适合做置信度把关serve_decide.py带/v1/decide接口的 vLLM 服务reports/decision_index_adaptive.jsonDecision Index 完整评测reports/thinking_games.json自适应思考在各游戏中的表现想直观感受它的效果可以打开 videos/ 目录电脑使用购物演示、机械臂抓放演示还有扫雷、四子棋、Wordle、数独的看它思考演示视频。⚖️ 诚实的局限适合什么、不适合什么元素文本是刚需只给带编号的框电脑使用成功率从 95% 掉到 15%别让 System 1 直挑电机指令在控制回路里让它从 8 条指令里直接选10 个场景 0 成功——相对位置二选一 外部循环才是正确用法思考模式帮推理、不帮感知数学/逻辑/科学问题提升显著如 AQuA-RAT 68.1% → 89.0%但分类、检索几乎没有收益甚至可能干扰已训任务英文为主用于高风险自动决策前务必用置信度阈值把关可切换到 calibration_gold.json一句话总结GEV-26B-Decide 用即时概率输出替代长篇文本生成把一个 26B 多模态模型变成了低延迟的视觉决策引擎——85 毫秒点一次屏幕、95% 的任务成功率就是它给自动化场景交出的答卷。【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

大模型上下文模式实战:从窗口管理到多轮记忆优化

大模型上下文模式实战:从窗口管理到多轮记忆优化

做 AI 应用开发这一年多,我越来越觉得“context-mode”这个词值得单独拿出来聊一聊。很多人用它指代大模型上下文管理,也有人用它描述对话系统里那种显式的模式切换。两个含义其实指同一件事:你怎么决定模型能看到什么、记得什么、理解成什么…

2026/10/11 18:54:38 阅读更多 →
2026年Token算力资源深度测评:词元之河与硅基流动的多模型调度、成本控制与工程落地对比

2026年Token算力资源深度测评:词元之河与硅基流动的多模型调度、成本控制与工程落地对比

2026 年,模型 API 的调用正在从"能用就行"转向"算力资源怎么安排"的深水区:多模型调度是否灵活、成本是否可控、工程落地是否顺畅,成了团队选聚合平台时的三把尺子。本文用这三把尺子,对词元之河(TokenRiver.…

2026/10/8 18:27:06 阅读更多 →
x64dbg-MCP Server 源码剖析:Zig 零依赖架构如何实现单二进制跨平台调试

x64dbg-MCP Server 源码剖析:Zig 零依赖架构如何实现单二进制跨平台调试

x64dbg-MCP Server 源码剖析:Zig 零依赖架构如何实现单二进制跨平台调试 【免费下载链接】x64dbg-mcp-server x64dbg-MCP Server is a native MCP (Model Context Protocol) plugin for x64dbg that exposes the debuggers full functionality over HTTP. Connect a…

2026/10/10 12:49:32 阅读更多 →

最新新闻

基于YOLOv8的大豆叶病检测:从数据集构建到模型部署全流程

基于YOLOv8的大豆叶病检测:从数据集构建到模型部署全流程

简介:这份资源面向深度学习入门者与计算机视觉方向的学习者,以大豆叶病检测为实战场景,帮助读者理解YOLOv8目标检测框架的整体构建流程。内容围绕数据采集与预处理、网络架构设计、基于PyTorch的训练与推理、模型评估指标监控以及部署时的模型…

2026/10/11 21:19:10 阅读更多 →
深入解析 Kubernetes Python 客户端 V2CrossVersionObjectReference 模型:跨版本对象引用与 HPA 实战

深入解析 Kubernetes Python 客户端 V2CrossVersionObjectReference 模型:跨版本对象引用与 HPA 实战

后端云原生容器编排 【免费下载链接】python Official Python client library for kubernetes 项目地址: https://gitcode.com/gh_mirrors/python1/python 点击查看 免费下载 导读:V2CrossVersionObjectReference 是 Kubernetes Python 官方客户端&…

2026/10/11 21:19:10 阅读更多 →
CoreCoder命令大全:/model、/compact、/tokens、/undo等斜杠命令让你像老司机一样驾驭编码Agent

CoreCoder命令大全:/model、/compact、/tokens、/undo等斜杠命令让你像老司机一样驾驭编码Agent

【免费下载链接】CoreCoder Minimal AI coding agent (~1,000 lines of Python) inspired by Claude Code. Works with any LLM. Think NanoGPT for coding agents. Formerly NanoCoder. 项目地址: https://gitcode.com/gh_mirrors/co/CoreCoder 点击查看 免费下载 …

2026/10/11 21:19:10 阅读更多 →
WorldWideView状态管理指南:Zustand九大数据切片如何组织一个3D地球应用

WorldWideView状态管理指南:Zustand九大数据切片如何组织一个3D地球应用

【免费下载链接】worldwideview 项目地址: https://gitcode.com/gh_mirrors/wo/worldwideview 点击查看 免费下载 WorldWideView 是一款在浏览器中运行的大型 3D 地球实时态势感知平台,它用 Zustand 状态管理方案,把相机、图层、时间轴、UI、…

2026/10/11 21:19:10 阅读更多 →
你的代码去了哪里?PR Lens 安全与隐私设计:自带 Key、零遥测与令牌轮换机制

你的代码去了哪里?PR Lens 安全与隐私设计:自带 Key、零遥测与令牌轮换机制

【免费下载链接】pr-lens Review code 100X faster. Lens draws every PR as animated architecture and data-flow walkthroughs, inside the pull request itself. Use it as a GitHub App, GitHub Action, CLI, or a Skill for your coding agent 项目地址: http…

2026/10/11 21:19:10 阅读更多 →
共享自行车检测系统工程落地:YOLOv8+PyQt5实战避坑指南

共享自行车检测系统工程落地:YOLOv8+PyQt5实战避坑指南

简介:本资源是一套面向计算机、人工智能及自动化等专业学生与初学者的共享自行车智能识别与违停检测实战项目,聚焦城市治理中共享单车乱停放问题,提供从数据采集、模型训练到GUI部署的完整闭环方案。压缩包共889个文件,含304张标注…

2026/10/11 21:18:09 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →