爆火决策模型刚被 Ollama 0.35 收编:91ms 出判断、零 API 成本,本地玩转 Jev 同款
爆火决策模型刚被 Ollama 0.35 收编91ms 出判断、零 API 成本本地玩转 Jev 同款【免费下载链接】Bespoke-Nimble-9B项目地址: https://ai.gitcode.com/hf_mirrors/bespokelabs/Bespoke-Nimble-9B2026 年 9 月 29 日Ollama 0.35 的发布在 AI 工程圈激起不小波澜它不再只是又一个支持更多模型的本地推理器而是首次把 Jev 风格的决策模型正式收编进本地运行时——新增/v1/systemone端点首日即上线三款轻量级决策模型单次决策中位延迟低至 33ms、典型值 91msAPI 成本直接归零。而这场路线切换的主角之一正是 Bespoke Labs 开源的 Nimble 决策模型一个基于 Qwen3.5-9B 的 LoRA 适配器本体只有约 165 MiB。本文将结合社区实测数据与 Bespoke-Nimble-9B 仓库源码回答三个问题Ollama 0.35 到底新增了什么33ms 和 91ms 是怎么测出来、又为什么能这么快以及零 API 成本对 AI 决策工程究竟意味着什么。一、先看背景Jev 为什么能火出圈要理解这次更新的分量得先理解 Jev 引发的范式争论。Jev 由 OpenAI 前研究员创立的 TypeSafe AI 推出定位是System One Model——摒弃生成能力专精于多选项概率化判断。它不写作文、不解释、不编故事只对给定的一组选项输出带置信度的判断。社区基准显示Jev 端到端响应仅 70–500ms相比常规大模型推理速度提升约 193.6 倍输入成本低至每百万 token 0.042 美元输出 token 永久免费。它用强化学习校准决策RLCD来提升概率可信度支持并行判断、LLM 验收与模型路由。这套设计戳中了工程界的痛点大量 AI 决策根本不需要写作文。客服工单进来系统只需要三个答案——这是账单问题还是技术问题要不要升级紧急度多高用前沿大模型回答每次调用要花钱、延迟可能到秒级返回的还是一段自由文本代码还得解析、校验、重试。Jev 及其开源复刻们则把判断本身做成了有类型、可直接编程消费的接口。开源生态跟进极快Laya421M、ModernBERT 编码器、单次前向输出多选项概率分布、Verdict118M、CPU 亚毫秒级、ECE 校准强等 8 个开源复刻项目陆续出现。Nimble 是其中基于 Qwen 路线的一员——它不做编码器改造而是直接微调 Qwen3.5-9B判断准确率达到 90.12%。而 Ollama 0.35 的收编相当于给这条路线补上了最后一公里把决策模型变成任何人都能本地一键运行的软件。二、Ollama 0.35 新增了什么Choice / Noul / Score 三类结构化输出Ollama 0.35 的核心变化是通过新的/v1/systemone端点支持 Jev 风格决策模型底层基于 TypeSafe 的 Jev API 语义。与发 prompt 等生成不同它让你发送一个状态对象 一组命名问题模型在单次请求里返回带类型的答案。首日上线三款模型NimbleBespoke Labs 开源的 9B 决策模型也是这次的主力在 Apple M5 Max 本地平均每次决策 91mstev1Together AI 的 4B 实验模型从 Qwen3.5 微调而来tev1:0.8b0.8B 参数的最小版本面向边缘与极低算力环境。三个模型除了主决策结果还会返回每个选项的概率与置信度——应用层直接读取类型化字段无需解析、无需校验 schema、也不会遇到模型想解释一下导致的边界情况。API 支持三种问题类型恰好对应决策任务的三种基本形态Choice从你定义的条件映射里选一个选项离散分类 / 路由Noul即 Bernoulli 问题对一个是非陈述返回 0 到 1 之间的概率布尔判断Score把状态放到 2 到 10 级的有序评分标准上分级打分。多个问题可以针对同一状态并行评估——社区文章里明确提到问五个问题和问一个问题耗时差不多。这一设计与 Nimble 的架构同源查看 schema_config.json 的训练契约训练数据中三类任务恰好就是 choice8080 条、noul2412 条、score1534 条三种 kind评测注册了 bespoke-eval324 条与 jevbench-eval534 条两套基准。也就是说Ollama 接口的三类问题类型与模型训练时对齐的任务形态是一一对应的不是临时包装。在 inference.py 的参考实现里这种映射看得更清楚字段类型为boolean时标记kindnoul命中score_fields的整数值枚举字段标记kindscore其余为普通 choice。noul结果返回probability_truescore结果返回概率加权期望分数if row.get(kind) score: result[prediction] int(choices[index]) result[expected_score] sum(int(v) * p for v, p in zip(choices, probs.tolist()))三、33ms 与 91ms 是怎么测出来的从源码看不生成、只打分社区传播最广的两个数字是 33ms 与 91ms它们其实来自不同环境91ms典型值Ollama 官方在 Apple M5 Max 上本地运行 Nimble9B单次决策的平均耗时33ms中位数独立测试在 RTX 5060 Ti 上对多个决策模型实测中位延迟区间为 33ms–73ms其中表现最好的模型也是准确率最高的 Nimble中位延迟约 33ms。作为对照TypeSafe 托管版 Jev API 端到端需要 236–276ms已含网络时间。也就是说本地方案对托管 API 有 3–8 倍的往返时间优势——而且还没算上 API 计费。为什么能这么快答案藏在源码的推理路径里。打开 inference.py核心函数candidate_logits揭示了一切def candidate_logits(model, inputs): logits model(input_idsinputs[input_ids], attention_maskinputs[attention_mask], use_cacheFalse, logits_to_keep1).logits[:, -1, :].float() selected logits.gather(1, inputs[candidate_ids]) return selected.masked_fill(~inputs[candidate_mask], -torch.inf)这里有三层关键设计不做自回归解码。logits_to_keep1表示只计算最后一个位置的 logits——模型把整个上下文一次前向传播读完直接得到答案位置的输出分布不需要逐步生成 token。生成式 LLM 的延迟随输出长度线性增长而决策模型的延迟基本只由输入长度决定这是 91ms 级延迟的根本原因。候选 token 打分而非全词表采样。candidate_ids是预先算好的候选答案 token ID在 parallel_schema.py / extended_schema.py 中通过在答案边界追加候选码并校验其确为单个普通 token的方式获得gather只取这些位置的 logits非候选位置用-inf屏蔽。整个推断空间被收窄到选项集合这一个点上。一次 softmax 出全部分布。decision_result中probs scaled_logits.softmax(-1)温度默认 T1.0见 temperature_config.jsontemperature_fitted: false官方特别提示不要沿用旧版 checkpoint 的 2.179 校准值。一次前向即得到所有选项的概率、argmax 预测以及 logits结果直接是类型化 JSON。此外提示词构造也刻意优化了并行性。parallel_schema.py 用__PARALLEL_FIELD_TARGET__占位符渲染整个 chat 模板后 rsplit得到公共前缀start与后缀end每个字段的 prompt 只是start 字段名 end——多个字段共享同一段上下文前缀这对 KV cache 与 prompt cache 极其友好也正是多问题并行评估、耗时几乎不增加的工程基础。每个字段最多支持 255 个选项≤26 个用 A–Z 单字母编码更多时用 AA–JT 这类在词表中确为单 token 的大写码见 serving_schema.py 与 schema_config.json 中的candidate_codes/candidate_token_ids完整码本输入超过 8192 token 时直接拒绝而非截断保证有界判断的契约不被悄悄破坏。四、零 API 成本对 AI 决策工程意味着什么零 API 成本不是一个营销话术而是一笔可以算清的账单价层面Jev 托管 API 收费约每百万输入 token 0.042 美元、输出免费——已经比主流大模型便宜两个数量级但本地跑成本仍是绝对的零业务层面一个每月处理 4 万张客服工单的创业公司用前沿大模型做路由判断按 OpenRouter 基准约 115 美元/月换成本地决策模型是 0 美元。这不是小幅优化而是成本结构从线性增长变成固定成本延迟税层面每一次托管 API 往返都是用户可感知的延迟成本。单次 236ms 的 API 调用叠加到高并发决策链路上意味着排队、超时、重试与降级逻辑本地 33ms 的决策则把判断压到了与正则表达式同一量级的心智模型里。更深一层零成本让决策能力的使用方式发生了质变当单次判断便宜到可以忽略你就不必再省着用 AI。客服工单路由、AI Agent 的模型路由与工具调用安全校验、内容审核的大规模分类打标、意图识别与安全护栏——这些高并发、有边界的判断场景过去只能靠正则或 prompt 分类器将就现在可以直接上带概率的模型化判断且数据完全不出内网隐私与合规团队的压力也随之释放。同时也要诚实划出边界。决策模型不是万能钥匙社区实测与官方文档都指出了它的限制不生成文本它做分类、路由、评分、判断但不会帮你写回复文案。顺的模式是决策模型做判断LLM 写回复的分工只吃文本图片、音频、PDF 不能作为输入状态必须是字符串、字符串数组或键值对算术与日期是弱项数字比较、日期判断、对抗性内容上并不可靠需要靠任务设计规避选项顺序敏感独立基准显示重排选项可能改变答案Jev 翻转率 0–1.9%部分本地模型更易受影响——有界判断的稳定性需要在实际部署中验证。知道边界才知道该把它放在技术栈的哪一层。五、把 Nimble 跑起来的工程姿势最后落到实际开发。从 README.md 与 inference.py 看Nimble 的加载和打分极简下载适配器、装依赖、导入NimbleModel一个score(context, schema)调用即完成判断from inference import NimbleModel model NimbleModel(nimble-model) result model.score( contextThe store accepts returns within 30 days. This item was bought 12 days ago., schema{ eligible: { type: boolean, description: Is this item within the store return window? } }, ) print(result[output]) print(result[fields][eligible][probabilities])返回结构里既有output每个字段的最终预测也有每个字段的完整probabilities逐选项概率与logits——score字段额外带概率加权期望分数boolean字段带probability_true。定义选择类字段用typeenumchoices列表 description可选的choice_descriptions用于给每个选项补充语义说明打分字段用整数值枚举如[0, 1, 2]并放进score_fields参数。值得称道的是这个仓库的工程严谨性schema_config.json 中通过prompt_source_sha256对candidate_schema.py、parallel_schema.py、extended_schema.py逐一哈希锁定serving_config.json 同样校验服务端源码与训练码本的一致性加载时任何 prompt 构造或候选编码的漂移都会直接报错——保证训练时怎么问推理时还怎么问。训练侧还有完整数据审计12026 条训练行、8468 个训练组、5370 个训练家族组件覆盖 contrastive-addition、safety-local、retrieval-classification-local 以及 Banking77、MultiNLI、BoolQ、AG News、DBpedia、TREC 等公开数据集provenance.json明确标注weights_unchanged_from_evaluated_checkpoint: true发布即评测权重杜绝榜单权重和发布权重不一致的行业陋习。结语这次更新发的是信号Ollama 0.35 表面上新增了一个端点、三款模型实际上传递了一个更强的信号AI 技术栈里最有价值的部分可能什么都不生成只告诉你的代码下一步该做什么——毫秒级带一个可置信的概率。过去两年行业追逐的是更大的模型、更长的上下文、更惊艳的生成而决策模型这条支线证明有界判断可以且应该被做成像数据库索引一样的基础设施小模型、简单 API、几乎可忽略的延迟、零边际成本、数据不出内网。当判断从每次都要花钱的奢侈调用变成本地随手可用的系统组件路由、审核、护栏、评分这些工程动作的架构假设都会被重写——这就是 91ms 与零成本背后真正的工程意义。【免费下载链接】Bespoke-Nimble-9B项目地址: https://ai.gitcode.com/hf_mirrors/bespokelabs/Bespoke-Nimble-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

PCB制造MES追溯系统方案:从工序追溯到全流程闭环

PCB制造MES追溯系统方案:从工序追溯到全流程闭环

简介:面向PCB制造企业的MES追溯系统方案资料,适合生产管理、品质管理、工艺及信息化部门人员阅读,用于解决从SMT贴装、组装测试到包装入库全流程的可追溯与品质管控问题。文档以PDF形式呈现,共1个文件,压缩包大小5.22M…

2026/10/11 4:54:52 阅读更多 →
RTL8812AU Linux驱动编译与故障排查实战指南

RTL8812AU Linux驱动编译与故障排查实战指南

简介:本资源是专为Linux用户提供的Realtek RTL8812AU无线网卡开源驱动程序包,面向嵌入式开发、Linux系统运维及硬件兼容性调试人员,解决该芯片在主流发行版(如Ubuntu、Debian、Fedora)中缺乏官方内核支持、Wi-Fi功能不…

2026/10/11 8:07:43 阅读更多 →
热榜 9 小时 vs Apache-2.0:开源科学模型该看榜单还是看生态

热榜 9 小时 vs Apache-2.0:开源科学模型该看榜单还是看生态

热榜 9 小时 vs Apache-2.0:开源科学模型该看榜单还是看生态 【免费下载链接】Intern-S2-397B 项目地址: https://ai.gitcode.com/InternLM/Intern-S2-397B 一个开源模型发布后,通常会在社区热榜上停留几个小时:搜索流量涌入、转发刷…

2026/10/11 8:07:46 阅读更多 →

最新新闻

GCC四阶段实战:从hello.c到可执行文件的完整编译链

GCC四阶段实战:从hello.c到可执行文件的完整编译链

简介:这是一份面向软件开发初学者与Linux系统使用者的GCC编译器入门指南,聚焦C/C开发环境搭建与核心编译原理。资源以PDF形式呈现,内容覆盖GCC发展沿革、多语言支持能力、跨平台特性及与G的本质区别,重点澄清四大常见误区&#xf…

2026/10/11 15:09:55 阅读更多 →
OVITO数据管道实战:分子模拟轨迹可视化与Python批处理解析

OVITO数据管道实战:分子模拟轨迹可视化与Python批处理解析

简介:OVITO是分子动力学模拟结果可视化的常用工具,这份1个PDF文件(约2.14MB)的手册与总结面向使用LAMMPS开展材料、物理、化学等模拟研究的用户,帮助快速掌握从导入Dump文件到分析原子轨迹的完整流程。内容按三部分梳理…

2026/10/11 15:09:55 阅读更多 →
220V降压24V700mA交转直芯片WT5110

220V降压24V700mA交转直芯片WT5110

220V降压24V700mA交转直芯片WT5110WT5110 是一款适用于非隔离型 AC-DC 降压转换的芯片,支持宽输入电压范围(85VAC~265VAC,部分场景可扩展至 110VAC~265VAC), 可将 220V 交流电转换为稳定的 24V 直流输出,并…

2026/10/11 15:09:55 阅读更多 →
SQL Server AlwaysOn 集群添加只读副本:从裸机到可用组的完整实战指南

SQL Server AlwaysOn 集群添加只读副本:从裸机到可用组的完整实战指南

简介:这份文档面向 SQL Server 数据库管理员与运维工程师,聚焦在已有 Always On 可用性组集群中新增一个数据库节点的完整落地流程,适合具备一定故障转移群集基础、需要横向扩展只读副本或提升高可用能力的技术人员参考。资源包内共 1 个 doc…

2026/10/11 15:09:55 阅读更多 →
SHL真题截图结构化:从PNG到JSON的6步确定性流水线

SHL真题截图结构化:从PNG到JSON的6步确定性流水线

简介:本资源为SHL在线评估测试真题截图整理文档,面向IT、金融、咨询等行业的求职者及HR招聘从业者,助力高效备考数理逻辑、数据解读与商业分析类标准化测评。文档完整呈现22道典型题目及其参考答案(含9处错题标注)&…

2026/10/11 15:09:55 阅读更多 →
2027浙大EMBA提前批面试怎么准备?底层逻辑与实战策略全解析

2027浙大EMBA提前批面试怎么准备?底层逻辑与实战策略全解析

每年到了三四月份,总会有几位在企业里做到中高层的老朋友来找我聊同样的问题:2027年想试试浙大EMBA,提前批面试到底要不要报名?我的回答从来都很干脆——只要你自己评估下来基本条件达标,就一定要申。原因并不复杂&…

2026/10/11 15:08:55 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →