只判断、不生成的模型两周进了七家厂10 月 1 日三家在同一天进场2026 年 10 月 1 日Perplexity 发布pplx-decider-v1-27bCloudflare 发布Clef和Clef-flashAWS 旗下 Strands Labs 发布Strands Decider 2B来源各家官方博客及 Hugging Face 模型卡。三家做的是同一种东西不生成文字、只输出判断的决策模型。往前数 16 天9 月 15 日TypeSafe 才发布 Jev第一次把「System One 决策模型」这个词摆上台面来源TypeSafe 官方博客。一个品类从被命名到被头部厂商集体跟进只用了两周。粗略数一遍这期间先后下场的厂商超过七家。一个「不写字、只判断」的模型两周内被至少七家厂商跟进。这是 AI 架构的一次分水岭还是一次精明的重新贴牌两边都不缺论据。先看清这些东西到底是什么Jev 由前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe 推出。输入一段程序状态加一组预定义问题它一次性返回结构化判定三种原语Choice从你给的选项里选一个、Score按你划定的尺度打分、Noul一句是非判断返回为真的概率每个答案都带校准置信度来源TypeSafe 官方博客。官方声称比前沿大模型快 40-200 倍、便宜 40-400 倍定价 $0.042/百万输入 token输出免费因为它根本不写文字来源TypeSafe 官方博客。跟进者的路线各不相同。Perplexity 的 Decider 用 Qwen3.8-27B 微调Apache 2.0 开源自报 11 个基准、7210 样本上 85.71%压过 Jev 的 84.51%但 Jev 在 11 个里赢了 6 个来源Hugging Face 模型卡。OpenAI 在 9 月 29 日 DevDay 预览 Decisions API10 月 6 日转公开 beta由 GPT-6 Luna 驱动$0.10/百万输入 token来源OpenAI API changelog。更早的 9 月 19 日国内 APUS 已经用 Qwen3.5-9B 在本地复现了 Jev 的机制封进fast-browser-use这个浏览器自动化 Skill来源央广网。密集到什么程度OpenRouter 的 decisions 目录9 月 28 日还是 7 条路由、4 家厂商几天之内又涌进一批来源OpenRouter 模型目录。正方这是必然的分层Agent 一旦规模化判断的量级会暴增。一次 agent 运行里有成百上千次工具调用、路由、门禁、校验每一次都是判断点。自回归生成是逐 token 串行解码延迟 O(n)、逐 token 计费判断只需要单次前向在封闭输出空间里打分延迟 O(1)、成本固定。把判断留在生成模型里等于每次「要不要重试」「该不该放行」都付一遍生成的钱、等一遍生成的延迟。拆出来能拿到延迟、成本还有一样更值钱的东西可校准的置信度。生成模型的「有把握」是软性的你没法拿它做阈值判断Jev 这类模型每个答案都带一个校准过的概率低于阈值就拒绝执行。这让「判断」从黑箱变成可编程、可测试、可审计的组件。分歧不在「判断该不该从生成里拆出来」而在「谁来拆、怎么拆」。反方这是贴牌分类头、router、guardrail这些组件在生产环境里跑了很多年。所谓「决策模型」多大比例是真创新多大比例是旧组件被重新命名、定价、塞进一个新赛道命名乱象是个信号System One、Decider、Clef、Strands Decider、d1、Span-01每个名字都不一样说明品类远未定型。更微妙的是 OpenAI。它的 Decisions API 不是独立训练的决策模型而是在现有的 reasoning 模型 GPT-6 Luna 上套了一个/v1/decisions端点来源OpenAI API changelog。这几乎是在说决策能力是接口层的事不是一个新模型的事。Cloudflare 自己在发布 Clef 的同时说这个市场「越来越饱和」一周之内 Fastino 的 GLiDE、自家的 Clef、Perplexity 的 Decider 先后上线来源Cloudflare 官方博客经第三方引述。一边下场一边说饱和这句话就是怀疑派藏在新闻里的注脚。交锋那个被借用的隐喻是错的Jev 把名字借给卡尼曼的「系统 1」。但人类的系统 1 是并行的、模糊的、不可解释的直觉比如开车时的条件反射Jev 是确定性的、带校准置信度的、封闭输出空间的打分器。两者本质不同。用「快思考」去命名一个确定性打分器恰恰掩盖了它真正的价值。它的卖点不是「快」是「可校准、可编程、可审计」。一个错误的隐喻正在反过来塑造工程师的设计心智把它当成「快直觉」你会高估它的智能、低估它的边界把它当成「打分器」你才会去核对它的校准曲线、设对阈值。命名不是修辞问题它决定了你怎么用这个东西。回到账本哪些判断值得拆争论到最后落点其实很窄不是「决策模型是不是新东西」而是「你的系统里哪些判断值得拆出来」。一条可用的标准高频、低延迟敏感、封闭输出空间、需要审计的判断拆出来。路由、筛选、评分、门禁属于这一类。低频、开放、创造性、一次性的判断留在大模型里。按这条线切正反两派其实不冲突。正方说的是「该拆的判断应该被产品化」反方说的是「别把不该拆的也拆了」。结尾回到 10 月 1 日那三家公司。他们是看到了同一个未来还是闻到了同一种 FOMO 的味道