斯坦福+英伟达联手开源 CLM-8B:Agent 决策不再逐字生成,9 倍延迟优势刷屏
斯坦福英伟达联手开源 CLM-8BAgent 决策不再逐字生成9 倍延迟优势刷屏【免费下载链接】CLM-v0.1-8B项目地址: https://ai.gitcode.com/hf_mirrors/Contrastive-LM/CLM-v0.1-8B当所有大模型厂商都在卷生成得更快、更长时斯坦福 Hazy Research 与英伟达联手在 9 月下旬悄然开源了一个反其道而行的模型——CLM-v0.1-8B。它几乎不生成任何文本却能在工具调用、Best-of-N 验证、GUI 操作等高频决策场景中交出与 Jev 零样本精度相当、延迟却最高低 9 倍的答卷。本文结合仓库源码与社区一周舆情拆解这套把决策压成一次点积的技术路径、其背后的训练配方以及它真正适合与不适合的场景。为什么押注对比式决策System One 模型的迟到补位要理解 CLM 的动机先要回到 Agent 决策的本质。一个 8B 级生成式模型做一次工具选择通常要逐 token 自回归地想出一段话再从中解析出动作而做一次 Best-of-N 验证则要完整写出 N 份理由。绝大多数 token 其实与最终动作无关——它们只是生成式模型的思考税。CLM 选择用 Kahneman 意义上的System One快思考来接管这类判断不再生成而是把状态与动作分别编码到同一向量空间用对比学习训练两者的一致性决策退化为一次向量点积。这个思路来自一支罕见的产学研组合——论文作者名单里既有斯坦福 Hazy Research 的 Christopher Ré 与 Jon Saad-Falcon也有英伟达的 Marco Pavone、Azalia Mirhoseini 与 Jacky Kwok 等人研究方向直指快速且可泛化的决策。更关键的是开源姿态模型权重与基础编码器双双采用 Apache-2.0 许可见 LICENSE基础模型是同样开源的 Qwen3-8B。这意味着验证器、路由、排序这类模型套模型的工程第一次有了可自由商用的 8B 级底座而非只能依赖闭源 API。从仓库元信息config.json可以看到其精简的构成architecture: state/action projection heads (InfoNCE)encoder_pooling: last-tokenembedding_dim: 4096。整个仓库没有一行训练骨干的代码因为骨干根本不需要训——这正是轻的来源。状态-动作向量匹配9 倍延迟差的工程由来架构冻结编码器 双投影头CLM-8B 由三部分组成一个完全冻结的 Qwen3-8B 编码器以及两个仅约 20M 参数的投影头——状态头state head与动作头action head。状态和动作被编码器分别映射为 last-token 池化的 4096 维向量再经各自的投影头进入共享对比空间以双向 InfoNCE 损失训练README.md。这种分离编码设计是后续一切性能优势的地基状态和动作在推理时不需要成对计算。动作侧是相对固定的候选集合工具名、补丁、下一步操作其嵌入可以被预缓存运行时只需编码当前状态一次再与全部候选嵌入做点积打分。训练分三阶段数据配比很能说明问题约 60M Nemotron QA 对做对比预训练建立状态-动作语义对齐约 30M 合成难负样本强化判别边界——这是对比学习提升排序能力的核心约 1M 条 Agentic 轨迹做后训练把模型拉向真实决策分布。推理一次前向 缓存复用 点积from clm import Engine engine Engine(emb_urlhttp://127.0.0.1:8090/v1/embeddings) engine.rank(What causes tides on Earth?, [The Moons gravitational pull., Photosynthesis in plants., Because the Earth is round.]) # [{rank: 1, candidate: The Moons gravitational pull., prob: 0.993}, ...]这段来自 README.md 的代码展示了最典型的用法给一个状态和一堆候选返回排序与相对概率。因为动作嵌入可复用、无需自回归解码延迟数据非常可观——官方口径是零样本任务上精度与 Jev 相当、延迟最高低 9 倍当候选规模达到约 1000 个时凭借缓存复用可达到 13 倍社区实测其 p50 延迟低至 28ms 量级。除自由候选排序外模型还支持三种有类型的问题详见 README.md 示例Choice多选项分类返回各选项概率、Score有序量表打分、Noul开放式二元/判断类问题。这套接口直接兼容 Jev迁移成本几乎为零恰好覆盖了工单路由、情绪监控、答案验证等候选集合稳定的场景。验证器才是杀手锏75MB 换两个 SOTACLM 更惊艳的表现出现在验证器角色上。由于只有投影头可训练微调成本极低仓库给出的一行命令即可启动微调见 README.md 的 Fine-tuning 一节。基于该 checkpoint 微调出的验证器头在DeepSWE 上达到 81.6% resolved rate在Terminal-Bench 2.1 上达到 87.6%双双刷新 SOTA而验证延迟仅为 Jev 的 1/4 到 1/6。整个验证器权重约 75MB——用 8B 生成器产候选用 75MB 验证器来排候选成为代码生成与 Agent 轨迹筛选的最佳实践组合。社区甚至把它当作免费重排序器一次对上千个候选打分用于 Best-of-N、工具名与下一步动作排序。一周热度轨迹与下一步值得盯的信号这条热度曲线相当陡峭梳理时间线有助于判断它的真实分量9 月 24 日凌晨Hugging Face 仓库建仓模型权重上线9 月 26 日首轮技术解读出现双塔架构、三阶段训练、13× 加速等细节被逐条拆解9 月 28 日—29 日解读进入密集期Playground 搭建、API 详解、与 Jev 的延迟之争、DeepSWE/Terminal-Bench SOTA 全解析集中爆发社区开始把它与System One 模型这一概念绑定10 月 5 日前后项目冲上 GitHub 热榜第 6 位静态源码审计类文章跟进Apache-2.0 合规性与工程轻量化成为讨论焦点10 月 8 日star 数突破 2900社区关注点从它快不快转向它该用在哪。热度之下社区也给出几处冷静的提醒这些在官方 README.md 的 Limitations 一节都能找到对应编码器锁定投影头依赖 Qwen3-8B 的 last-token 池化嵌入换骨干等于重训不生成、只打分概率是相对于给定候选集合的候选集覆盖不全时结论可能失真有用户指出在部分分布外问题上存在三态坍缩与词面偏差中文场景支持也偏弱SOTA 需要微调81.6% 与 87.6% 来自微调后的验证器头而非本 checkpoint 零样本直接可用部署时别混淆。接下来值得盯的三个信号其一是CLM-35B 多模态版本官方预告 10 月初发布更多数据、算力与参数主打更强泛化见 README.md它将检验这套范式能否从窄场景验证器走向通用决策层其二是微调生态——两个投影头即可适配业务低成本微调很可能催生一批垂直验证器其三则是与生成式模型的协同编排生成候选 CLM 排序能否成为 Agent 架构的新默认范式。CLM 的意义不在于取代生成式模型——它明确不生成任何文本。它的价值在于重新划分了 Agent 计算的分工需要创造力的部分留给生成需要判断力的部分交给一次点积。当决策被压缩成向量匹配Agent 的思考税第一次有了可量化的下限。【免费下载链接】CLM-v0.1-8B项目地址: https://ai.gitcode.com/hf_mirrors/Contrastive-LM/CLM-v0.1-8B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

视频号视频下载工具,一键提取!【手机+电脑端】

视频号视频下载工具,一键提取!【手机+电脑端】

刷视频号时,总能刷到优质干货、治愈风景、实用教程视频,想保存收藏、二次剪辑做素材,无法直接保存本地,十分不方便。今天分享一款免费无广告、界面简洁、高清无水印的视频号视频提取神器,无需注册登录,手机…

2026/10/11 13:21:55 阅读更多 →
Beekeeper Studio:轻量跨数据库SQL客户端实战指南

Beekeeper Studio:轻量跨数据库SQL客户端实战指南

简介:Beekeeper Studio 是一款开源跨平台 SQL 客户端,专为数据库开发者、运维工程师及数据分析师设计,支持 MySQL、PostgreSQL、SQLite、SQL Server 等主流关系型数据库,解决传统工具界面陈旧、操作繁琐、多库管理低效等痛点&…

2026/10/11 13:21:55 阅读更多 →
本地大模型也能做智能体?Ollama+Python搭建离线AI助手完整教程​

本地大模型也能做智能体?Ollama+Python搭建离线AI助手完整教程​

一、引言:从"能聊天"到"能干活"的鸿沟 过去两年,本地大模型的部署门槛被 Ollama 拉到了几乎为零:一条 ollama run qwen2.5:7b,消费级显卡甚至纯 CPU 都能跑起来。但很多人跑完就陷入了同一个困惑——它能对话…

2026/10/11 13:21:55 阅读更多 →

最新新闻

多Agent共享桌面:agent-desktop共享会话与Cursor Overlay光标覆盖层实战

多Agent共享桌面:agent-desktop共享会话与Cursor Overlay光标覆盖层实战

GUI 自动化AI 应用桌面应用AI 技能 【免费下载链接】agent-desktop Agent Desktop gives any agent reliable computer use on the desktop. Built with Rust, it sees any apps real UI structure through OS accessibility trees and operates it — refs stay stable and ac…

2026/10/11 14:13:22 阅读更多 →
google-research TaskSet 中的 losg_problems 优化问题集:从 LOSG 到可扩展的元学习优化器基准

google-research TaskSet 中的 losg_problems 优化问题集:从 LOSG 到可扩展的元学习优化器基准

人工智能深度学习NLP计算机视觉强化学习 【免费下载链接】google-research Google Research 项目地址: https://gitcode.com/gh_mirrors/go/google-research 点击查看 免费下载 本技术指南围绕 task_set/tasks/losg_problems/README.md 展开,系统讲解 g…

2026/10/11 14:13:22 阅读更多 →
自动化立体仓库规划与评估:从尺寸计算到节拍仿真

自动化立体仓库规划与评估:从尺寸计算到节拍仿真

简介:文档包围绕物流规划中自动化立体仓库的规划与评估展开,适合物流规划从业者、仓储系统设计人员及相关专业学生使用。内容从立体仓库的五大优点切入,系统梳理收货、存货、取货、发货、信息查询五大功能,并重点拆解规划设计流程…

2026/10/11 14:13:22 阅读更多 →
Obsidian+WorkBuddy+Gitee 构建可追溯的AI增强知识工作流

Obsidian+WorkBuddy+Gitee 构建可追溯的AI增强知识工作流

1. 这套组合到底在解决什么真实痛点?我第一次把 Obsidian、WorkBuddy 和 Gitee 拼在一起用,不是为了炫技,而是被逼出来的。当时手头有三类内容长期处于“失联”状态:一是某跨平台系统项目里零散的会议纪要和接口草稿,存…

2026/10/11 14:13:22 阅读更多 →
光伏发电预测系统实战:从压缩包到可落地预测链路

光伏发电预测系统实战:从压缩包到可落地预测链路

简介:光伏发电预测系统是一套基于Python与Flask框架构建的完整Web工程,采用前后端分离架构,面向新能源发电预测方向的学习者、算法工程师与电力数据研究人员,用于解决光伏功率短期预测、多模型对比与结果可视化等问题。压缩包共约…

2026/10/11 14:13:22 阅读更多 →
AgentEvolver经验管理深度指南:用Self-Navigating与ReMe经验池让Agent学会复用经验

AgentEvolver经验管理深度指南:用Self-Navigating与ReMe经验池让Agent学会复用经验

【免费下载链接】AgentEvolver AgentEvolver: Towards Efficient Self-Evolving Agent System 项目地址: https://gitcode.com/gh_mirrors/ag/AgentEvolver 点击查看 免费下载 AgentEvolver 是一款面向高效自进化 Agent 系统(Self-Evolving Agent Syste…

2026/10/11 14:12:21 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →