不训练、不加模型、还能再省 32% 推理时间:上交 ParaTempo 把「置信度」重新定义了一遍
不训练、不加模型、还能再省 32% 推理时间上交 ParaTempo 把「置信度」重新定义了一遍Hugging Face 每日论文2026-08-24 精选8 月 24 日 Hugging Face 每日论文榜第五名的位置是一篇没有任何新增训练的论文上海交通大学计算机系本科生 Xuteng Zhang 和 Wenhao Zeng 牵头、与微软亚研、华为等团队合作的 ParaTempoarxiv:2608.16425。它只给出了一个新信号叫「时间置信度」temporal confidence就把并行推理的延迟压低了 21.8% 到 32.2%token 用量压低了 18.1% 到 30.3%准确率还跟原来持平。这是一篇完全免训练、纯运行时就能直接拿来用的论文。一件反直觉的事「并行」本身就是浪费并行推理parallel reasoning是过去一年最常见的「让大推理模型再准一点」的办法让模型同时沿多条思路推下去再投票得到最终答案。原理上看只要分得够多模型就有更大概率踩到对的路径但代价是算力随分支数线性增长——分支越多token 越多延迟越长。更尴尬的是传统并行推理对「该砍哪一条分支、该新开哪一条分支、什么时候停下来」几乎一问三不知等所有分支都跑完投票再决定开销最大用单步 token 的瞬时置信度判断信号噪声太大抽中间步骤单独验证又会卡同步开销这三个老办法共同的毛病是把「该不该继续、该不该停」这件事放在了「token 级」或者「全模型级」上——这两个粒度一个太细、一个太粗跟一条分支到底走没走到答案的「真实收敛状态」完全错位。时间置信度把判定信号搬到「分支级」ParaTempo 的核心贡献就是把信号粒度从 token 级挪到分支级提出一个叫「时间置信度」的指标。它是这样算的每条分支跑的时候周期性地从分支当前状态里抽出一个「暂定答案的概率分布」说白了就是问这条分支现在的判断偏向哪个选项时间置信度 最近若干次抽出的概率分布在多大程度上集中到同一个主导答案上一旦时间置信度高、且稳定就说这条分支「事实上已经收敛」注意这里的关键点信号只看分支自己、且只看最近一段时间的探测结果。所以它天然抵抗两类噪声token 级别的偶发低置信某个字写错了不影响整条路径跨分支同步各跑各的不必等其他分支这种「只看自己最近表现」的信号之所以靠谱论文里给了一个直观解释推理路径上的 token 大多数是冗余的真正决定答案的时刻只有几个——只要探测抽中其中之一分布就会突然收敛到某个答案上并保持稳定。ParaTempo 等的就是这种「分布锁死」的时刻。不用训练的「异步调度器」剪、停、生三件套拿到时间置信度之后ParaTempo 用一个非常简洁的调度器去用它低置信度分支直接被剪掉pruned这条路大概率走偏了不值得继续烧算力高置信度、长期锁死主导答案的分支被提前终止retired early它已经收敛再跑也是重复 token释放出来的算力立刻被用来派生新分支forking new branches把资源补到那些正在犹豫、还有戏的路径上全局停止的触发条件是置信度加权投票已经集中到同一个答案上这套调度器是异步的分支之间不必相互等待。这就是为什么 ParaTempo 在「不用新增训练」的前提下还能省出 30% 左右的延迟——它根本不需要让所有分支对齐到一个节拍。调度动作触发信号节省的算力去向剪枝低置信分支时间置信度持续偏低算力立即用于派生新分支提前终止收敛分支时间置信度长时间稳定在主导答案算力立即用于派生新分支派生新分支上述两条释放的算力沿父分支未探索的语义空间继续全局停止置信度加权投票集中整体推理结束论文里强调这种调度方式天然适配任何一种「采样式」推理把模型权重、温度、采样策略全部封进原始分支调度器只看「这条分支什么时候收敛」。实验省下来的不只是时间还有 token论文在多个「有挑战性的数学与科学推理基准」上做了对照覆盖了主流的 LLM 推理模型具体名单论文里给出。三条最关键的结果平均延迟下降 21.8% 到 32.2%不同基准、不同模型上、下限都稳定在这个区间总 token 用量下降 18.1% 到 30.3%意味着省的不只是延迟也包括 API 费用——这是面向生产部署最直观的好处准确率与现有并行方法保持竞争力所谓「竞争力」指的是跟那些「把所有分支跑完再投票」的「保守并行」相比单条分支的命中率没有掉把这三个数放在一起看会发现一个不容易被忽视的事实ParaTempo 不只是把推理做快了而是把「推理 算力」的等式两端同时压了下来。延迟是左端、token 是右端一篇免训练的论文同时压住了两端这是它能上 Hugging Face 当日榜第五名25 票赞的根本原因。为什么这件事值得一篇论文分支级信号过去没人认真做过ParaTempo 给的最大启示其实不是延迟数字本身而是「分支级信号」这个研究缝隙。过去几年并行推理的研究集中在两件事上怎么生成更好的分支更好的 prompt、更好的采样以及怎么在所有分支都跑完之后做更好的投票。这两件事都默认「分支之间是同步的、必须跑完整」。但 ParaTempo 的核心论点是分支级的中间信号足以让你提前做决定、不必等所有分支跑完。这和过去「token 级置信度」「最终投票」两条路线相比是一种新粒度的信号——它既不像 token 级那样噪声大也不像最终投票那样开销大。从研究脉络上看这篇论文和 OpenAI o1、DeepSeek R1 之后的「scaling reasoning」浪潮直接相关。当各家把推理做得越来越深、token 越来越多节省「无效 token」就成了新的性能瓶颈。ParaTempo 给出的解法不是「训一个更聪明的剪枝器」而是「用一个对的时间信号去触发已经存在的剪枝器」——这是工程味很重、但同时又很有学术价值的一种轻量路线。局限与未解问题信号再轻也有适用边界ParaTempo 自己也承认了几条边界。第一时间置信度依赖「暂定答案概率分布」可以被周期性抽取。这意味着推理过程里必须能问模型「你现在倾向哪个答案」这对开放式生成比如写长文章是不可行的——开放式任务没有明确候选答案。论文的实验集中在数学和科学推理正因为这些任务的答案是离散的、可枚举的。第二调度器的剪枝动作非常激进——一旦判定低置信度就立刻砍掉分支。这意味着对一些「需要尝试错误、试错很久才能走通」的难题ParaTempo 可能会过早终止一条本来能成功的分支。论文对此的应对是「置信度加权投票集中才停止」但这种做法在「多答案」或「答案分布很平坦」的任务上未必有效。第三「不用训练」是把双刃剑。它意味着工程师今天就能在自己的推理栈里加一个 ParaTempo 调度器——但也意味着没有可调参数、没有可微优化空间所有改进只能来自信号设计本身。当未来前沿模型的「分支内部行为」进一步变化时ParaTempo 是不是还能保持 30% 的节省幅度需要重新验证。工程上现在就能用代码已经开源ParaTempo 的代码和数据集已经开源在 GitHub仓库名 ScottZhang812/ParaTempo是那种「读论文的同时就能上生产环境跑一遍」的工程友好型论文。对于今天已经在做大模型推理服务、又被 token 账单困扰的团队来说这是 2026 年 8 月最值得做一次对照实验的论文之一。把 ParaTempo 读完最值得带走的认知是「信号」比「模型」更便宜。当一个 AI 系统的瓶颈不是「模型够不够聪明」而是「算力够不够用」时重新设计一个更轻的信号往往比换一个更大的模型更值得投入。这件事 ParaTempo 用一组数字证明了一回而它的具体做法——把判定粒度从 token 级挪到分支级——也给了后续研究者一条清晰可延伸的路线。

相关新闻

学一下Transform(TODO1)

学一下Transform(TODO1)

1 Transform基础 Transformer 是谷歌 2017 年提出、完全基于自注意力机制(Self‑Attention) 的深度学习基础架构,抛弃了 RNN/LSTM 的循环串行结构,支持输入序列全局并行计算,能够直接捕捉文本、图像等数据里长距离元素…

2026/8/26 13:54:54 阅读更多 →
SenseNova-U1.5-8B-MoT图像编辑完全指南:局部替换、文字编辑与多参考图5大实操技巧

SenseNova-U1.5-8B-MoT图像编辑完全指南:局部替换、文字编辑与多参考图5大实操技巧

SenseNova-U1.5-8B-MoT图像编辑完全指南:局部替换、文字编辑与多参考图5大实操技巧 【免费下载链接】SenseNova-U1.5-8B-MoT SenseNova-U1.5-8B-MoT 是商汤最新的原生统一多模态权重,面向更准确、更一致、更可靠且更具审美表现力的视觉创作。基于 NEO-un…

2026/8/26 13:54:54 阅读更多 →
苹果设备管理为什么更依赖官方框架?从设备归属到策略管理的完整解析

苹果设备管理为什么更依赖官方框架?从设备归属到策略管理的完整解析

在移动设备管理领域,有一个问题经常被客户问到:“苹果手机到底怎样管理才稳定?”这个问题看似简单,但实际上涉及设备归属、系统能力、企业管理流程以及长期运营维护等多个方面。很多企业刚开始接触设备管理时,关注点往…

2026/8/26 13:54:54 阅读更多 →

最新新闻

5分钟上手StackExchange.Redis.Extensions:安装、配置与快速入门完整指南

5分钟上手StackExchange.Redis.Extensions:安装、配置与快速入门完整指南

5分钟上手StackExchange.Redis.Extensions:安装、配置与快速入门完整指南 【免费下载链接】StackExchange.Redis.Extensions StackExchange.Redis.Extensions is a library that extends StackExchange.Redis, making it easier to work with Redis in .NET applica…

2026/8/26 14:26:35 阅读更多 →
DPJ-83基于STM32单片机wifi智能寝室室内环境检测系统

DPJ-83基于STM32单片机wifi智能寝室室内环境检测系统

1、前言 这两年开始毕业设计和毕业答辩的要求和难度不断提升,传统的毕设题目缺少创新和亮点,往往达不到毕业答辩的要求,这两年不断有学弟学妹告诉洪核学长自己做的项目系统达不到老师的要求。为了大家能够顺利以及最少的精力通过毕设&#xf…

2026/8/26 14:26:35 阅读更多 →
我是Java程序员廖志伟

我是Java程序员廖志伟

📕我是廖志伟,一名Java领域优质创作者、CSDN博客专家、阿里云专家博主、51CTO专家博主 、产品软文专业写手、技术文章评审老师、技术类问卷调查设计师、幕后大佬社区创始人、开源项目贡献者、清华大学出版社签约作家。 📘不定期分享高并发、高…

2026/8/26 14:26:35 阅读更多 →
InternVL3.5-4B为何推理这么强?Cascade RL训练管线(MPO+GSPO)原理全解

InternVL3.5-4B为何推理这么强?Cascade RL训练管线(MPO+GSPO)原理全解

InternVL3.5-4B为何推理这么强?Cascade RL训练管线(MPOGSPO)原理全解 【免费下载链接】InternVL3_5-4B 项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B 如果你正在关注 InternVL3.5-4B 这个小体积多模态大模…

2026/8/26 14:26:35 阅读更多 →
4步蒸馏技术揭秘:MiniMax-H3 Turbo-SLA如何将30步压缩到4步

4步蒸馏技术揭秘:MiniMax-H3 Turbo-SLA如何将30步压缩到4步

4步蒸馏技术揭秘:MiniMax-H3 Turbo-SLA如何将30步压缩到4步 【免费下载链接】Minimax-h3-Turbo-SLA 项目地址: https://ai.gitcode.com/hf_mirrors/lightx2v/Minimax-h3-Turbo-SLA MiniMax-H3 Turbo-SLA 是一个面向图生视频(FL2V)场景…

2026/8/26 14:26:34 阅读更多 →
ajax的使用、json、jquery

ajax的使用、json、jquery

json其实就是一种字符串格式,可以用一种特殊格式的字符串表示对象function testAjax(){}success:function(list){}跨域:dataType:“jsonp”jsonp:"aaa"

2026/8/26 14:25:33 阅读更多 →

日新闻

Python random 模块常用函数详解:从入门到实战

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 0:00:40 阅读更多 →
《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》索引目录: 《Microsoft Sql server 2008 Internals》读书笔记--目录索引 在上篇文章中,主要介绍了创建数据库的基本语法和FileGroup的初步知识。需要注意的是: 关于FileGroup 如果你的系统是用Raid设备直接存…

2026/8/26 1:18:18 阅读更多 →
政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体已经从概念试点阶段,转入了政务服务的常态化落地应用;在实际使用过程中,它能自主理解办事需求、辅助完成填报申报、开展材料预审,并联动多个系统协同作业,真正嵌入到政务办理的全流程当中。但在落地推进过…

2026/8/26 1:18:18 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/25 3:38:12 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/25 3:38:18 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/25 3:38:23 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/26 3:50:20 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/25 10:31:12 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/26 1:24:05 阅读更多 →