ICLR 2026 | 面向序列决策的贝叶斯集成方法
文章转自“京东零售技术”公众号本文导读本文提出了Bayesian EnsembleBE它可以理解为加在现有 ensemble 方法之上的一个轻量级贝叶斯层除了更新每个 base model 的参数我们还通过观测到的 reward动态更新“该抽哪个 ensemble 成员”的索引分布。换句话说成员选择本身不再是固定随机的而是一个随着反馈不断校正的贝叶斯过程。基于这个统一框架我们进一步提出了面向 bandit 的Bayesian Ensemble BanditBEB以及面向强化学习的Bayesian Ensemble DQNBE-DQN。在合成环境和真实环境上的大量实验都表明这种做法既有效也足够高效。基于本工作的论文已被 ICLR2026 接收欢迎阅读交流。· 链接https://openreview.net/pdf?ids2hxd8JghB· 论文Bayesian Ensemble for Sequential Decision-Making01摘要在这篇工作中我们关注的是不确定性下的序列决策问题典型场景包括推荐系统里的在线决策以及强化学习中的探索与利用。已有很多 ensemble-based 方法会用多个模型来近似后验分布再从中随机选一个成员做决策。但这些方法通常有一个共同限制它们默认 ensemble 成员的采样分布是固定的比如简单地均匀采样。这样做忽略了一个事实——不同 ensemble 成员本身的质量、偏好和有效性可能会随着训练过程逐渐拉开差异。因此我们提出了Bayesian EnsembleBE。它可以理解为加在现有 ensemble 方法之上的一个轻量级贝叶斯层除了更新每个 base model 的参数我们还通过观测到的 reward动态更新“该抽哪个 ensemble 成员”的索引分布。换句话说成员选择本身不再是固定随机的而是一个随着反馈不断校正的贝叶斯过程。基于这个统一框架我们进一步提出了面向 bandit 的Bayesian Ensemble BanditBEB以及面向强化学习的Bayesian Ensemble DQNBE-DQN。在合成环境和真实环境上的大量实验都表明这种做法既有效也足够高效。02引言这篇文章的出发点来自一个经典问题在不确定环境中智能体该如何平衡 exploration 和 exploitation。这个问题在推荐系统和强化学习里都非常核心。最经典的建模方式之一是Thompson Sampling维护一个关于奖励分布参数的后验每一轮从后验里采样一个参数再基于这个参数去选动作。它的优势在于探索是由不确定性自然驱动的。但问题在于一旦我们用神经网络去建模复杂的 context–reward 关系精确维护后验分布几乎是不可行的。因此实际工作里大家往往使用各种近似贝叶斯方法比如 variational inference、MCMC、dropout、gradient-based posterior sampling以及 ensemble-based 方法。其中ensemble 方法之所以特别受欢迎是因为它实现简单、泛化性强而且在很多实际任务中效果稳定。不过现有 ensemble-based Thompson Sampling 还有一个被忽视的问题大家通常只在更新 ensemble 成员的参数却不更新成员索引本身的采样分布。也就是说模型在学但“抽谁来做决策”这件事没学。可在实际中不同成员由于随机初始化、prior function 等因素表现并不等价。基于这个观察我们的核心主张是不确定性不仅存在于模型参数中也存在于 ensemble 成员之间因此索引分布也应该被纳入贝叶斯更新。这正是本文想补上的那一块。03方法统一框架Bayesian Ensemble一个关键点在于对于 ensemble 参数 θ我们依然沿用现有方法常见的做法用 surrogate loss 做经验风险最小化但对于索引分布 p我们不再借助 surrogate loss而是直接围绕长期累积 reward 去更新。原因很简单相比庞大的网络参数索引分布的参数量通常很小更适合直接做精确或近似的贝叶斯推断。这个设计是本文相较于已有 ensemble-based TS 方法最本质的区别。面向 BanditBayesian Ensemble Bandit在 contextual bandit 场景中我们用一个 ensemble 网络来输出 reward 的概率分布。每轮先从当前索引分布里采样一个成员再由该成员在候选动作集合上挑选期望 reward 最大的动作。动作执行后我们利用新样本同时更新 ensemble 参数和索引分布。这个算法就是Bayesian Ensemble BanditBEB。它不是替代现有 ensemble bandit而是可以增强现有方法。为了说明这一点文中给了两个代表性实例。第一个是ensemble。原始 ensemble 使用均匀分布在多个 ensemble 成员中随机选一个。我们在 BEB 下把每个成员对应一个 Beta 分布参数用 Beta-Bernoulli 的共轭关系根据实际 reward 对成员选择分布做精确贝叶斯更新。直觉上它等于让“哪个成员更值得被抽到”这件事随着反馈自动学出来。第二个是hypermodel。原始 hypermodel 使用标准高斯分布采样连续索引再通过 hypernetwork 映射成模型参数。我们则进一步把这个连续索引分布做成可学习的高斯分布学习每个维度的均值和方差并用 variational inference 去近似后验。换句话说我们不仅保留了 hypermodel 的连续索引表达能力还把索引本身也变成一个可自适应更新的贝叶斯对象。面向强化学习Bayesian Ensemble DQN除了 bandit我们还把这一思想扩展到了强化学习提出了BE-DQN。它维护 k 个独立的 Q-network每个网络对应一个 Beta 分布。每一轮先从这些 Beta 分布里采样出权重再选出当前最优的那个 Q-network 负责动作选择但在 target Q 的构造时并不是只用单个网络而是对所有 Q-network 做加权聚合。这个设计有两个好处。第一它继承了 ensemble 方法降低方差、稳定训练的优点第二它不像传统 Ensemble DQN 或 Random Ensemble DQN 那样使用固定或随机的组合方式而是让“哪个估计器更值得信”也能随着 reward 自适应变化。文中进一步给出了理论分析在一个单向 MDP 环境里BE-DQN 的 Q-value 方差上界与标准 DQN 一致下界与 Ensemble DQN 一致。这说明它至少不会比 DQN 更不稳定同时又保留了比纯平均 ensemble 更强的探索能力。04实验合成环境Neural Testbed 和 Mushroom我们先在两个 bandit 风格环境里验证方法。一个是Neural Testbed它通过神经网络生成 ground-truth reward 分布可以精确计算 regret另一个是Mushroom把蘑菇可食用性数据集转化成一个二元决策问题智能体需要决定是否选择当前蘑菇。在 Neural Testbed 上我们设置动作维度 (d2,10,50)时间跨度为 20,000 步。结果显示无论问题简单还是复杂BEB 版本都在全程显著优于原始 baseline。到最后一步时ensemble(BEB) 相对 ensemble 的 regret 分别下降37.0%、12.8%、42.2%hypermodel(BEB) 相对 hypermodel 的 regret 分别下降69.8%、22.8%、30.3%。在 Mushroom 数据集上BEB 版本同样始终更优最终 ensemble(BEB) 和 hypermodel(BEB) 分别带来8.7%和4.8%的提升。换句话说不管是离散索引还是连续索引只要把索引分布也学起来探索效率就会更高。我们还专门分析了时间开销。对于 ensemble因为 Beta-Bernoulli 更新是共轭的几乎没有额外耗时而对于 hypermodel由于需要 variational inferenceBEB 版本比原始方法大约多20%的计算时间。这个结果也说明BE 的额外成本主要取决于索引分布的更新方式本身而不是框架设计带来的硬性负担。真实推荐环境Yahoo!R6B为了验证方法在真实序列决策场景中的表现我们进一步在Yahoo!R6B新闻推荐数据集上做了实验。这个数据集包含 2800 万次用户访问日志每条样本包括用户特征、展示文章、候选文章集合以及点击标签。由于真实最优奖励不可见我们用累计点击数作为评价指标。在这个实验里我们主要评测 hypermodel 系列因为 ensemble 的计算开销更大。结果显示hypermodel(BEB)达到了50,322.1 ± 1,487.2次点击高于原始 hypermodel 的49,676.8 ± 1,355.7也明显优于 Random、Greedy、ϵ-Greedy、MC Dropout 和 Gradient TS 等方法。这个结果说明BE 并不只是一个合成环境里的技巧而是能够在真实推荐任务中带来更强的探索效率和更好的点击收益。强化学习环境MiniGrid在强化学习部分我们选择了MiniGrid中五个任务FourRooms、Empty-6x6、LavaGapS5、GoToDoor-5x5 和 MultiRoom-N2-S4用来评测BE-DQN。对比方法包括 vanilla DQN、Ensemble DQN、Random Ensemble DQN以及 UAAC。整体结果表明BE-DQN 在这些任务上表现最强或最稳健。例如在 Empty-6x6、LavaGapS5、GoToDoor-5x5 和 MultiRoom-N2-S4 上BE-DQN 的平均 reward 都是表中最优在 FourRooms 上也优于其余多数 baseline。论文里对此的解释是传统 DQN 依赖单一 Q-value estimator鲁棒性差E-DQN 和 RE-DQN 虽然有所缓解但由于权重机制静态或随机无法持续偏向更优的 Q-estimator而 BE-DQN 能动态更新不同 Q-network 的重要性分布从而更好地兼顾探索、利用和训练稳定性。另外附录里还补充了更多实证结论比如在 Yahoo!R6B 的 100 万样本子集上ensemble(BEB) 比 ensemble 再提升约3%随着 ensemble size 从 25 增大到 100ensemble(BEB) 相对 ensemble 的 regret reduction 从28.23%提升到47.97%这也说明我们的框架在更大的 ensemble 上反而更能发挥优势。05参考文献本文的参考文献大致可以分成四条主线。第一条是Thompson Sampling 与 bandit 理论。这里包括 Thompson (1933)、Russo et al. (2018)、Li et al. (2010)、Chapelle Li (2011)、Lattimore Szepesvari 等工作它们奠定了“基于后验采样做探索”的基本范式也是我们将 ensemble 成员选择视作贝叶斯决策问题的理论起点。第二条是深度不确定性建模与 ensemble posterior sampling。比如 deep ensembles、randomized prior functions、hypermodel、Epistemic Neural Networks、Ensemble Sampling 等工作共同构成了我们方法的直接技术背景。我们的工作与这些方法的关系不是推翻而是前进一步它们主要学模型参数我们进一步去学索引分布。第三条是强化学习中的 ensemble 方法。包括 DQN、Ensemble DQN、Random Ensemble DQN、Reset Deep Ensemble、HyperDQN、HyperAgent 等。这些工作说明 ensemble 在 RL 中确实可以帮助稳定训练、增强探索而我们的 BE-DQN 可以理解为在此基础上加入一个“贝叶斯化的动态成员选择机制”。第四条是实验基准与应用背景。例如 Neural Testbed、Yahoo!R6B、MiniGrid、Mushroom 数据集等这些基准分别对应了合成 bandit、真实推荐、强化学习与经典决策数据集使我们能够从多个角度验证方法的有效性与泛化性。

相关新闻

AI Agent质量保障:从可观测性到工程化干预的实践指南

AI Agent质量保障:从可观测性到工程化干预的实践指南

1. 项目概述:从“玄学”到“工程”的必经之路如果你正在或计划构建一个AI Agent,那么“输出质量不稳定”这个问题,大概率已经让你头疼不已了。今天,我们就来聊聊如何把AI Agent的输出质量保障,从一个靠运气、看“人品”…

2026/9/26 18:06:13 阅读更多 →
计算机毕设选题推荐:Hadoop+Django食管癌数据可视化分析系统源码 毕业设计 选题推荐 毕设选题 数据分析 源码 机器学习 深度学习

计算机毕设选题推荐:Hadoop+Django食管癌数据可视化分析系统源码 毕业设计 选题推荐 毕设选题 数据分析 源码 机器学习 深度学习

✍✍计算机编程指导师 ⭐⭐个人介绍:自己非常喜欢研究技术问题!专业做Java、Python、小程序、安卓、大数据、爬虫、Golang、大屏等实战项目。 ⛽⛽实战项目:有源码或者技术上的问题欢迎在评论区一起讨论交流! ⚡⚡如果你遇到具体的…

2026/10/3 6:25:51 阅读更多 →
宜选科技构建“五层数字增长架构” 打造外贸企业智能获客新体系

宜选科技构建“五层数字增长架构” 打造外贸企业智能获客新体系

随着人工智能加速融入信息搜索、供应商筛选和采购决策,全球贸易营销模式正在发生深刻变化。对于外贸企业而言,独立站已不再只是产品展示窗口,而需要升级为集内容建设、流量获取、商机转化和数据优化于一体的数字增长体系。业内认为&#xff0…

2026/10/3 12:48:27 阅读更多 →

最新新闻

vue-plugin-hiprint:可视化拖拽的 Vue 打印模板设计器

vue-plugin-hiprint:可视化拖拽的 Vue 打印模板设计器

给项目加打印功能,听起来不就是调一下window.print()吗?但凡是接过自定义打印模板需求的人,都不会这么想。业务方要的不是把网页原样打出来,而是按照他们的格式来——订单要一张三联单,质检要一张带条码的报表&#xf…

2026/10/4 7:40:06 阅读更多 →
Android智能健身助手APP开发实战:MVVM架构与核心功能实现

Android智能健身助手APP开发实战:MVVM架构与核心功能实现

1. 项目定位与功能边界:一个Android健身助手究竟该做什么接到"基于Android的智能健身助手APP"这个题目时,我第一反应不是去列功能清单,而是先想清楚一件事:这个APP到底是给谁用、解决什么痛点?市面上健身类应…

2026/10/4 7:40:06 阅读更多 →
OpenRig 活动钩子设计全解:/api/activity/hooks 如何做到绝不泄露提示词

OpenRig 活动钩子设计全解:/api/activity/hooks 如何做到绝不泄露提示词

OpenRig 活动钩子设计全解:/api/activity/hooks 如何做到绝不泄露提示词 【免费下载链接】openrig Build your own network of agents from Claude Code, Codex and Pi: persistent teams with roles, shared context and owned work. 项目地址: https://gitcode.…

2026/10/4 7:40:06 阅读更多 →
Angular 模板中的 @for 内置控制流:列表渲染、track 表达式与 DOM 高效更新实战

Angular 模板中的 @for 内置控制流:列表渲染、track 表达式与 DOM 高效更新实战

文档教程知识库 【免费下载链接】developer-roadmap Interactive roadmaps, guides and other educational content to help developers grow in their careers. 项目地址: https://gitcode.com/GitHub_Trending/de/developer-roadmap 点击查看 免费下载 for 是 An…

2026/10/4 7:40:06 阅读更多 →
气象数据处理必备:面积加权平均原理与Matlab实现

气象数据处理必备:面积加权平均原理与Matlab实现

做气象数据处理的人应该都有过这种经历:拿到一套全球格点数据,比如 CMIP6 的月平均降水,或者 ERA5 的逐时温度,第一反应就是mean(mean(data, 1), 2),然后画一条区域平均的时间序列。但画出来之后,发现曲线的…

2026/10/4 7:40:06 阅读更多 →
AI辅助接口设计与异常处理:中小型项目提效实战指南

AI辅助接口设计与异常处理:中小型项目提效实战指南

接口设计这件事,很多人觉得是架构师才需要操心的活儿,写业务代码的时候随手定义几个字段、返回个 200 就完事了。但真正做过线上项目的人都知道,接口设计不到位、异常处理没跟上,后期排查问题的时间成本能占到整个开发周期的四成以…

2026/10/4 7:39:06 阅读更多 →

日新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 10:36:31 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/3 9:42:35 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/3 9:42:36 阅读更多 →