ICLR 2026 | 面向序列决策的贝叶斯集成方法
文章转自“京东零售技术”公众号本文导读本文提出了Bayesian EnsembleBE它可以理解为加在现有 ensemble 方法之上的一个轻量级贝叶斯层除了更新每个 base model 的参数我们还通过观测到的 reward动态更新“该抽哪个 ensemble 成员”的索引分布。换句话说成员选择本身不再是固定随机的而是一个随着反馈不断校正的贝叶斯过程。基于这个统一框架我们进一步提出了面向 bandit 的Bayesian Ensemble BanditBEB以及面向强化学习的Bayesian Ensemble DQNBE-DQN。在合成环境和真实环境上的大量实验都表明这种做法既有效也足够高效。基于本工作的论文已被 ICLR2026 接收欢迎阅读交流。· 链接https://openreview.net/pdf?ids2hxd8JghB· 论文Bayesian Ensemble for Sequential Decision-Making01摘要在这篇工作中我们关注的是不确定性下的序列决策问题典型场景包括推荐系统里的在线决策以及强化学习中的探索与利用。已有很多 ensemble-based 方法会用多个模型来近似后验分布再从中随机选一个成员做决策。但这些方法通常有一个共同限制它们默认 ensemble 成员的采样分布是固定的比如简单地均匀采样。这样做忽略了一个事实——不同 ensemble 成员本身的质量、偏好和有效性可能会随着训练过程逐渐拉开差异。因此我们提出了Bayesian EnsembleBE。它可以理解为加在现有 ensemble 方法之上的一个轻量级贝叶斯层除了更新每个 base model 的参数我们还通过观测到的 reward动态更新“该抽哪个 ensemble 成员”的索引分布。换句话说成员选择本身不再是固定随机的而是一个随着反馈不断校正的贝叶斯过程。基于这个统一框架我们进一步提出了面向 bandit 的Bayesian Ensemble BanditBEB以及面向强化学习的Bayesian Ensemble DQNBE-DQN。在合成环境和真实环境上的大量实验都表明这种做法既有效也足够高效。02引言这篇文章的出发点来自一个经典问题在不确定环境中智能体该如何平衡 exploration 和 exploitation。这个问题在推荐系统和强化学习里都非常核心。最经典的建模方式之一是Thompson Sampling维护一个关于奖励分布参数的后验每一轮从后验里采样一个参数再基于这个参数去选动作。它的优势在于探索是由不确定性自然驱动的。但问题在于一旦我们用神经网络去建模复杂的 context–reward 关系精确维护后验分布几乎是不可行的。因此实际工作里大家往往使用各种近似贝叶斯方法比如 variational inference、MCMC、dropout、gradient-based posterior sampling以及 ensemble-based 方法。其中ensemble 方法之所以特别受欢迎是因为它实现简单、泛化性强而且在很多实际任务中效果稳定。不过现有 ensemble-based Thompson Sampling 还有一个被忽视的问题大家通常只在更新 ensemble 成员的参数却不更新成员索引本身的采样分布。也就是说模型在学但“抽谁来做决策”这件事没学。可在实际中不同成员由于随机初始化、prior function 等因素表现并不等价。基于这个观察我们的核心主张是不确定性不仅存在于模型参数中也存在于 ensemble 成员之间因此索引分布也应该被纳入贝叶斯更新。这正是本文想补上的那一块。03方法统一框架Bayesian Ensemble一个关键点在于对于 ensemble 参数 θ我们依然沿用现有方法常见的做法用 surrogate loss 做经验风险最小化但对于索引分布 p我们不再借助 surrogate loss而是直接围绕长期累积 reward 去更新。原因很简单相比庞大的网络参数索引分布的参数量通常很小更适合直接做精确或近似的贝叶斯推断。这个设计是本文相较于已有 ensemble-based TS 方法最本质的区别。面向 BanditBayesian Ensemble Bandit在 contextual bandit 场景中我们用一个 ensemble 网络来输出 reward 的概率分布。每轮先从当前索引分布里采样一个成员再由该成员在候选动作集合上挑选期望 reward 最大的动作。动作执行后我们利用新样本同时更新 ensemble 参数和索引分布。这个算法就是Bayesian Ensemble BanditBEB。它不是替代现有 ensemble bandit而是可以增强现有方法。为了说明这一点文中给了两个代表性实例。第一个是ensemble。原始 ensemble 使用均匀分布在多个 ensemble 成员中随机选一个。我们在 BEB 下把每个成员对应一个 Beta 分布参数用 Beta-Bernoulli 的共轭关系根据实际 reward 对成员选择分布做精确贝叶斯更新。直觉上它等于让“哪个成员更值得被抽到”这件事随着反馈自动学出来。第二个是hypermodel。原始 hypermodel 使用标准高斯分布采样连续索引再通过 hypernetwork 映射成模型参数。我们则进一步把这个连续索引分布做成可学习的高斯分布学习每个维度的均值和方差并用 variational inference 去近似后验。换句话说我们不仅保留了 hypermodel 的连续索引表达能力还把索引本身也变成一个可自适应更新的贝叶斯对象。面向强化学习Bayesian Ensemble DQN除了 bandit我们还把这一思想扩展到了强化学习提出了BE-DQN。它维护 k 个独立的 Q-network每个网络对应一个 Beta 分布。每一轮先从这些 Beta 分布里采样出权重再选出当前最优的那个 Q-network 负责动作选择但在 target Q 的构造时并不是只用单个网络而是对所有 Q-network 做加权聚合。这个设计有两个好处。第一它继承了 ensemble 方法降低方差、稳定训练的优点第二它不像传统 Ensemble DQN 或 Random Ensemble DQN 那样使用固定或随机的组合方式而是让“哪个估计器更值得信”也能随着 reward 自适应变化。文中进一步给出了理论分析在一个单向 MDP 环境里BE-DQN 的 Q-value 方差上界与标准 DQN 一致下界与 Ensemble DQN 一致。这说明它至少不会比 DQN 更不稳定同时又保留了比纯平均 ensemble 更强的探索能力。04实验合成环境Neural Testbed 和 Mushroom我们先在两个 bandit 风格环境里验证方法。一个是Neural Testbed它通过神经网络生成 ground-truth reward 分布可以精确计算 regret另一个是Mushroom把蘑菇可食用性数据集转化成一个二元决策问题智能体需要决定是否选择当前蘑菇。在 Neural Testbed 上我们设置动作维度 (d2,10,50)时间跨度为 20,000 步。结果显示无论问题简单还是复杂BEB 版本都在全程显著优于原始 baseline。到最后一步时ensemble(BEB) 相对 ensemble 的 regret 分别下降37.0%、12.8%、42.2%hypermodel(BEB) 相对 hypermodel 的 regret 分别下降69.8%、22.8%、30.3%。在 Mushroom 数据集上BEB 版本同样始终更优最终 ensemble(BEB) 和 hypermodel(BEB) 分别带来8.7%和4.8%的提升。换句话说不管是离散索引还是连续索引只要把索引分布也学起来探索效率就会更高。我们还专门分析了时间开销。对于 ensemble因为 Beta-Bernoulli 更新是共轭的几乎没有额外耗时而对于 hypermodel由于需要 variational inferenceBEB 版本比原始方法大约多20%的计算时间。这个结果也说明BE 的额外成本主要取决于索引分布的更新方式本身而不是框架设计带来的硬性负担。真实推荐环境Yahoo!R6B为了验证方法在真实序列决策场景中的表现我们进一步在Yahoo!R6B新闻推荐数据集上做了实验。这个数据集包含 2800 万次用户访问日志每条样本包括用户特征、展示文章、候选文章集合以及点击标签。由于真实最优奖励不可见我们用累计点击数作为评价指标。在这个实验里我们主要评测 hypermodel 系列因为 ensemble 的计算开销更大。结果显示hypermodel(BEB)达到了50,322.1 ± 1,487.2次点击高于原始 hypermodel 的49,676.8 ± 1,355.7也明显优于 Random、Greedy、ϵ-Greedy、MC Dropout 和 Gradient TS 等方法。这个结果说明BE 并不只是一个合成环境里的技巧而是能够在真实推荐任务中带来更强的探索效率和更好的点击收益。强化学习环境MiniGrid在强化学习部分我们选择了MiniGrid中五个任务FourRooms、Empty-6x6、LavaGapS5、GoToDoor-5x5 和 MultiRoom-N2-S4用来评测BE-DQN。对比方法包括 vanilla DQN、Ensemble DQN、Random Ensemble DQN以及 UAAC。整体结果表明BE-DQN 在这些任务上表现最强或最稳健。例如在 Empty-6x6、LavaGapS5、GoToDoor-5x5 和 MultiRoom-N2-S4 上BE-DQN 的平均 reward 都是表中最优在 FourRooms 上也优于其余多数 baseline。论文里对此的解释是传统 DQN 依赖单一 Q-value estimator鲁棒性差E-DQN 和 RE-DQN 虽然有所缓解但由于权重机制静态或随机无法持续偏向更优的 Q-estimator而 BE-DQN 能动态更新不同 Q-network 的重要性分布从而更好地兼顾探索、利用和训练稳定性。另外附录里还补充了更多实证结论比如在 Yahoo!R6B 的 100 万样本子集上ensemble(BEB) 比 ensemble 再提升约3%随着 ensemble size 从 25 增大到 100ensemble(BEB) 相对 ensemble 的 regret reduction 从28.23%提升到47.97%这也说明我们的框架在更大的 ensemble 上反而更能发挥优势。05参考文献本文的参考文献大致可以分成四条主线。第一条是Thompson Sampling 与 bandit 理论。这里包括 Thompson (1933)、Russo et al. (2018)、Li et al. (2010)、Chapelle Li (2011)、Lattimore Szepesvari 等工作它们奠定了“基于后验采样做探索”的基本范式也是我们将 ensemble 成员选择视作贝叶斯决策问题的理论起点。第二条是深度不确定性建模与 ensemble posterior sampling。比如 deep ensembles、randomized prior functions、hypermodel、Epistemic Neural Networks、Ensemble Sampling 等工作共同构成了我们方法的直接技术背景。我们的工作与这些方法的关系不是推翻而是前进一步它们主要学模型参数我们进一步去学索引分布。第三条是强化学习中的 ensemble 方法。包括 DQN、Ensemble DQN、Random Ensemble DQN、Reset Deep Ensemble、HyperDQN、HyperAgent 等。这些工作说明 ensemble 在 RL 中确实可以帮助稳定训练、增强探索而我们的 BE-DQN 可以理解为在此基础上加入一个“贝叶斯化的动态成员选择机制”。第四条是实验基准与应用背景。例如 Neural Testbed、Yahoo!R6B、MiniGrid、Mushroom 数据集等这些基准分别对应了合成 bandit、真实推荐、强化学习与经典决策数据集使我们能够从多个角度验证方法的有效性与泛化性。

相关新闻

AI Agent质量保障:从可观测性到工程化干预的实践指南

AI Agent质量保障:从可观测性到工程化干预的实践指南

1. 项目概述:从“玄学”到“工程”的必经之路如果你正在或计划构建一个AI Agent,那么“输出质量不稳定”这个问题,大概率已经让你头疼不已了。今天,我们就来聊聊如何把AI Agent的输出质量保障,从一个靠运气、看“人品”…

2026/8/14 1:29:54 阅读更多 →
计算机毕设选题推荐:Hadoop+Django食管癌数据可视化分析系统源码 毕业设计 选题推荐 毕设选题 数据分析 源码 机器学习 深度学习

计算机毕设选题推荐:Hadoop+Django食管癌数据可视化分析系统源码 毕业设计 选题推荐 毕设选题 数据分析 源码 机器学习 深度学习

✍✍计算机编程指导师 ⭐⭐个人介绍:自己非常喜欢研究技术问题!专业做Java、Python、小程序、安卓、大数据、爬虫、Golang、大屏等实战项目。 ⛽⛽实战项目:有源码或者技术上的问题欢迎在评论区一起讨论交流! ⚡⚡如果你遇到具体的…

2026/8/14 1:29:54 阅读更多 →
宜选科技构建“五层数字增长架构” 打造外贸企业智能获客新体系

宜选科技构建“五层数字增长架构” 打造外贸企业智能获客新体系

随着人工智能加速融入信息搜索、供应商筛选和采购决策,全球贸易营销模式正在发生深刻变化。对于外贸企业而言,独立站已不再只是产品展示窗口,而需要升级为集内容建设、流量获取、商机转化和数据优化于一体的数字增长体系。业内认为&#xff0…

2026/8/14 1:28:54 阅读更多 →

最新新闻

大语言模型API返回JSON解析全攻略:从防御性解析到Prompt工程

大语言模型API返回JSON解析全攻略:从防御性解析到Prompt工程

1. 项目概述:当AI的“智能”遇上JSON的“固执”最近在对接各种大语言模型(LLM)的API时,你是不是也经常被返回的“JSON”数据搞得焦头烂额?满怀信心地写下response.json()或者json.loads(response_text),结果…

2026/8/14 2:26:20 阅读更多 →
Android音视频开发:FFmpeg集成与JNI调用实战指南

Android音视频开发:FFmpeg集成与JNI调用实战指南

在Android应用开发中,处理音视频编解码、格式转换、流媒体等复杂任务时,系统自带的MediaCodec和MediaExtractor等API有时会显得力不从心,尤其是在面对非标准格式或需要高度定制化处理流程时。此时,将业界公认的“瑞士军刀”——FF…

2026/8/14 2:26:20 阅读更多 →
Transformer架构核心原理与工程实践:从自注意力到训练调优

Transformer架构核心原理与工程实践:从自注意力到训练调优

1. 从“注意力”到“革命”:Transformer的诞生与核心思想如果你在2017年之后才开始接触深度学习,尤其是自然语言处理(NLP)领域,那么“Transformer”对你来说可能就像空气一样自然存在。BERT、GPT、T5这些如雷贯耳的模型…

2026/8/14 2:26:20 阅读更多 →
YOLOv8自瞄完整指南:五份清单带你搭建AI瞄准辅助系统

YOLOv8自瞄完整指南:五份清单带你搭建AI瞄准辅助系统

YOLOv8自瞄完整指南:五份清单带你搭建AI瞄准辅助系统 【免费下载链接】RookieAI_yolov8 基于yolov8实现的AI自瞄项目 AI self-aiming project based on yolov8 项目地址: https://gitcode.com/gh_mirrors/ro/RookieAI_yolov8 想给 FPS 游戏体验加一层"智…

2026/8/14 2:26:20 阅读更多 →
基于行为数据的开发者画像构建:从特征工程到K-Means聚类实战

基于行为数据的开发者画像构建:从特征工程到K-Means聚类实战

1. 项目缘起:当SBTI遇上程序员,一个“睡眠”问题的技术解法最近SBTI(十六型人格测试)在社交网络上又火了一把,各种meme图和梗图满天飞。作为一个常年和代码打交道的程序员,我一边刷着“INTJ如何毁灭世界”的…

2026/8/14 2:26:20 阅读更多 →
FFmpeg中文语音自适应比特率编码实战:从原理到HLS流生成

FFmpeg中文语音自适应比特率编码实战:从原理到HLS流生成

在音视频处理项目中,尤其是针对中文语音内容,我们常常面临一个核心挑战:如何在不同网络条件和设备性能下,保证语音的清晰度与流畅度,同时有效控制文件体积?直接使用固定比特率(CBR)编…

2026/8/14 2:25:19 阅读更多 →

日新闻

临沂网站建设铭镇:深耕本土数字生态,以匠心铸就企业品牌核心竞争力

临沂网站建设铭镇:深耕本土数字生态,以匠心铸就企业品牌核心竞争力

在这个流量为王、视觉至上的互联网时代,对于临沂乃至整个山东乃至全国的传统中小企业来说,拥有一张精美的“数字名片”早已不再是可选项,而是生存的必答题。每当夜幕降临,沂河两岸灯火辉煌,物流之都的喧嚣逐渐沉淀为对未来的思考。我们常常听到老板们在茶余饭后探讨:为什…

2026/8/14 0:00:26 阅读更多 →
Flutter与OpenHarmony实现剧本杀组队表单开发实战

Flutter与OpenHarmony实现剧本杀组队表单开发实战

1. 项目概述在移动应用开发领域,跨平台框架Flutter因其高效的开发体验和出色的性能表现,已经成为众多开发者的首选。而OpenHarmony作为新兴的操作系统平台,其开放性和灵活性为开发者提供了全新的可能性。本文将聚焦于一个实际应用场景——剧本…

2026/8/14 0:00:26 阅读更多 →
大连网站建设找简维科技:为您打造懂业务更懂用户的数字化转型引擎

大连网站建设找简维科技:为您打造懂业务更懂用户的数字化转型引擎

在这个数字化浪潮席卷全球的今天,企业想要在激烈的市场竞争中站稳脚跟,拥有一张好看的“数字名片”已经远远不够了。很多老板在刚开始接触互联网业务时,都有一个共同的困惑:为什么我花了钱建的网站,就像是在真空中自嗨?访客进来转了两圈就跑了,线索石沉大海,甚至连客服…

2026/8/14 0:01:27 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/13 2:38:34 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/13 10:41:52 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/13 10:41:51 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/13 10:41:50 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/13 10:41:49 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/13 10:41:49 阅读更多 →