论文阅读-EATA
EATAEfficient Test-Time Model Adaptation without Forgetting论文Efficient Test-Time Model Adaptation without Forgetting会议ICML 2022核心思想不是所有测试样本都值得用于模型更新。EATA 在 TENT 的熵最小化基础上引入可靠样本选择、非冗余样本过滤和 Fisher 正则化在减少无效计算的同时降低持续适应中的模型遗忘。整体思路测试样本 → 可靠性判断 → 非冗余筛选 → 选择性熵最小化 → Fisher约束 → 模型更新1. EATA解决的核心问题1.1 TENT的基本思路TENT 的核心假设是测试阶段虽然没有真实标签但模型自身的预测概率仍然可以用于构造熵损失通过最小化预测熵使模型适应目标域。内容TENT机制输入无标签测试样本 x模型输出p(x)softmax(fθ(x))损失Lent−Σc pc(x)log pc(x)更新方式对测试样本进行 backward核心假设测试样本都可以提供有效适应信号对于测试流 x1,x2,…,xtTENT 基本执行测试样本 → Forward → Entropy → Backward → 参数更新1.2 TENT存在的问题问题具体表现后果样本不可靠高熵样本预测不确定可能产生噪声梯度样本高度重复大量相似测试样本连续出现重复计算、适应收益低持续参数更新模型不断偏离原始参数容易产生灾难性遗忘计算成本高几乎每个测试样本都进行反向传播Adaptation Time增加因此 EATA 对 TENT 的核心质疑是测试样本 → 并不一定都是有效训练信号进一步形成两个问题哪些测试样本值得更新更新以后如何避免破坏原模型能力2. EATA总体结构2.1 三个核心模块模块解决的问题核心机制Reliable Sample Selection样本是否可靠熵阈值Redundant Sample Filtering样本是否提供新信息预测表示相似度Fisher Regularization参数更新是否导致遗忘Fisher参数重要性整体可以概括为EATA 选择性熵最小化 Fisher正则化其中选择性样本机制进一步分为Reliable Sample Selection → Redundant Sample Filtering → 有效样本更新2.2 EATA的核心思想变化TENTEATA所有样本都可能参与更新只有满足条件的样本参与更新只考虑熵同时考虑可靠性与冗余性每个样本都可能触发Backward尽量减少无效Backward主要关注目标域适应同时关注适应与遗忘测试样本默认都是资源测试样本需要进行选择核心转变所有测试样本 → 有效测试样本 → 有效且非冗余测试样本3. Reliable Sample Selection3.1 为什么高熵样本需要过滤模型输出p(x)[p1,p2,…,pc]预测熵E(x;θ)−Σc pc(x)log pc(x)熵越低说明预测分布越集中熵越高说明模型越不确定。样本预测分布示例熵可靠性A[0.98,0.01,0.01]低高B[0.34,0.33,0.33]高低监督学习中存在真实标签可以直接判断预测误差TTA没有测试标签因此熵成为判断测试样本是否适合更新的重要依据。高熵样本 → 模型预测不确定 → 熵优化方向可能不可靠 → 产生噪声更新3.2 EATA的可靠性判定EATA 使用Sent(x)exp(−(E(x;θ)−E0))I{E(x;θ)E0}其中 E0 为熵阈值。核心判断条件处理方式E(x)E0认为样本可靠进入下一阶段E(x)≥E0直接过滤不参与更新因此 EATA 并不是简单降低高熵样本的权重而是首先进行硬过滤。对于可靠样本E(x)越低 → Sent(x)越高 → 样本适应价值越高3.3 可靠样本的意义假设测试集有100个样本其中样本类型数量是否更新低熵可靠样本60是高熵不可靠样本40否则100个测试样本 → 60个可靠样本 → 只对60个样本进行后续适应因此 EATA 的第一个效率来源是减少不可靠测试样本产生的无效Backward。4. Redundant Sample Filtering4.1 为什么可靠样本仍然需要过滤仅进行可靠性筛选仍然存在一个问题低熵样本不一定具有新的信息。例如测试流连续出现大量相似样本x1,x2,x3,…,x100它们都可能满足E(x)E0如果全部参与更新那么仍然需要大量Backward。因此 EATA进一步提出可靠 ≠ 有新增价值还需要判断当前样本是否与已经处理过的信息高度重复4.2 非冗余筛选机制EATA维护历史预测信息并计算当前预测表示与历史信息之间的余弦相似度。历史信息可以通过指数移动平均进行更新mtαmt−1(1−α)fθ(xt)然后计算cos(fθ(x),mt−1)判断规则相似度含义处理高与历史样本高度相似认为冗余过滤低与已有信息差异较大认为具有新信息保留EATA 的多样性判断可以表示为Sdiv(x)I{cos(fθ(x),mt−1)ε}其中 ε 为相似度阈值。4.3 Reliable Non-redundant最终样本选择同时考虑两个条件S(x)Sent(x)Sdiv(x)样本低熵可靠非冗余是否更新A✓✓✓B✗✓✗C✓✗✗D✗✗✗因此有效更新样本需要满足E(x)E0 且 cos(fθ(x),mt−1)ε最终形成测试样本 → 可靠性筛选 → 冗余性筛选 → 有效适应样本5. Fisher Regularization与抗遗忘5.1 为什么需要Fisher正则前两个模块解决的是哪些样本值得更新但持续TTA还存在更新之后会不会忘记原模型模型参数变化θ0 → θ1 → θ2 → … → θt如果长期适应目标域参数可能逐渐远离原始模型从而导致原有分布性能下降。因此 EATA 不仅要适应目标域还要保持原模型能力5.2 为什么不能简单限制参数变化最简单的约束Lreg||θ−θ0||²问题在于不同参数的重要程度不同。假设ω1100ω21两者都发生Δθ0.1普通L2正则认为两者变化代价相同但实际上参数1可能对原模型能力更加重要。因此需要估计参数对原模型的重要程度。5.3 Fisher InformationEATA 使用 Fisher Information 衡量参数的重要性。Fisher值参数重要性更新限制大对原模型重要强限制小对原模型影响相对较小可以适当更新Fisher正则R(θ,θ0)Σi ω(θi)(θi−θ0,i)²其中符号含义θi当前适应后的参数θ0,i原始模型参数ω(θi)Fisher重要性因此重要参数 → 不希望发生较大变化不重要参数 → 允许更多地适应目标域5.4 Fisher与无标签TTATTA不能使用真实测试标签因此需要利用模型预测得到伪标签来估计 Fisher 信息原模型 → 测试样本 → 模型预测 → 伪标签 → Fisher估计这使得 EATA 能够在没有真实测试标签的情况下建立参数重要性约束。5.5 最终优化目标EATA的整体损失可以理解为LS(x)E(x;θ)βR(θ,θ0)其中部分作用S(x)E(x;θ)只利用可靠且非冗余样本进行熵最小化R(θ,θ0)限制重要参数偏离原模型β控制适应与保持之间的平衡因此 EATA 实际优化的是目标域适应能力 原模型稳定性补充如何计算简单来说就是对正确答案贡献的梯度越高参数越重要6. 实验设计与研究启示6.1 核心消融实验EATA 的实验逻辑可以概括为方法样本选择核心验证All Samples所有测试样本TENT式基线Reliable Samples仅低熵样本验证可靠性筛选Reliable Non-redundant可靠且非冗余验证冗余过滤对应关系All Samples → Reliable Samples → Reliable Non-redundant每增加一个筛选机制就减少一部分无效适应同时观察Accuracy和计算成本的变化。6.2 主要评价指标指标关注问题Accuracy目标域适应效果Backward Samples有多少测试样本真正触发更新Adaptation TimeTTA实际计算成本Forgetting适应后原有模型能力下降程度其中 Backward Samples 是理解 EATA 的关键指标Nbackward# {x:S(x)0}测试样本数量并不等于Backward数量。6.3 EATA的核心创新EATA最重要的贡献并不是简单加入一个Fisher正则而是重新定义了测试样本在TTA中的作用。层次TENTEATA样本价值默认所有样本有价值样本价值存在差异可靠性不主动过滤熵阈值过滤信息重复不主动考虑相似度过滤参数更新直接适应重要参数受到保护资源观念测试样本均可使用测试样本是一种有限适应资源核心观点测试样本数量 ≠ 有效适应信息量一个测试样本是否值得更新需要同时考虑可靠性 新颖性 参数更新风险6.4 EATA在TTA发展路线中的位置方法主要解决问题TENT如何利用无标签测试数据进行在线适应EATA哪些测试样本值得更新以及如何降低遗忘CoTTA连续测试流中的错误累积与灾难性遗忘SAR如何提高TTA更新过程的稳定性RoTTA非IID动态测试流中的类别不平衡与持续漂移PASLE如何减少错误伪标签和熵最小化带来的问题因此可以将EATA理解为TTA研究中的一个重要转折“如何更新模型” → “什么样的测试样本值得更新模型”6.5 对端云协同研究的启发EATA中的样本筛选思想可以自然延伸到端云场景测试样本 → 可靠性/不确定性评估 → 信息价值判断 → 本地适应或上传云端EATA关注“哪些样本值得消耗本地模型的适应资源”进一步的端云协同问题可以变成“哪些样本值得消耗通信、端侧计算和云端模型资源”因此可以形成一个值得继续研究的问题测试数据是否应该被视为有限的适应资源进一步可以拆解为研究问题对应EATA思想哪些样本值得更新Reliable Sample Selection哪些样本提供新信息Non-redundant Filtering哪些样本值得上传Sample Selection → Communication Selection哪些样本应该交给云模型Uncertainty-based Routing如何避免本地模型遗忘Fisher Regularization如何平衡适应收益与资源消耗Accuracy–Time–Communication Trade-off最终可以将EATA的研究思想概括为测试数据不是越多越好 → 有效测试信息才是关键 → 可靠样本优先 → 新信息优先 → 重要参数谨慎更新 → 在有限计算资源下实现稳定适应。

相关新闻

安徽皖上好影视制作公司 擅长人物传记片、活动花絮视频的创意制作

安徽皖上好影视制作公司 擅长人物传记片、活动花絮视频的创意制作

影视制作行业发展态势与皖上好的业务定位随着数字化传播时代的全面到来,视频内容已经成为政企单位与商业品牌对外展示形象、传递价值的核心载体。无论是政务宣传、校园文化传播,还是企业品牌推广、活动记录留存,人物传记片与活动花絮视频的需…

2026/10/10 2:57:07 阅读更多 →
工业智能体:小白也能学会的大模型应用指南(收藏必备)

工业智能体:小白也能学会的大模型应用指南(收藏必备)

本文介绍了工业智能体的概念、发展现状、产业生态布局以及典型应用案例。工业智能体以大模型为核心,深度融合工业知识与AI技术,实现环境感知、逻辑推理、任务规划等功能。文章还分析了工业智能体推动“人工智能制造”落地的机理,包括知识内化…

2026/10/10 2:57:07 阅读更多 →
Solidity 基础语法:用五个小案例,把语法学成肌肉记忆

Solidity 基础语法:用五个小案例,把语法学成肌肉记忆

前两篇我们聊了学习路径和三个实战合约。但有个问题一直悬着:很多人的语法是"拼凑"出来的,不是"理解"出来的。他们能写 mapping(address > uint256),但说不清为什么不用数组;能用 modifier,但不…

2026/10/10 2:57:07 阅读更多 →

最新新闻

MATLAB联合CST建模:超表面仿真自动化工作流实战

MATLAB联合CST建模:超表面仿真自动化工作流实战

最近不少做超表面的同学都在折腾CST仿真,尤其是想把MATLAB联合CST建模这条路彻底走通,用来处理超透镜、轨道角动量、吸收器、极化转换器、EIT(类电磁诱导透明)这些常见方向。这篇文章不打算讲教科书推导,只写我在真实仿…

2026/10/10 3:48:27 阅读更多 →
PostgreSQL权限管理实战:角色体系、层级授权与行级安全

PostgreSQL权限管理实战:角色体系、层级授权与行级安全

1. 权限分配这件事,先搞懂 PostgreSQL 的角色体系做数据库运维这些年,我发现一个特别有意思的现象:很多人对 PostgreSQL 的权限管理第一反应是“这不就是 grant 一下嘛”,可真到了线上环境,经常被各种“没权限”“权限…

2026/10/10 3:48:26 阅读更多 →
1996-2024年各省农业总产值无缺失面板数据:从处理到分析完整指南

1996-2024年各省农业总产值无缺失面板数据:从处理到分析完整指南

做农业数据分析的人应该都有过这种经历:想研究各省农业生产的长期变化,打开官方数据库发现要么年份对不上,要么某些省份某几年突然缺了一块,要么当年价格和可比价格混在一起,搞不清谁是谁。最后大量时间花在找数据、拼…

2026/10/10 3:48:26 阅读更多 →
SCSI磁盘实战指南:从协议原理到Linux诊断调优

SCSI磁盘实战指南:从协议原理到Linux诊断调优

1. 项目概述:为什么“SCSI磁盘”这个老词还在工程师的日常对话里反复出现你可能在服务器机房巡检时听到运维同事说“这台存储柜挂了两块SCSI盘,热备没切过去”,也可能在旧系统迁移文档里看到“需兼容SCSI-3 SPI协议的磁盘阵列”,甚…

2026/10/10 3:48:26 阅读更多 →
PostgreSQL自定义函数规范:从命名到性能排查的完整指南

PostgreSQL自定义函数规范:从命名到性能排查的完整指南

1. 为什么自定义函数必须讲规范1.1 从一次线上事故说起先说一个我亲眼见过的教训。某公司的订单系统,早期为了赶业务进度,开发人员在 PostgreSQL 里写自定义函数时完全放飞自我——函数名有的叫get_data、有的叫f_order,参数类型混用 varchar…

2026/10/10 3:48:26 阅读更多 →
PyTorch+LSTM电影评论情感分析实战:从预处理到模型部署

PyTorch+LSTM电影评论情感分析实战:从预处理到模型部署

简介:一份评审分达99分的基于深度学习的电影评论情感分析项目资源包,适合计算机相关专业课程设计、期末大作业及入门实战,重点解决从数据爬取到模型训练演示中缺完整代码、缺数据集、缺文档的常见问题。资源围绕豆瓣短评设计,约5万…

2026/10/10 3:47:26 阅读更多 →

日新闻

卫星轨道分类全解析:从LEO到GEO的选型逻辑与工程实践

卫星轨道分类全解析:从LEO到GEO的选型逻辑与工程实践

1. 从“卫星轨道分类”这个标题说起:为什么值得花时间搞懂第一次接触“卫星轨道分类”这个概念,很多人会觉得它离自己很远——不就是天上的星星怎么转吗?但如果你正在做航天任务规划、遥感数据接收、星座设计,甚至只是准备一场航天…

2026/10/10 0:00:39 阅读更多 →
Spring AOP 核心原理与实战:从概念到日志切面落地

Spring AOP 核心原理与实战:从概念到日志切面落地

1. 从一个真实痛点说起:为什么你的代码里到处都是重复逻辑刚入行那会儿,我写过一个用户管理模块,注册、登录、改密码、注销四个接口。每个接口里都塞了几乎一样的日志打印、参数校验、事务开启和提交。当时觉得没什么,能跑就行。直…

2026/10/10 0:00:40 阅读更多 →
Python招聘数据采集与分析可视化:从采集清洗到薪资技能城市可视化全链路

Python招聘数据采集与分析可视化:从采集清洗到薪资技能城市可视化全链路

简介:这是一套面向计算机相关专业学生与项目实战学习者的Python数据采集与分析可视化完整项目,以Boss直聘岗位数据为对象,适合用作毕业设计、课程设计或期末大作业。资源包共38个文件,约246KB,以13个py源码文件为核心&…

2026/10/10 0:00:40 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:32 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 1:36:08 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 10:11:06 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 21:13:17 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 6:17:20 阅读更多 →