迁移学习新视角:无语义噪声也能助力模型,提升少量标注场景学习效果!
迁移学习新突破噪声助力模型学习迁移学习里的 源数据未必非得是图像、文本或音频。一组从高斯分布里随机采样出来、没有任何语义的噪声也能帮助模型在少量标注下学得更好。这项工作名为半监督噪声自适应Semi - Supervised Noise AdaptationSSNA论文已发表于ICML 2026。噪声自适应框架NAF提升学习效果SSNA团队进一步提出噪声自适应框架Noise Adaptation Framework, NAF它利用随机生成的噪声构造出具有判别性的类别结构并将这种结构迁移到真实目标数据上从而提升模型在少量标注场景下的学习效果。NAF把噪声域和目标域投影到共享表征空间并在类别层面进行对齐。在每类仅有4个标注样本的情况下基于ResNet - 18骨干网络NAF在CIFAR - 10、CIFAR - 100、DTD - 47和Caltech - 101上的准确率相比仅使用有标注样本训练的标准监督学习基线ERM经验风险最小化Empirical Risk Minimization分别提升了12.35、7.61、4.38和2.74个百分点。目前论文源码已开源。把真实源域换成噪声传统迁移学习通常需要一个标签丰富的源域但真实源数据并不总是容易获得。隐私、保密和版权限制都可能让源域数据无法共享。SSNA试图把这个前提拿掉源域不再放真实样本而是换成从简单概率分布中生成的噪声。具体做法是假设目标任务包含C个类别研究团队首先在1024维空间中为每个类别随机采样一个均值向量并以单位矩阵作为协方差由此构造C个高斯分布再从每个分布中采样50个噪声向量。噪声域与目标域使用相同的类别索引集合每个噪声类别预先对应一个目标类别索引但这种对应本身不包含语义信息。这里的编号本身没有语义真正被迁移的是噪声域中形成的判别结构。只要这套结构能够和目标域对齐它就能为真实目标样本提供更清楚的分类边界。少量标签仍然是必要的噪声可以替代真实源数据但不能完全替代目标域标签。因为噪声来自另一个空间类别编号又是人为指定的模型必须借助少量已标注目标样本才能知道噪声类0究竟该和哪个真实类别对齐。论文在CIFAR - 100上把每类标注样本降到0时ERM和NAF的准确率分别只有0.97%和1.34%都接近随机水平。一旦提供少量标注NAF便持续超过ERM。因此在半监督分类设定中真实源域未必是实现正迁移的必要条件。NAF主要做了三件事围绕论文给出的泛化上界NAF把训练目标拆成三部分。一是先学好少量真实标签目标域编码器把真实样本映射到共享表征空间分类器使用少量标注样本计算交叉熵损失用来建立噪声类和真实类别之间的桥梁。二是再让噪声形成清楚的类别结构噪声投影器负责把随机向量映射到同一个表征空间分类器则按照预设类别编号识别这些噪声。训练之后同类噪声逐渐聚拢不同类噪声彼此分离。三是最后把两边对齐NAF还会计算噪声域和目标域之间的分布差异。分布对齐模块并不限定具体实现论文对多种方案进行了比较最终在实验中经验性地采用负域相似度Negative Domain SimilarityNDS作为默认机制。NDS同时比较两域的全局均值和各类别均值并用余弦相似度推动它们靠近。未标注目标样本的类别均值则由模型产生的伪标签迭代估计。从CIFAR到ImageNet噪声都能带来增益主实验覆盖8个视觉数据集和1个文本分类数据集。除ImageNet - 1K外视觉任务均采用每类4个标注样本其余训练样本作为无标注数据。在ResNet - 18上NAF相较ERM的Top - 1提升分别达到CIFAR - 10 12.35、CIFAR - 100 7.61、DTD - 47 4.38、Caltech - 101 2.74个百分点。细粒度分类同样有效使用ResNet - 18时NAF在CUB - 200、Oxford Flowers - 102和Stanford Cars - 196上相对ERM分别提高8.94、5.51和7.74个百分点。在更大规模的ImageNet - 1K上研究团队为每类保留100个标注样本。NAF达到37.10%准确率比ERM高0.99个百分点。文本任务AG News - 4上使用BERT的NAF达到82.82%比ERM的78.64%高4.18个百分点。NAF也可以直接插入现有半监督方法论文将其接入UDA、FixMatch、FlexMatch、DebiasMatch、DST、LERM和SA - FixMatch整体都获得了增益。以CIFAR - 10的20轮训练结果为例UDA和FixMatch加入NAF后准确率分别提高20.83和9.91个百分点。真正有用的不是“随机”而是结构噪声为什么能帮忙论文的消融实验把答案指向了同一个因素类别之间是否具有可分离的结构。团队首先把所有类别的噪声都压成同一个点这样一来噪声域彻底失去判别结构NAF不但没有增益反而出现明显负迁移。CIFAR - 10准确率从ERM的58.15%跌到33.34%CIFAR - 100则从42.24%跌到6.79%。相反当逐步拉大噪声类别中心之间的距离时CIFAR - 100准确率从43.80%一路提高到49.78%。这说明噪声类越容易区分能够提供的结构引导通常越强。噪声数量反倒没有那么关键每类从10个增加到100个噪声时准确率一直稳定在约50%增加到200个后还略有下降。论文据此认为只要能形成可分离模式少量噪声就足以发挥作用。研究团队还把噪声域简化成每类一个中心点无论中心固定还是可学习结果都高于ERM其中可学习中心比固定中心更好但仍低于完整NAF。在Amazon到Caltech - 10的迁移实验中真实源数据整体仍略胜一筹但噪声源域已经能把准确率从ERM的83.51%提升到约88%至89%。这也给出了更现实的定位当真实源数据不可得时合成噪声可以成为一种成本很低的替代方案。它也不同于常见数据增强数据增强通常在真实样本附近做旋转、裁剪、插值或生成SSNA则先构造一个独立噪声域再在表征空间中完成跨域对齐。总结没有语义结构依然可以迁移这项工作为迁移学习提供了一个颇具反常识的新视角源数据能够帮助目标任务未必完全依赖其真实语义表征空间中形成的类别结构同样可能成为可迁移的知识。NAF正是利用这一点让随机噪声在共享表征空间中形成具有判别性的结构再借助少量标注样本将其传递给真实数据。实验结果表明即使源域不包含真实图像、文本或音频只要保留合适的类别结构依然可能对目标任务产生正向作用。换句话说迁移学习所迁移的或许不只是“数据讲了什么”还包括“数据在表征空间中如何组织”。这也为隐私受限、版权敏感或真实源数据难以获取的场景提供了一条新的研究思路。你怎么看待这项迁移学习的新突破呢

相关新闻

FX5U与R系列通信怎么选?三菱PLC协议差异全解析

FX5U与R系列通信怎么选?三菱PLC协议差异全解析

三菱 PLC 覆盖串口、以太网、现场总线、工业以太网四大类,特点是自有协议强(CCLink/MC/SLMP)、Modbus 全系标配、高端加 EtherCAT/OPC UA;和汇川相比,CCLink 生态更成熟,EtherCAT 起步稍晚。一、串口协议&a…

2026/7/23 7:36:57 阅读更多 →
2026年计算机类期刊投稿指南:从CCF目录到中科院分区,选刊看这篇就够了

2026年计算机类期刊投稿指南:从CCF目录到中科院分区,选刊看这篇就够了

又到了准备投稿的季节。面对琳琅满目的期刊列表,从CCF推荐目录到中科院分区,从SCI到EI,很多科研人最大的困惑不是“怎么写”,而是“往哪投”。据统计,全球计算机领域SCI期刊投稿量同比激增43%,而平均接收率…

2026/7/23 7:36:57 阅读更多 →
AI Agent与大模型:构建智能系统的核心技术解析

AI Agent与大模型:构建智能系统的核心技术解析

1. AI Agent与大模型:智能革命的基石组合去年我在开发一个智能客服系统时,第一次真正体会到AI Agent与大模型结合带来的震撼。当时我们尝试用传统规则引擎处理用户咨询,需要手动编写上千条业务规则,而接入大模型后,仅用…

2026/7/23 7:35:57 阅读更多 →

最新新闻

PID控制在线仿真查看参数变化

PID控制在线仿真查看参数变化

PID控制 https://www.luisllamas.es/en/pid-controller-simulator/

2026/7/23 14:10:48 阅读更多 →
深度学习结合Koopman算子的非线性系统线性化方法

深度学习结合Koopman算子的非线性系统线性化方法

1. Koopman算子与非线性动力学线性化Koopman算子理论提供了一种将非线性动力学系统转化为无限维线性系统的数学框架。这个1931年提出的方法,近年来随着计算能力的提升和数据驱动方法的兴起重新获得关注。其核心思想是通过观测函数的线性演化来描述非线性系统的行为。…

2026/7/23 14:10:48 阅读更多 →
桌面智能体技术拆解:2026主流技术方案盘点

桌面智能体技术拆解:2026主流技术方案盘点

2026年,桌面智能体(Desktop Agent)进入集中爆发期。从微软Build 2026宣布Windows全面拥抱Agent时代,到苹果WWDC对Siri进行15年来最大变革,操作系统厂商正在将智能体能力下沉为系统级基础设施。与此同时,开源…

2026/7/23 14:10:48 阅读更多 →
WorldWarp:3D视频生成的几何一致性与扩散技术融合

WorldWarp:3D视频生成的几何一致性与扩散技术融合

1. WorldWarp项目概述 WorldWarp是新加坡国立大学与香港理工大学联合开发的创新性3D视频生成框架,它通过异步视频扩散技术实现了高质量的长视频序列生成。这个项目的核心目标在于解决当前视频生成领域的一个关键难题:如何在保持严格几何一致性的同时&…

2026/7/23 14:10:48 阅读更多 →
深度学习优化毕赤酵母蛋白表达的技术解析

深度学习优化毕赤酵母蛋白表达的技术解析

1. 项目背景与核心突破在生物制药领域,重组蛋白表达效率的提升始终是行业痛点。以单克隆抗体为例,全球市场规模已超2000亿美元,但生产成本居高不下。传统密码子优化方法依赖统计学规律,往往难以突破表达瓶颈。MIT团队开发的Pichia…

2026/7/23 14:10:48 阅读更多 →
Claude Sonnet 5全面测评:AI代理模型编码与工具使用实战

Claude Sonnet 5全面测评:AI代理模型编码与工具使用实战

最近在AI开发圈里,Anthropic新发布的Claude Sonnet 5模型引起了广泛关注。作为长期关注AI模型技术演进的技术博主,我决定对这款号称"最具代理性"的Sonnet模型进行全面测评。经过一周的深度测试,结果确实有些出乎意料——不仅在性能…

2026/7/23 14:09:48 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻