SWFNet:当脉冲神经网络遇见小波变换——VVC压缩360度视频质量增强的新范式
论文标题SWFNet: A Spiking-Wavelet Fusion Network for Frame-Level Quality Enhancement of VVC-Compressed 360-Degree Video发表期刊IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), 2026DOI10.1109/TCSVT.2026.3710288开源代码https://github.com/647-bei/SWFNet一、研究背景360度视频压缩的双重困境1.1 VVC压缩与ERP投影的双重失真360度全景视频是VR/AR沉浸式体验的核心载体。为了在有限带宽下传输这种超大视野的视频内容业界采用了H.266/VVCVersatile Video Coding标准进行高压缩比编码。然而激进的压缩策略不可避免地在解码端引入严重的压缩伪影。更棘手的是360度视频通常以**等距柱状投影Equirectangular Projection, ERP**格式存储和传输。ERP将球面经纬度线性映射到二维矩形平面这一过程带来了一个固有的几何缺陷两极区域被严重过采样。赤道附近的像素分布相对稀疏而越接近极点像素密度越高大量冗余像素堆积在上下边缘区域。这意味着当VVC对ERP图像进行均匀压缩时两极区域的冗余像素不仅浪费编码码率还会在解码后产生密集的块效应和振铃噪声。传统视频质量增强方法在处理这类图像时面临一个核心矛盾如何在修正ERP几何畸变的同时恢复高频细节且不超出严格的计算预算1.2 现有方法的局限已有的压缩视频质量增强方法主要分为两类基于CNN的方法如NAFNet、ARCNN等擅长局部纹理恢复但缺乏全局结构建模能力难以有效处理ERP特有的全局几何畸变。且参数量和计算量通常较大难以扩展到4K/8K分辨率。基于Transformer的方法如ViT系列自注意力机制能捕获长距离依赖有利于全局结构修正但其O(N²)的计算复杂度在高分辨率输入下会迅速导致内存溢出OOM在8K分辨率下几乎不可行。SWFNet的切入点正是这个既要全局又要局部、既要质量又要效率的三难困境。二、核心思想从灵长类视觉系统寻找灵感2.1 大细胞-小细胞M-P双流理论SWFNet的设计灵感来源于灵长类视觉系统中一条经过大量神经科学实验验证的经典通路——大细胞-小细胞Magnocellular-Parvocellular, M-P双流理论。在灵长类的外侧膝状体LGN中视觉信息通过两条功能截然不同的并行通路进行处理特性大细胞通路M-pathway小细胞通路P-pathway响应特性高时间频率、低空间频率高空间频率、低时间频率功能侧重运动检测、全局结构感知精细纹理、颜色细节识别传导速度快速、粗略较慢、精细对比度敏感高对比度敏感低对比度敏感M通路快速捕捉场景的全局结构和运动信息提供粗粒度但快速的感知P通路则慢速但精确地解析细节纹理。两条通路在视觉皮层汇合共同构建完整的视觉感知。2.2 从生物视觉到网络设计SWFNet将这一生物机制映射为网络架构设计原则全局流M通路对应采用脉冲神经网络SNN构建U-Net型架构以事件驱动的稀疏脉冲捕获全局结构先验修正ERP几何畸变。SNN的稀疏激活特性天然适配ERP两极区域的冗余采样问题——对过采样区域产生更少的脉冲响应自适应地抑制冗余。局部流P通路对应采用残差小波融合模块RWFB在频域分解的多个尺度上恢复高频空间细节补偿VVC量化造成的信息损失。这种解耦设计将几何修正与细节恢复这两个本质上存在冲突的任务分配给不同通路独立处理再通过融合机制协同输出有效避免了单一网络同时处理两种任务时的互相干扰。三、网络架构详解SWFNet的整体架构是一个SNN-ANN混合双流网络据论文称这是首次将混合脉冲-人工神经网络架构引入全景视频质量增强领域。3.1 全局流U型脉冲Transformer架构全局流采用U-Net型编码器-解码器结构核心组件包括1TransSNN模块Transformer-SNN Block编码器端使用TransSNN模块提取全局结构先验。这一模块将Transformer的自注意力机制与脉冲神经元相结合脉冲神经元采用Leaky Integrate-and-FireLIF模型。LIF神经元模拟生物神经元的膜电位累积-放电过程输入信号累积到膜电位上当电位超过阈值时发射脉冲spike随后膜电位重置。这一过程是离散的、事件驱动的——只有当输入足够强时才产生脉冲输出天然实现了稀疏激活。稀疏自注意力传统Transformer的自注意力对所有token对计算相似度计算复杂度为O(N²)。TransSNN通过脉冲神经元的稀疏发放机制使得只有显著的结构响应才能触发注意力计算大幅减少了冗余计算。这类似于M通路中只对显著全局变化做出快速响应的特性。2SCAtten模块Spiking Channel Attention解码器端引入脉冲通道注意力机制。与传统ANN中的通道注意力如SE-Net不同SCAtten在脉冲域中运行通过脉冲驱动的全局平均池化压缩空间维度利用脉冲神经元的阈值机制自适应地选择重要通道主动抑制背景噪声和ERP过采样区域的冗余响应3U-Net跳跃连接编码器提取的多尺度全局特征通过跳跃连接传递给解码器保留了不同分辨率下的结构信息。由于特征以脉冲形式传递跳跃连接的内存开销极低。4SNN在ERP场景的独特优势ERP图像的两极区域存在大量冗余像素。传统ANN对所有像素执行相同的密集计算在极区浪费大量算力。SNN的脉冲发放是输入驱动的——冗余、平坦区域的输入变化小膜电位难以达到阈值自然产生很少甚至零脉冲。这种自适应稀疏性使得SNN在处理ERP格式时具有天然的结构匹配优势。3.2 局部流残差小波融合模块RWFB局部流专注于高频细节恢复核心模块是残差小波融合块Residual Wavelet Fusion Block, RWFB。1为什么选择小波变换VVC压缩的本质是变换域的量化损失其中高频分量受损最严重。传统CNN在空间域操作难以显式地定位和恢复特定频段的损失。小波变换提供了一种多尺度频域分解工具将特征分解为低频近似分量和高频细节分量水平、垂直、对角线方向不同频段可以独立处理针对性地补偿量化损失小波变换是可逆的分解后可以精确重建不引入信息损失2RWFB的工作流程RWFB的处理流程可概括为小波分解对输入特征进行离散小波变换如Haar小波得到一个低频子带和三个高频子带频域自适应处理对每个子带应用独立的卷积处理低频子带保留全局结构高频子带聚焦于细节恢复残差融合将处理后的子带通过逆小波变换重建特征并与输入特征做残差连接多尺度堆叠多个RWFB级联在不同分辨率尺度上逐步恢复细节这种设计对应于P通路精细解析高频空间细节的生物特性通过频域显式分解实现了对量化损失的精准补偿。3.3 双流融合机制全局流和局部流的输出通过融合机制汇合。论文中M-P双流理论强调两条通路在视觉皮层汇合后共同构建完整感知SWFNet的融合模块同样需要将全局流提供的结构先验脉冲域稀疏表示转换为连续值特征与局部流恢复的高频细节特征进行通道级融合通过可学习的融合权重自适应地平衡全局结构修正和局部细节恢复的贡献四、效率优势极轻量级的SOTA性能SWFNet在效率方面的数据令人印象深刻指标SWFNetNAFNet对比参数量1.48M~17M计算量2.32 GFLOPs论文GitHub/ 10.3 GFLOPsIEEE摘要~268 GFLOPs估算能耗44.8 mJ显著更高峰值内存185.2 MB更高8K下OOM8K推理可行OOM注GitHub README中标注为2.32 GFLOPs而IEEE摘要中标注为10.3 GFLOPs两者差异可能与是否计入脉冲运算的等效FLOP换算方式有关。核心结论一致计算量比NAFNet降低约96%。这种极端效率的来源有三SNN的稀疏性脉冲神经元只对显著输入发放脉冲大量计算被跳过。在神经形态硬件上这种稀疏性可直接转化为能耗节省仅脉冲触发时消耗能量。小波变换的高效性小波分解是一种固定变换不需要学习参数计算量远低于等价的深度卷积。轻量架构设计整体参数量仅1.48M远小于主流恢复网络动辄数十M的规模。8K可扩展性是SWFNet的一个独特卖点。由于SNN的稀疏激活和U-Net结构的内存效率SWFNet是唯一能在8K8192×4096分辨率输入上进行可行推理的测试模型而基于ViT的方法在此分辨率下普遍遭遇OOM。五、实验结果分析5.1 实验设置基于论文信息SWFNet的实验设置可归纳如下任务帧级质量增强Frame-Level Quality Enhancement即对VVC压缩后的360度视频帧进行后处理增强输入格式ERP格式的4K和8K分辨率全景视频压缩标准H.266/VVC数据集360度视频质量评估数据集具体数据集名称需参考论文正文评估指标PSNR、SSIM等全参考图像质量指标以及WS-PSNRWeighted-to-Spherical PSNR专用于360度视频的球面加权PSNR5.2 核心结果论文宣称SWFNet实现了state-of-the-art的恢复性能同时在效率上远超对比方法。结合摘要和GitHub信息关键发现包括质量-效率权衡在达到或超越现有SOTA方法恢复质量的同时参数量减少至1.48M计算量降低约96%8K可行性在8K分辨率下成功完成推理而对比方法如NAFNet等基于密集ANN的方法因OOM无法运行能耗优势估算能耗44.8 mJ为沉浸式高清媒体应用提供了有利的保真度-效率权衡5.3 SNN在恢复任务中的有效性验证论文的一个隐含贡献是验证了SNN在低级视觉任务图像/视频恢复中的可行性。传统上SNN主要用于分类等高级视觉任务在需要精确数值预测的恢复任务中表现不佳。SWFNet通过SNN-ANN混合架构——用SNN处理全局结构对数值精度要求较低的任务用ANN处理局部细节恢复需要精确数值预测的任务——巧妙地规避了这一难题。六、技术亮点与创新总结6.1 四大核心创新首个SNN-ANN混合架构用于全景视频质量增强将脉冲神经网络的稀疏性能与人工神经网络的精确性结合开辟了神经形态计算在视频恢复领域的新应用方向。M-P双流生物启发框架将灵长类视觉系统的M-P双流理论映射为全局-局部解耦的网络设计有效解决了ERP几何修正与细节恢复之间的冲突。TransSNN模块创新性地将Transformer自注意力与脉冲神经元融合在保持长距离建模能力的同时实现稀疏计算。RWFB模块利用小波变换的多尺度频域分解显式地针对VVC量化损失进行补偿为压缩伪影去除提供了频域视角的解决方案。6.2 方法论启示SWFNet的设计思路对后续研究有几条重要启示生物启发不等于简单模仿SWFNet并非机械复制M-P通路而是提取其全局快速粗略局部慢速精细的功能分工原则映射为SNN稀疏、事件驱动和ANN小波精确、频域的技术组合。SNN-ANN混合是务实路线纯SNN在恢复任务中精度不足纯ANN在高分辨率下效率不足。混合架构让两种范式各司其职是一种务实的工程选择。频域处理对压缩伪影有天然优势压缩伪影本质上是频域量化损失在频域直接处理比在空间域间接学习更高效。七、个人分析与思考7.1 方法优势计算效率的质的飞跃96%的计算量降低不是渐进式优化而是架构层面的范式转换。对于需要在VR头显等功耗受限设备上实时运行的场景这种效率提升具有实际部署价值。8K可扩展性随着VR设备向8K演进能在此分辨率上运行的质量增强方案具有前瞻性。理论动机扎实M-P双流理论提供了清晰的功能分工依据不是随意堆砌模块而是有神经科学支撑的系统性设计。7.2 潜在局限帧级处理的时序局限SWFNet聚焦于帧级质量增强未利用视频帧间的时序相关性。对于视频质量增强而言多帧方法如利用相邻高质量帧增强当前帧通常能获得更好的性能。论文标题中的Frame-Level也暗示了这一范围限定。SNN训练的工程挑战脉冲神经元的不可导性需要使用替代梯度Surrogate Gradient进行反向传播训练训练稳定性和收敛速度仍是SNN领域的共性难题。论文未详细讨论训练细节实际复现可能面临调试困难。评估的全面性从摘要和GitHub信息来看主要评估了PSNR/SSIM等客观指标。对于360度视频主观质量评估如在VR头显中的用户研究和球面一致性指标同样重要论文是否覆盖这些维度有待确认。GFLOPs数据不一致GitHub README和IEEE摘要中GFLOPs数值存在差异2.32 vs 10.3可能涉及脉冲运算的等效计算量换算问题建议关注论文正文的具体定义。代码尚未完全开源GitHub仓库目前仅提供README和架构图完整源代码将在论文正式接收后公开。在代码发布前部分实现细节无法独立验证。7.3 未来方向基于SWFNet的思路以下方向值得探索时序扩展将帧级增强扩展为时序增强利用SNN天然适合处理时序信号的特性设计脉冲驱动的多帧质量增强框架。神经形态硬件部署在Loihi、天机芯等神经形态芯片上实际部署SWFNet验证理论能耗优势能否在硬件上兑现。自适应ERP处理结合ERP的纬度依赖特性设计纬度自适应的脉冲阈值或小波分解策略进一步利用ERP的结构先验。与其他压缩标准适配将框架扩展到AV1、HEVC等其他压缩标准验证方法的通用性。端到端联合优化探索将SWFNet作为VVC环路滤波器In-Loop Filter的替代方案在编码端联合优化压缩效率与恢复质量。八、总结SWFNet提出了一种生物启发式的SNN-ANN混合架构通过M-P双流理论将360度视频质量增强任务解耦为全局结构修正脉冲Transformer和局部细节恢复小波融合两条并行通路。在仅1.48M参数和极低计算量的条件下实现了SOTA恢复性能并成为唯一可在8K分辨率上推理的方案。这篇工作的核心贡献不在于单一模块的创新而在于跨范式的系统设计——将神经科学的M-P理论、脉冲神经网络的稀疏计算、小波变换的频域分解三者有机融合为高分辨率沉浸式视频质量增强提供了一条兼顾质量与效率的新路径。随着VR/AR设备向更高分辨率和更低功耗演进这种生物启发的轻量架构思路具有重要的参考价值。参考文献与资源论文链接IEEE Xplore开源代码GitHub - 647-bei/SWFNetDOI10.1109/TCSVT.2026.3710288

相关新闻

嵌入式视觉跟踪系统开发:MaixCAM与无刷电机云台适配实战

嵌入式视觉跟踪系统开发:MaixCAM与无刷电机云台适配实战

在嵌入式视觉项目中,将高性能的AI摄像头与精密运动控制设备结合,往往能实现令人惊艳的效果。最近在开发一个智能跟踪系统时,遇到了MaixCAM与轮趣无刷电机云台的适配需求,发现相关资料比较零散。本文将完整记录从硬件选型、通信协议…

2026/7/31 2:40:22 阅读更多 →
大功率步进电机驱动系统设计:从MOSFET选型到控制算法优化

大功率步进电机驱动系统设计:从MOSFET选型到控制算法优化

1. 先搞清楚大功率步进电机驱动到底要解决什么问题大功率步进电机驱动系统不是简单地把普通驱动器的功率放大,而是要在保持步进电机原有定位精度优势的基础上,解决高扭矩输出时的失步、发热和振动问题。很多人一上来就想着怎么把电流调大,结果…

2026/7/31 2:40:22 阅读更多 →
原来重庆这些校园广播销售生产商这么热门,究竟是哪些呢?

原来重庆这些校园广播销售生产商这么热门,究竟是哪些呢?

引言在重庆,校园广播市场发展得如火如荼,不少销售生产商受到广泛关注。优质的校园广播系统能为学校的日常教学、活动开展等提供有力支持。接下来就为大家介绍重庆几家热门的校园广播销售生产商,以及它们各自的特点。重庆优沃科技:…

2026/7/31 2:40:22 阅读更多 →

最新新闻

INMS架构:LLM多智能体系统中的高效内存共享方案

INMS架构:LLM多智能体系统中的高效内存共享方案

1. INMS论文核心思想解析这篇论文提出了一种名为INMS(Inter-Agent Memory Sharing)的创新架构,专门针对基于大型语言模型(LLM)的多智能体系统中的内存共享问题。传统LLM智能体在协作时面临的最大痛点就是每个智能体都是…

2026/7/31 3:17:34 阅读更多 →
免费 AI 率检测报告对比(2027 最新版)

免费 AI 率检测报告对比(2027 最新版)

上周帮学妹改论文,顺手把同一份两千多字的文献综述丢进了四家能查 AI 率的工具里,本来只是想交叉验证一下数字,结果发现报告这东西真不是看个总分就完了——有的能精确到哪一句话可能是 AI 写的,有的直接甩一个百分比让你自己猜。折腾一圈之后整理出这篇,省得大家像我一样一家家…

2026/7/31 3:17:34 阅读更多 →
文献综述生成工具评测(2026 最新版):引用真实性、可选项、成稿质量三个维度

文献综述生成工具评测(2026 最新版):引用真实性、可选项、成稿质量三个维度

开题前写综述这件事,我算是把市面上能试的工具都过了一遍。倒不是闲得慌,是被逼的——上一版综述被导师标红「这几篇文献查不到」,回去一核对,真的是编的,期刊、年份、作者全对不上号,活活被将了一军。吃过这个亏之后我给自己定了个规矩:测评一个综述工具,引用是不是真的必须放…

2026/7/31 3:17:34 阅读更多 →
DHT11温湿度传感器一线协议驱动:从硬件连接到软件解码全解析

DHT11温湿度传感器一线协议驱动:从硬件连接到软件解码全解析

1. 项目概述:从“一线”窥探嵌入式世界的简约之美 在嵌入式开发的世界里,传感器是系统感知物理世界的“五官”。而要让这些“五官”与作为“大脑”的微控制器(MCU)顺畅对话,就需要一套双方都认可的“语言”&#xff0c…

2026/7/31 3:17:34 阅读更多 →
六边形数回高级技巧:设置栅栏的原理与应用实战

六边形数回高级技巧:设置栅栏的原理与应用实战

1. 从“数回”到“栅栏”:一个逻辑谜题的深度解构如果你是一个逻辑谜题爱好者,或者对那种需要“连点成线”的网格游戏情有独钟,那么“数回”(Slitherlink)这个名字你一定不陌生。它规则简洁——用线连接相邻的点&#…

2026/7/31 3:17:33 阅读更多 →
水下航行器NMPC控制:Matlab实现与分布式轨迹跟踪

水下航行器NMPC控制:Matlab实现与分布式轨迹跟踪

1. 水下航行器NMPC控制:从理论到Matlab实现水下航行器的自主导航与控制一直是海洋工程领域的核心挑战。传统PID控制在复杂洋流环境下往往表现不佳,而基于非线性模型预测控制(NMPC)的分布式轨迹跟踪方案,通过实时优化和…

2026/7/31 3:16:33 阅读更多 →

日新闻

物理复制比逻辑复制好在哪?数据库复制原理详解

物理复制比逻辑复制好在哪?数据库复制原理详解

数据库复制是把主库数据同步到备库的机制,分为逻辑复制和物理复制两种。逻辑复制传输的是 SQL 语句或行变更事件,物理复制传输的是存储引擎底层的物理日志。阿里云 PolarDB(云原生数据库)采用物理复制,在同步延迟、数据…

2026/7/31 0:00:34 阅读更多 →
BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南 【免费下载链接】BilibiliDown (GUI-多平台支持) B站 哔哩哔哩 视频下载器。支持稍后再看、收藏夹、UP主视频批量下载|Bilibili Video Downloader 😳 项目地址: https://gitcode.com/gh_mirrors/bi/Bilib…

2026/7/31 0:00:34 阅读更多 →
有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

当前,游戏行业的“DataAI融合”已从概念验证进入价值落地阶段。根据IDC 2025年数据,中国AI游戏云市场规模已达18.6亿元;同时,游戏研发环节AI渗透率高达86%,生成式AI内容普及率超过50%。面对庞大的市场,游戏…

2026/7/31 0:00:34 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/31 1:03:03 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/29 15:00:03 阅读更多 →

月新闻