python神经网络编程入门(十二)——CNN池化层(Pooling)—— 为什么要“压缩“图像?
本文属于《Python神经网络入门零基础保姆级路线图》专栏上一篇python神经网络编程入门十一——CNN卷积层的反向传播—— 为什么要把卷积核转 180°下一篇​​​​​​​​​​​​​​python神经网络编程入门十三——CNN纯 NumPy 实现 LeNet-5 全流程拆解与 MNIST 前向验证上完整目录 更新记录《Python神经网络入门零基础保姆级路线图附全系列免费源码》一、回顾与痛点在上一篇中我们用纯 NumPy 手撕了卷积层的前向与反向传播。你现在已经知道卷积层通过卷积核在图像上滑动提取局部特征。但请你思考一个问题如果输入是一张 256x256 的图片经过第一层卷积假设 stride1, paddingsame特征图依然是 256x256。如果接着再做卷积尺寸几乎不变。这会带来两个灾难性的后果计算量爆炸特征图越大下一层卷积需要做的乘加操作就越多。过拟合与参数爆炸如果最后要接全连接层进行分类假设最终的卷积特征图是 32x32x128展平后就是 131072 维。全连接层的参数量会轻松突破千万级模型极易过拟合。为了解决这个问题神经网络引入了池化层Pooling Layer。它就像一个压缩器专门用来缩小特征图的尺寸。二、池化层的三个核心使命池化层没有需要学习的参数没有权重和偏置它只是一个固定的计算操作。它的核心作用有以下三点作用一降维减少计算量与参数量池化层通过对特征图进行下采样Downsampling大幅减少空间尺寸。比如 4x4 的特征图经过 2x2 池化后变成 2x2——像素数量直接减少到原来的四分之一。后续层的计算量和参数量也随之大幅下降。作用二平移不变性Translation Invariance这是池化层最精妙的地方。假设图片中的猫向左平移了 2 个像素在卷积层看来特征图上的激活位置发生了变化。但经过 MaxPooling取最大值后只要猫的特征比如胡须的强响应依然在池化窗口内池化后的输出结果是完全相同的。这就让网络对物体的微小位移不再敏感大大增强了泛化能力。作用三防止过拟合参数数量减少模型复杂度降低自然就不容易过拟合。三、MaxPooling vs AveragePooling两种压缩方式的本质区别池化层最常用的两种方式是最大池化MaxPooling和平均池化AveragePooling。3.1 MaxPooling最大池化原理在池化窗口内只取最大值作为输出其余全部丢弃。特性提取最显著的特征如边缘、纹理的强烈响应相当于做了一个特征增强让最强的信号传递下去。应用通常放在卷积层之后用来提取最突出的纹理或轮廓特征。3.2 AveragePooling平均池化原理在池化窗口内取所有数值的算术平均值作为输出。特性对输入进行平滑处理减少噪声干扰保留的是局部区域的整体水平而非峰值。应用通常用在网络的最后几层如全局平均池化 GAP或者需要对背景信息进行平滑的场景。3.3 直观的数字对比假设某个池化窗口内的 4 个数值排列如下为了数据连贯我们使用固定的 2x2 区域1356MaxPooling 结果 max(1, 3, 5, 6) 6AveragePooling 结果 (1 3 5 6) / 4 15 / 4 3.75可以看到MaxPooling 只关心谁最强而 AveragePooling 关心大家平均是什么水平。四、池化的前向传播一步一步手算 4x4 矩阵池化的前向传播和卷积非常相似——都是用窗口在输入上滑动在每个位置计算一个值。不同之处在于卷积做加权和需要参数池化做max或mean不需要参数。我们设定输入特征图A是一个固定的 4x4 矩阵为了你能完全跟上我们不使用随机数。它在 NumPy 中的表示为import numpy as np A np.array([[1, 3, 2, 4], [5, 6, 8, 7], [2, 1, 3, 5], [4, 6, 2, 3]])设定池化参数窗口大小 2x2步长 Stride 2无重叠最常用的方式。第一步定位第一个窗口行索引 0-1列索引 0-1窗口内的数据矩阵为1356MaxPooling 计算结果 max 6AveragePooling 计算结果 mean 3.75输出位置(0, 0)分别为 6 和 3.75。第二步窗口向右移动 2 步行索引 0-1列索引 2-3窗口内的数据矩阵为2487MaxPooling 计算结果 max 8AveragePooling 计算结果 mean (2487)/4 5.25输出位置(0, 1)分别为 8 和 5.25。第三步窗口向下移动 2 步行索引 2-3列索引 0-1窗口内的数据矩阵为2146MaxPooling 计算结果 max 6AveragePooling 计算结果 mean (2146)/4 3.25输出位置(1, 0)分别为 6 和 3.25。第四步窗口移动到右下角行索引 2-3列索引 2-3窗口内的数据矩阵为3523MaxPooling 计算结果 max 5AveragePooling 计算结果 mean (3523)/4 3.25输出位置(1, 1)分别为 5 和 3.25。最终前向传播结果汇总MaxPooling 输出矩阵 (2x2) 为[[6, 8], [6, 5]]AveragePooling 输出矩阵 (2x2) 为[[3.75, 5.25], [3.25, 3.25]]看到没有4x4 的输入被压缩成了 2x2 的输出——尺寸缩小了一半五、池化的反向传播梯度如何传回去重点难点这是池化层最核心、也最容易混淆的地方。请打起精神跟着我的步骤一步步理解。在反向传播中梯度要从输出层传回输入层。池化层把 4 个像素压缩成了 1 个像素那么反向传播时1 个像素的梯度要分给 4 个像素。关键铁律是传递前后梯度的总和必须保持不变梯度守恒。5.1 MaxPooling 的反向传播最大值独享梯度MaxPooling 在前向传播时只把窗口内的最大值传递给了下一层其他值直接被丢弃了。那么在反向传播时最大值所在的位置独享全部梯度梯度原封不动地传给它。其他位置梯度为 0因为它们在前向传播时没有贡献。这就引出了一个关键问题反向传播时我们必须知道前向传播时最大值在哪个位置所以在实现 MaxPooling 时前向传播必须记录下最大值的位置通常称为mask或argmax。具体反向传播手算例子还是用刚才的第一个 2x2 窗口左上角1356← 最大值 6 在右下角假设反向传播时上层传下来的梯度dOut 0.5。那么传回给这个窗口内每个位置的梯度dA分配如下0000.5← 独享全部梯度验证梯度守恒输入的梯度总和 0000.5 0.5等于输出的梯度 0.5。5.2 AveragePooling 的反向传播平均值均分梯度AveragePooling 在前向传播时把窗口内所有值的平均值传递给了下一层。那么在反向传播时窗口内的每个位置均分梯度。具体反向传播手算例子同样的 2x2 窗口左上角1356前向传播输出平均值 3.75。假设反向传播时上层传下来的梯度dOut 0.5。窗口内有 4 个像素所以每个像素分得的梯度 0.5 / 4 0.125。传回给这个窗口内每个位置的梯度dA分配如下0.1250.1250.1250.125验证梯度守恒输入的梯度总和 0.125 * 4 0.5等于输出的梯度 0.5。✅⚠️ 致命错误提醒千万不要把 0.5 复制 4 份传回去那样总和变成 2.0是原来的 4 倍会造成梯度爆炸六、用 NumPy 完整实现 MaxPooling 的前向与反向理论讲完了现在我们来写代码6.1 准备工作设置固定数据为了保证数据的连贯性我们使用和手算例子中完全相同的输入数据4x4 矩阵。import numpy as np # 固定的输入数据4x4和手算例子完全一致 A np.array([[1, 3, 2, 4], [5, 6, 8, 7], [2, 1, 3, 5], [4, 6, 2, 3]], dtypenp.float64) print(输入特征图 A (4x4):) print(A)输出6.2 前向传播实现带掩码记录def max_pooling_forward(A, pool_size2, stride2): MaxPooling 前向传播 参数: A: 输入特征图形状 (H, W) pool_size: 池化窗口大小 stride: 步长 返回: out: 池化后的输出 mask: 记录最大值位置的掩码 (用于反向传播) H, W A.shape # 计算输出尺寸假设整除 out_h (H - pool_size) // stride 1 out_w (W - pool_size) // stride 1 out np.zeros((out_h, out_w)) # mask 形状(out_h, out_w, pool_size, pool_size) mask np.zeros((out_h, out_w, pool_size, pool_size), dtypebool) for i in range(out_h): for j in range(out_w): h_start i * stride h_end h_start pool_size w_start j * stride w_end w_start pool_size # 提取当前窗口 (这是一个 2x2 切片) window A[h_start:h_end, w_start:w_end] # 找最大值并赋值 max_val np.max(window) out[i, j] max_val # 找到最大值在窗口内的平面索引并还原为二维坐标 flat_idx np.argmax(window) # 例如 3 代表第 3 个位置 row_idx flat_idx // pool_size # 行坐标 col_idx flat_idx % pool_size # 列坐标 mask[i, j, row_idx, col_idx] True # 标记该位置为最大值来源 return out, mask # 测试前向传播 out, mask max_pooling_forward(A, pool_size2, stride2) print(MaxPooling 输出 (2x2):) print(out) print(\n掩码 mask (记录最大值位置True 代表该位置是最大值):) print(mask)输出结果验证6.3 反向传播实现def max_pooling_backward(dout, mask, pool_size2, stride2): MaxPooling 反向传播 参数: dout: 来自上层的梯度形状 (out_h, out_w) mask: 前向传播时记录的最大值位置掩码 返回: dA: 传递给输入的梯度形状与输入相同 (H, W) out_h, out_w dout.shape # 恢复输入尺寸假设是正方形 H out_h * stride W out_w * stride dA np.zeros((H, W)) for i in range(out_h): for j in range(out_w): # 取出当前输出位置的梯度值标量 grad dout[i, j] # 在当前窗口的 mask 中找到最大值的位置 (True 所在位置) # mask[i, j] 是一个 pool_size x pool_size 的布尔矩阵 rows, cols np.where(mask[i, j]) # 由于我们只记录了一个最大值取第一个 (0) if len(rows) 0: r rows[0] c cols[0] # 计算在原始输入 A 中的绝对坐标 abs_r i * stride r abs_c j * stride c # 将梯度原封不动传给这个位置独享 dA[abs_r, abs_c] grad return dA # 测试反向传播 # 假设从上层传下来的梯度全是 1方便我们验证结果 dout np.ones((2, 2)) dA max_pooling_backward(dout, mask, pool_size2, stride2) print(来自上层的梯度 dout (2x2全部为 1):) print(dout) print(\n反向传播后传递给输入的梯度 dA (4x4):) print(dA)输出结果验证验证结果分析对照我们手算的四个窗口最大值位置反向传播后只有四个位置获得了梯度值为1其他位置全部为0。这完美符合 MaxPooling 最大值独享梯度 的原则6.4 面向对象的完整封装实战标准最后我们将上述功能封装成标准的MaxPooling2D类方便在神经网络中直接调用。class MaxPooling2D: MaxPooling 层2D纯 NumPy 实现支持前向与反向传播 def __init__(self, pool_size2, stride2): self.pool_size pool_size self.stride stride self.mask None # 存储最大值位置 self.input_shape None # 存储输入尺寸用于反向传播 def forward(self, A): 前向传播 self.input_shape A.shape H, W A.shape pool_size self.pool_size stride self.stride out_h (H - pool_size) // stride 1 out_w (W - pool_size) // stride 1 out np.zeros((out_h, out_w)) mask np.zeros((out_h, out_w, pool_size, pool_size), dtypebool) for i in range(out_h): for j in range(out_w): h_start i * stride h_end h_start pool_size w_start j * stride w_end w_start pool_size window A[h_start:h_end, w_start:w_end] out[i, j] np.max(window) flat_idx np.argmax(window) row_idx flat_idx // pool_size col_idx flat_idx % pool_size mask[i, j, row_idx, col_idx] True self.mask mask return out def backward(self, dout): 反向传播 H, W self.input_shape pool_size self.pool_size stride self.stride out_h, out_w dout.shape dA np.zeros((H, W)) for i in range(out_h): for j in range(out_w): grad dout[i, j] rows, cols np.where(self.mask[i, j]) if len(rows) 0: r, c rows[0], cols[0] abs_r i * stride r abs_c j * stride c dA[abs_r, abs_c] grad return dA # 使用示例 pool MaxPooling2D(pool_size2, stride2) output pool.forward(A) print(类方法前向输出:\n, output) grad_input pool.backward(dout) print(类方法反向输出:\n, grad_input)七、本章总结与下篇预告在本篇中你学会了池化的意义降维、平移不变性、防止过拟合。两种池化方式MaxPooling取最大值特征增强和 AveragePooling取均值平滑。前向传播用固定窗口滑动计算并手算了 4x4 矩阵的完整过程。反向传播重点MaxPooling梯度独享给最大值位置其余为 0。AveragePooling梯度均分给窗口内所有位置。代码实现纯 NumPy 实现了 MaxPooling 的前向与反向并封装为类。八、下篇预告我们已经有了卷积层和池化层下一章我们将把它们组合起来构建一个完整的卷积神经网络CNN并使用反向传播联合训练。你将看到这些层是如何协同工作完成图像分类任务的第13篇组装经典 LeNet-5 —— 用纯 NumPy 跑通第一个 CNN 模型LeNet-5 结构详解Conv1 → Pool1 → Conv2 → Pool2 → FC1 → FC2 → 输出逐层拆解参数和尺寸变化将卷积层、池化层、全连接层组装起来实现一个可训练的 CNN 类前向与反向的完整数据流在 MNIST 上验证 CNN 的威力用纯 NumPy 训练 LeNet-5对比 MLP 的准确率亲眼见证卷积池化带来的巨大提升我们下一篇见

相关新闻

环境变量与Python环境配置

环境变量与Python环境配置

1. 环境变量1.1 定义环境变量(Environment Variable)是操作系统维护的一组"键值对",用来告诉系统和应用程序运行时所需要的一些重要的配置信息环境变量相当于给系统或用户应用程序设置的一些参数,具体起什么作用和具体的…

2026/9/23 17:17:23 阅读更多 →
工业软件底层架构设计与核心模块开发实践

工业软件底层架构设计与核心模块开发实践

1. 工业软件底层架构设计的核心挑战工业软件(CAD/CAE/CAM等)的底层架构设计面临着独特的工程挑战。与通用软件不同,这些系统需要同时处理复杂的数学计算、海量数据处理和实时交互需求。以CAD系统为例,其核心几何引擎每秒需要处理数…

2026/9/22 7:40:35 阅读更多 →
python的工业过程控制场景模拟第一百一十三篇:开发储罐联锁逻辑仿真,液位超高关闭进料阀,液位过低关闭出料泵。

python的工业过程控制场景模拟第一百一十三篇:开发储罐联锁逻辑仿真,液位超高关闭进料阀,液位过低关闭出料泵。

储罐联锁逻辑仿真 —— 液位超高/过低安全保护系统 "那年半夜,A3罐液位计突然卡死在60%,实际液位悄悄爬到98%,进料阀还开着。幸亏SIS系统的联锁在99%硬切断,否则就是一场漫溢事故。那一刻我才明白:安全联锁不是万…

2026/9/21 14:37:13 阅读更多 →

最新新闻

ECG心电信号分类实战:Python与Matlab双版本实现与避坑指南

ECG心电信号分类实战:Python与Matlab双版本实现与避坑指南

简介:这是一份面向医学数据分析、生物医学工程及机器学习初学者的ECG心电信号分类资源包,整合Python与MATLAB两套实现方案,帮助学习者掌握从信号预处理、特征提取到分类建模的完整流程。压缩包共825个文件,约6.25MB,核…

2026/9/24 0:46:51 阅读更多 →
YOLOv7打电话检测实战:双格式数据集与训练部署全解析

YOLOv7打电话检测实战:双格式数据集与训练部署全解析

简介:YOLOv7打电话行为检测项目,面向计算机视觉开发者与边缘设备部署场景,适合需要快速落地手持电话识别功能的工程人员及高校研究者。压缩包提供训练好的权重、完整训练代码以及配套数据集,可直接加载权重进行图片/视频推理&…

2026/9/24 0:46:51 阅读更多 →
ResNet50迁移学习做垃圾分类:数据对齐、模型改造与可解释性实战

ResNet50迁移学习做垃圾分类:数据对齐、模型改造与可解释性实战

简介:本资源是一份基于ResNet50迁移学习实现垃圾分类任务的完整Python项目,面向计算机、人工智能、数据科学等专业学生及初入CV领域的开发者,适用于课程设计、毕业设计、大作业或技术验证场景。项目已通过实测运行,包含模型训练、…

2026/9/24 0:46:51 阅读更多 →
基于SpringBoot的仓储管理系统-附源码

基于SpringBoot的仓储管理系统-附源码

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/9/24 0:44:50 阅读更多 →
ISO 24748-3指南:软件生命周期过程落地与裁剪实战

ISO 24748-3指南:软件生命周期过程落地与裁剪实战

简介:ISO/IEC/IEEE 24748-3:2020 是一份系统与软件工程领域生命周期管理国际标准,旨在为组织实施 ISO/IEC/IEEE 12207(软件生命周期过程)提供详细指南。该标准共75页,完整英文电子版,适用于软件工程师、系统…

2026/9/24 0:44:50 阅读更多 →
Linux与Windows交替输出实现原理对比

Linux与Windows交替输出实现原理对比

1. 这道题到底在考什么:从“交替输出”看操作系统思维的本质差异刚看到这个标题——“Linux课后作业,用Windows下批处理和Linux下的shell脚本完成,两文本交替输出”——我第一反应不是写代码,而是笑了。不是笑题目难,是…

2026/9/24 0:44:50 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/23 4:55:02 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/23 4:49:06 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/23 9:53:41 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/23 9:53:40 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/23 9:53:40 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/23 9:53:40 阅读更多 →