吴恩达深度学习课程一:神经网络和深度学习 第四周:深度神经网络的关键概念
吴恩达深度学习课程一神经网络和深度学习 第四周深度神经网络的关键概念大家好我是你们的技术博主小深。今天我们来聊聊吴恩达老师的深度学习课程第一部分的第四周内容——深度神经网络的关键概念。如果你已经学完了前三周从线性回归到浅层神经网络那么第四周就是带你从“浅水区”游向“深水区”的关键一步。别怕我会用大白话讲清楚并配上可运行的代码示例让你看得懂、跑得动。## 什么是深度神经网络深度神经网络Deep Neural Network简称DNN说白了就是有很多层隐藏层的神经网络。浅层神经网络比如只有一个隐藏层能解决的问题有限比如简单的分类任务。但现实中很多问题比如图像识别、语音识别非常复杂需要多层神经网络来提取更抽象的特征。举个例子识别一张图片里有没有猫。浅层网络可能只能看到像素点边缘、颜色而深层网络可以逐步组合出“眼睛”、“耳朵”、“胡须”这些更高级的特征最后判断是不是猫。这就是“深层”的价值——层次越深特征越抽象。## 关键概念一前向传播和反向传播在深度神经网络中训练过程分为两步前向传播Forward Propagation和反向传播Backward Propagation。简单来说-前向传播从输入层开始一层一层向前计算直到输出层。每层会计算线性部分z w * a_prev b和激活部分a activation(z)。-反向传播从输出层开始向后计算每一层的梯度即损失函数对参数的导数然后用这些梯度更新参数。这两个过程是“对偶”的前向传播时的中间值比如z和a会被缓存下来供反向传播使用。这就是为什么代码里要“缓存”中间结果。下面是前向传播的通用公式- 对于第l层Z[l] W[l] * A[l-1] b[l]- A[l] gl其中g[l]是激活函数ReLU、sigmoid等反向传播的梯度计算公式以sigmoid为例- dZ[l] dA[l] * g[l](Z[l])- dW[l] (1/m) * dZ[l] * A[l-1]T- db[l] (1/m) * np.sum(dZ[l], axis1, keepdimsTrue)## 关键概念二参数初始化深度神经网络对参数初始化非常敏感。如果W初始化为0那么所有隐藏单元会对称导致所有神经元学到相同的东西即“对称性问题”。因此我们通常使用随机初始化并且根据激活函数选择不同的缩放因子。对于ReLU激活函数推荐使用“He初始化”W[l] np.random.randn(shape) * np.sqrt(2 / n[l-1])对于tanh或sigmoid推荐使用“Xavier初始化”W[l] np.random.randn(shape) * np.sqrt(1 / n[l-1])## 代码示例一实现深度神经网络的前向传播下面是一个简单的深度神经网络前向传播代码包含两层隐藏层使用ReLU和输出层使用sigmoid。注意看缓存机制。pythonimport numpy as npdef initialize_parameters(layer_dims): 初始化深度神经网络的参数 layer_dims: 包含每层神经元数量的列表例如 [2, 4, 3, 1] 表示输入层2个隐藏层1有4个隐藏层2有3个输出层1个 np.random.seed(1) # 固定随机种子方便复现 parameters {} L len(layer_dims) # 层数包括输入层 for l in range(1, L): # He初始化适用于ReLU parameters[W str(l)] np.random.randn(layer_dims[l], layer_dims[l-1]) * np.sqrt(2 / layer_dims[l-1]) parameters[b str(l)] np.zeros((layer_dims[l], 1)) return parametersdef linear_forward(A_prev, W, b): 线性前向传播Z W * A_prev b Z np.dot(W, A_prev) b cache (A_prev, W, b) # 缓存供反向传播使用 return Z, cachedef activation_forward(Z, activation_type): 激活函数前向传播 if activation_type sigmoid: A 1 / (1 np.exp(-Z)) cache Z elif activation_type relu: A np.maximum(0, Z) cache Z else: raise ValueError(Unsupported activation type) return A, cachedef forward_propagation(X, parameters): 完整的前向传播 caches [] A X L len(parameters) // 2 # 层数不包括输入层 # 隐藏层使用ReLU for l in range(1, L): A_prev A W parameters[W str(l)] b parameters[b str(l)] Z, linear_cache linear_forward(A_prev, W, b) A, activation_cache activation_forward(Z, relu) caches.append((linear_cache, activation_cache)) # 输出层使用sigmoid W parameters[W str(L)] b parameters[b str(L)] Z, linear_cache linear_forward(A, W, b) A, activation_cache activation_forward(Z, sigmoid) caches.append((linear_cache, activation_cache)) return A, caches# 测试输入层2个特征两个隐藏层4个和3个神经元输出层1个layer_dims [2, 4, 3, 1]parameters initialize_parameters(layer_dims)X np.array([[0.5, 0.2], [0.1, 0.8]]) # 两个样本A_final, caches forward_propagation(X, parameters)print(输出层结果, A_final)运行这段代码你会看到输出层的结果概率值它表示每个样本属于正类的概率。注意这里参数是随机初始化的所以结果不是训练后的预测。## 关键概念三为什么深度神经网络有效深度神经网络之所以强大有两个主要原因1.层次化特征提取浅层网络只能学习简单特征如边缘深层网络可以组合这些特征形成更复杂的模式。在图像识别中第一层学边缘第二层学形状第三层学物体部件第四层学整个物体。2.参数共享和效率深度神经网络通过分层结构可以用更少的参数模拟更复杂的函数。理论上一个足够深的网络可以用指数级少的参数达到与浅层网络相同的表示能力。## 关键概念四深度神经网络的训练技巧训练深度神经网络时有几个常见问题需要留意-梯度消失/爆炸当网络很深时梯度在反向传播中可能指数级缩小消失或增大爆炸。解决方法包括使用ReLU等非饱和激活函数、批量归一化、梯度裁剪。-过拟合深度网络参数多容易过拟合。可以用L2正则化、dropout、数据增强来缓解。-学习率调整深度网络训练需要合适的学习率。可以使用学习率衰减learning rate decay或自适应优化器如Adam。## 代码示例二实现深度神经网络的损失函数和反向传播下面我们实现一个完整的反向传播示例包括损失函数计算和梯度更新。pythondef compute_loss(A_final, Y): 计算交叉熵损失 A_final: 输出层激活值预测概率 Y: 真实标签0或1 m Y.shape[1] loss -1/m * np.sum(Y * np.log(A_final) (1 - Y) * np.log(1 - A_final)) return np.squeeze(loss)def linear_backward(dZ, cache): 线性反向传播计算dW, db, dA_prev A_prev, W, b cache m A_prev.shape[1] dW 1/m * np.dot(dZ, A_prev.T) db 1/m * np.sum(dZ, axis1, keepdimsTrue) dA_prev np.dot(W.T, dZ) return dA_prev, dW, dbdef activation_backward(dA, cache, activation_type): 激活函数反向传播计算dZ Z cache if activation_type sigmoid: s 1 / (1 np.exp(-Z)) dZ dA * s * (1 - s) # sigmoid导数 elif activation_type relu: dZ dA * (Z 0) # ReLU导数大于0时为1否则为0 else: raise ValueError(Unsupported activation type) return dZdef backward_propagation(Y, caches): 完整的反向传播返回所有参数的梯度 grads {} L len(caches) m Y.shape[1] # 初始化输出层的dAcross-entropy loss对sigmoid输出的导数 A_final, _ caches[-1] # caches中最后一组是输出层 dA - (np.divide(Y, A_final) - np.divide(1 - Y, 1 - A_final)) # 反向传播从输出层开始 for l in reversed(range(L)): linear_cache, activation_cache caches[l] if l L-1: # 输出层使用sigmoid dZ activation_backward(dA, activation_cache, sigmoid) else: # 隐藏层使用ReLU dZ activation_backward(dA, activation_cache, relu) dA_prev, dW, db linear_backward(dZ, linear_cache) grads[dW str(l1)] dW grads[db str(l1)] db dA dA_prev return gradsdef update_parameters(parameters, grads, learning_rate): 使用梯度下降更新参数 L len(parameters) // 2 for l in range(L): parameters[W str(l1)] - learning_rate * grads[dW str(l1)] parameters[b str(l1)] - learning_rate * grads[db str(l1)] return parameters# 测试反向传播使用上面的前向传播结果Y np.array([[1, 0]]) # 两个样本的真实标签loss compute_loss(A_final, Y)print(损失值, loss)grads backward_propagation(Y, caches)print(dW3的形状, grads[dW3].shape) # 输出层权重梯度# 更新参数parameters update_parameters(parameters, grads, learning_rate0.01)print(更新后的W3, parameters[W3][:2]) # 只看前两行运行这段代码你会看到损失值和梯度更新的结果。这就是深度神经网络训练的核心循环前向传播 - 计算损失 - 反向传播 - 更新参数。## 总结深度神经网络是深度学习的基础。第四周课程主要教会我们三件事1.深层网络的结构通过堆叠多个隐藏层网络可以学习更抽象的特征。2.前向传播和反向传播这是训练的核心需要理解每层的计算和缓存机制。3.参数初始化与训练技巧好的初始化能加速收敛梯度消失/爆炸需要警惕。从代码实现来看深度神经网络的代码虽然比浅层网络复杂但核心思想是一致的线性变换 激活函数然后反复堆叠。只要你掌握了浅层网络第三周内容深层网络只是“重复”和“缓存”的升级版。吴恩达老师在这周的课程中还强调了向量化实现的重要性——用矩阵运算替代for循环能让代码跑得飞快。上面我的代码例子已经用了向量化你可以试试跑一下感受一下矩阵运算的魅力。最后记住一句话深度不是魔法而是层次化抽象。希望这篇文章能帮你更好地理解深度神经网络如果你有任何疑问欢迎在评论区留言讨论。

相关新闻

终极AMD Ryzen调试指南:SMUDebugTool深度使用与硬件性能调优教程

终极AMD Ryzen调试指南:SMUDebugTool深度使用与硬件性能调优教程

终极AMD Ryzen调试指南:SMUDebugTool深度使用与硬件性能调优教程 【免费下载链接】SMUDebugTool A dedicated tool to help write/read various parameters of Ryzen-based systems, such as manual overclock, SMU, PCI, CPUID, MSR and Power Table. 项目地址: …

2026/10/6 17:07:12 阅读更多 →
3步快速上手大气层整合包系统:从安装到实战的完整指南

3步快速上手大气层整合包系统:从安装到实战的完整指南

3步快速上手大气层整合包系统:从安装到实战的完整指南 【免费下载链接】Atmosphere-stable 大气层整合包系统稳定版 项目地址: https://gitcode.com/gh_mirrors/at/Atmosphere-stable 大气层整合包系统是Nintendo Switch上功能最强大、最稳定的自制系统解决方…

2026/10/8 15:10:12 阅读更多 →
临沂企业数字化服务商选择要点

临沂企业数字化服务商选择要点

临沂企业数字化服务商选择:聚焦技术、数据与合规的实用指南随着AI技术加速渗透本地产业,临沂企业在选择数字化服务商时,面临的核心挑战不再是“要不要做”,而是“如何选对”。面对市场上众多概念和方案,企业决策者需回…

2026/10/5 19:08:06 阅读更多 →

最新新闻

2026年实时数据同步工具怎么选?GoldenGate、Striim、SeaTunnel、FineDataLink 5.0横评

2026年实时数据同步工具怎么选?GoldenGate、Striim、SeaTunnel、FineDataLink 5.0横评

实时数据同步,是这两年企业数据建设里绕不开的一环。业务对实时性的要求越来越高——库存要实时、订单要实时、设备状态要实时,T1 的离线数仓在很多场景下已经不够用了。于是选型的问题摆在了面前:GoldenGate、Striim、SeaTunnel、FineDataLi…

2026/10/11 8:51:41 阅读更多 →
拼多多反爬对抗实战:Scrapy 中间件化采集架构解析

拼多多反爬对抗实战:Scrapy 中间件化采集架构解析

1. 选型依据 PDD 公开数据分布在移动端 API(mobile.yangkeduo.com)与 H5(mobile.pinduoduo.com)。当采集规模上升,手写 requests 线程池在三个方面迅速失效: 调度:限流、重试、去重需自行实现…

2026/10/11 8:51:41 阅读更多 →
Kubeadm证书过期检查实操

Kubeadm证书过期检查实操

Kubeadm证书过期检查实操技术栈:Kubernetes v1.32.13 Rocky Linux 8.6 Containerd 1.7.x Calico v3.27.x操作环境 / 对接原理 / 详细步骤 / 完整命令 / 配置文件 / 验证流程 / 排错方案Kubeadm证书过期检查实操操作环境K8s 集群版本 v1.32.13,操作系统…

2026/10/11 8:51:41 阅读更多 →
大模型Skill技能全解析:从原理、结构到实操,让AI真正动手办事

大模型Skill技能全解析:从原理、结构到实操,让AI真正动手办事

直接抛个结论:Skill 这个词,最近在 AI 圈子里火得不像话,但你要是以为它是什么高深莫测的新算法,那就想多了。它其实是一套很朴素的工程思路:把大模型从“只会聊天”改造成“能动手办事”。我自己从最早被这个概念绕晕…

2026/10/11 8:51:41 阅读更多 →
后来,我再也没说过一句谢谢

后来,我再也没说过一句谢谢

以前,我是一个很喜欢说谢谢的人。 别人帮我拿一下东西,我说谢谢;别人替我多做了一点事情,我说谢谢;哪怕对方只是在完成自己的工作,只要态度好一些,我也会习惯性地表达感谢。 我一直觉得&#xf…

2026/10/11 8:51:41 阅读更多 →
2026软件测试面试指南:从Linux到AI测试的全栈质量保障

2026软件测试面试指南:从Linux到AI测试的全栈质量保障

1. 2026年软件测试面试到底在面什么做了这么多年软件测试,也面试过不少候选人,我越来越觉得现在的面试早就不是背几套题就能过关的时代了。前两天跟一个刚跳槽去大厂的兄弟聊天,他说现在的软件测试面试题已经卷到“既要懂八股、又要能落地、还…

2026/10/11 8:50:40 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →