吴恩达深度学习课程一:神经网络和深度学习 第四周:深度神经网络的关键概念
吴恩达深度学习课程一神经网络和深度学习 第四周深度神经网络的关键概念大家好我是你们的技术博主小深。今天我们来聊聊吴恩达老师的深度学习课程第一部分的第四周内容——深度神经网络的关键概念。如果你已经学完了前三周从线性回归到浅层神经网络那么第四周就是带你从“浅水区”游向“深水区”的关键一步。别怕我会用大白话讲清楚并配上可运行的代码示例让你看得懂、跑得动。## 什么是深度神经网络深度神经网络Deep Neural Network简称DNN说白了就是有很多层隐藏层的神经网络。浅层神经网络比如只有一个隐藏层能解决的问题有限比如简单的分类任务。但现实中很多问题比如图像识别、语音识别非常复杂需要多层神经网络来提取更抽象的特征。举个例子识别一张图片里有没有猫。浅层网络可能只能看到像素点边缘、颜色而深层网络可以逐步组合出“眼睛”、“耳朵”、“胡须”这些更高级的特征最后判断是不是猫。这就是“深层”的价值——层次越深特征越抽象。## 关键概念一前向传播和反向传播在深度神经网络中训练过程分为两步前向传播Forward Propagation和反向传播Backward Propagation。简单来说-前向传播从输入层开始一层一层向前计算直到输出层。每层会计算线性部分z w * a_prev b和激活部分a activation(z)。-反向传播从输出层开始向后计算每一层的梯度即损失函数对参数的导数然后用这些梯度更新参数。这两个过程是“对偶”的前向传播时的中间值比如z和a会被缓存下来供反向传播使用。这就是为什么代码里要“缓存”中间结果。下面是前向传播的通用公式- 对于第l层Z[l] W[l] * A[l-1] b[l]- A[l] gl其中g[l]是激活函数ReLU、sigmoid等反向传播的梯度计算公式以sigmoid为例- dZ[l] dA[l] * g[l](Z[l])- dW[l] (1/m) * dZ[l] * A[l-1]T- db[l] (1/m) * np.sum(dZ[l], axis1, keepdimsTrue)## 关键概念二参数初始化深度神经网络对参数初始化非常敏感。如果W初始化为0那么所有隐藏单元会对称导致所有神经元学到相同的东西即“对称性问题”。因此我们通常使用随机初始化并且根据激活函数选择不同的缩放因子。对于ReLU激活函数推荐使用“He初始化”W[l] np.random.randn(shape) * np.sqrt(2 / n[l-1])对于tanh或sigmoid推荐使用“Xavier初始化”W[l] np.random.randn(shape) * np.sqrt(1 / n[l-1])## 代码示例一实现深度神经网络的前向传播下面是一个简单的深度神经网络前向传播代码包含两层隐藏层使用ReLU和输出层使用sigmoid。注意看缓存机制。pythonimport numpy as npdef initialize_parameters(layer_dims): 初始化深度神经网络的参数 layer_dims: 包含每层神经元数量的列表例如 [2, 4, 3, 1] 表示输入层2个隐藏层1有4个隐藏层2有3个输出层1个 np.random.seed(1) # 固定随机种子方便复现 parameters {} L len(layer_dims) # 层数包括输入层 for l in range(1, L): # He初始化适用于ReLU parameters[W str(l)] np.random.randn(layer_dims[l], layer_dims[l-1]) * np.sqrt(2 / layer_dims[l-1]) parameters[b str(l)] np.zeros((layer_dims[l], 1)) return parametersdef linear_forward(A_prev, W, b): 线性前向传播Z W * A_prev b Z np.dot(W, A_prev) b cache (A_prev, W, b) # 缓存供反向传播使用 return Z, cachedef activation_forward(Z, activation_type): 激活函数前向传播 if activation_type sigmoid: A 1 / (1 np.exp(-Z)) cache Z elif activation_type relu: A np.maximum(0, Z) cache Z else: raise ValueError(Unsupported activation type) return A, cachedef forward_propagation(X, parameters): 完整的前向传播 caches [] A X L len(parameters) // 2 # 层数不包括输入层 # 隐藏层使用ReLU for l in range(1, L): A_prev A W parameters[W str(l)] b parameters[b str(l)] Z, linear_cache linear_forward(A_prev, W, b) A, activation_cache activation_forward(Z, relu) caches.append((linear_cache, activation_cache)) # 输出层使用sigmoid W parameters[W str(L)] b parameters[b str(L)] Z, linear_cache linear_forward(A, W, b) A, activation_cache activation_forward(Z, sigmoid) caches.append((linear_cache, activation_cache)) return A, caches# 测试输入层2个特征两个隐藏层4个和3个神经元输出层1个layer_dims [2, 4, 3, 1]parameters initialize_parameters(layer_dims)X np.array([[0.5, 0.2], [0.1, 0.8]]) # 两个样本A_final, caches forward_propagation(X, parameters)print(输出层结果, A_final)运行这段代码你会看到输出层的结果概率值它表示每个样本属于正类的概率。注意这里参数是随机初始化的所以结果不是训练后的预测。## 关键概念三为什么深度神经网络有效深度神经网络之所以强大有两个主要原因1.层次化特征提取浅层网络只能学习简单特征如边缘深层网络可以组合这些特征形成更复杂的模式。在图像识别中第一层学边缘第二层学形状第三层学物体部件第四层学整个物体。2.参数共享和效率深度神经网络通过分层结构可以用更少的参数模拟更复杂的函数。理论上一个足够深的网络可以用指数级少的参数达到与浅层网络相同的表示能力。## 关键概念四深度神经网络的训练技巧训练深度神经网络时有几个常见问题需要留意-梯度消失/爆炸当网络很深时梯度在反向传播中可能指数级缩小消失或增大爆炸。解决方法包括使用ReLU等非饱和激活函数、批量归一化、梯度裁剪。-过拟合深度网络参数多容易过拟合。可以用L2正则化、dropout、数据增强来缓解。-学习率调整深度网络训练需要合适的学习率。可以使用学习率衰减learning rate decay或自适应优化器如Adam。## 代码示例二实现深度神经网络的损失函数和反向传播下面我们实现一个完整的反向传播示例包括损失函数计算和梯度更新。pythondef compute_loss(A_final, Y): 计算交叉熵损失 A_final: 输出层激活值预测概率 Y: 真实标签0或1 m Y.shape[1] loss -1/m * np.sum(Y * np.log(A_final) (1 - Y) * np.log(1 - A_final)) return np.squeeze(loss)def linear_backward(dZ, cache): 线性反向传播计算dW, db, dA_prev A_prev, W, b cache m A_prev.shape[1] dW 1/m * np.dot(dZ, A_prev.T) db 1/m * np.sum(dZ, axis1, keepdimsTrue) dA_prev np.dot(W.T, dZ) return dA_prev, dW, dbdef activation_backward(dA, cache, activation_type): 激活函数反向传播计算dZ Z cache if activation_type sigmoid: s 1 / (1 np.exp(-Z)) dZ dA * s * (1 - s) # sigmoid导数 elif activation_type relu: dZ dA * (Z 0) # ReLU导数大于0时为1否则为0 else: raise ValueError(Unsupported activation type) return dZdef backward_propagation(Y, caches): 完整的反向传播返回所有参数的梯度 grads {} L len(caches) m Y.shape[1] # 初始化输出层的dAcross-entropy loss对sigmoid输出的导数 A_final, _ caches[-1] # caches中最后一组是输出层 dA - (np.divide(Y, A_final) - np.divide(1 - Y, 1 - A_final)) # 反向传播从输出层开始 for l in reversed(range(L)): linear_cache, activation_cache caches[l] if l L-1: # 输出层使用sigmoid dZ activation_backward(dA, activation_cache, sigmoid) else: # 隐藏层使用ReLU dZ activation_backward(dA, activation_cache, relu) dA_prev, dW, db linear_backward(dZ, linear_cache) grads[dW str(l1)] dW grads[db str(l1)] db dA dA_prev return gradsdef update_parameters(parameters, grads, learning_rate): 使用梯度下降更新参数 L len(parameters) // 2 for l in range(L): parameters[W str(l1)] - learning_rate * grads[dW str(l1)] parameters[b str(l1)] - learning_rate * grads[db str(l1)] return parameters# 测试反向传播使用上面的前向传播结果Y np.array([[1, 0]]) # 两个样本的真实标签loss compute_loss(A_final, Y)print(损失值, loss)grads backward_propagation(Y, caches)print(dW3的形状, grads[dW3].shape) # 输出层权重梯度# 更新参数parameters update_parameters(parameters, grads, learning_rate0.01)print(更新后的W3, parameters[W3][:2]) # 只看前两行运行这段代码你会看到损失值和梯度更新的结果。这就是深度神经网络训练的核心循环前向传播 - 计算损失 - 反向传播 - 更新参数。## 总结深度神经网络是深度学习的基础。第四周课程主要教会我们三件事1.深层网络的结构通过堆叠多个隐藏层网络可以学习更抽象的特征。2.前向传播和反向传播这是训练的核心需要理解每层的计算和缓存机制。3.参数初始化与训练技巧好的初始化能加速收敛梯度消失/爆炸需要警惕。从代码实现来看深度神经网络的代码虽然比浅层网络复杂但核心思想是一致的线性变换 激活函数然后反复堆叠。只要你掌握了浅层网络第三周内容深层网络只是“重复”和“缓存”的升级版。吴恩达老师在这周的课程中还强调了向量化实现的重要性——用矩阵运算替代for循环能让代码跑得飞快。上面我的代码例子已经用了向量化你可以试试跑一下感受一下矩阵运算的魅力。最后记住一句话深度不是魔法而是层次化抽象。希望这篇文章能帮你更好地理解深度神经网络如果你有任何疑问欢迎在评论区留言讨论。

相关新闻

终极AMD Ryzen调试指南:SMUDebugTool深度使用与硬件性能调优教程

终极AMD Ryzen调试指南:SMUDebugTool深度使用与硬件性能调优教程

终极AMD Ryzen调试指南:SMUDebugTool深度使用与硬件性能调优教程 【免费下载链接】SMUDebugTool A dedicated tool to help write/read various parameters of Ryzen-based systems, such as manual overclock, SMU, PCI, CPUID, MSR and Power Table. 项目地址: …

2026/7/24 22:19:52 阅读更多 →
3步快速上手大气层整合包系统:从安装到实战的完整指南

3步快速上手大气层整合包系统:从安装到实战的完整指南

3步快速上手大气层整合包系统:从安装到实战的完整指南 【免费下载链接】Atmosphere-stable 大气层整合包系统稳定版 项目地址: https://gitcode.com/gh_mirrors/at/Atmosphere-stable 大气层整合包系统是Nintendo Switch上功能最强大、最稳定的自制系统解决方…

2026/7/24 22:18:52 阅读更多 →
临沂企业数字化服务商选择要点

临沂企业数字化服务商选择要点

临沂企业数字化服务商选择:聚焦技术、数据与合规的实用指南随着AI技术加速渗透本地产业,临沂企业在选择数字化服务商时,面临的核心挑战不再是“要不要做”,而是“如何选对”。面对市场上众多概念和方案,企业决策者需回…

2026/7/24 22:18:52 阅读更多 →

最新新闻

宇宙膨胀率吵炸锅!或掀翻物理学,是危机吗?

宇宙膨胀率吵炸锅!或掀翻物理学,是危机吗?

在圣巴巴拉一处离海岸仅几步之遥的会议室里,一众天文学家与物理学家正坐立难安。窗外阳光和煦、海风轻拂,可他们却闭门不出,只为探讨物理学界的一大难题:宇宙的膨胀速度究竟是多少。 依托超新星(恒星爆炸)观…

2026/7/24 22:26:55 阅读更多 →
Tcp客户端报错原因分析

Tcp客户端报错原因分析

00000001 2026-03-26 03:06:04 CTcpClient TCP连接测试ConnectTest failed!Server Ipaddr:10.135.134.103, iPort=7807,错误:Bad file descriptor 00000002 2026-03-26 03:06:04 CTcpClient ConnectThread 连接服务器失败!Server Ipaddr:10.135.134.103, iPort=7807,错误…

2026/7/24 22:26:55 阅读更多 →
VC++串口通讯模块实战:异步I/O、环形缓冲区与工业级可靠性设计

VC++串口通讯模块实战:异步I/O、环形缓冲区与工业级可靠性设计

1. 项目概述:从零构建一个可靠的VC串口通讯模块在工业控制、嵌入式开发、仪器仪表对接等众多领域,串口通讯(Serial Communication)至今仍是设备间进行数据交换最经典、最可靠的通信方式之一。尽管网络通信日益普及,但串…

2026/7/24 22:26:55 阅读更多 →
AI 版权求证:用 Andersen、Getty、Bartz 等真实裁决,拆“AI 偷画“传言

AI 版权求证:用 Andersen、Getty、Bartz 等真实裁决,拆“AI 偷画“传言

一、"AI 偷画"这个说法,从哪来的 很多画师这两年心里有个结:AI 绘画公司把我们作品偷偷喂进模型,这不就是偷吗?我完全理解这种愤怒,但写这篇文章,是想把AI 版权这团事摊开了看。一句话先放这儿&a…

2026/7/24 22:26:55 阅读更多 →
AI智能体与具身智能关系误区纠偏(系列)

AI智能体与具身智能关系误区纠偏(系列)

前沿技术探索:AI智能体视觉(TVA,Transformer-based Vision Agent)是依托Transformer架构与“因式智能体”理论所构建的颠覆性工业视觉技术,是集深度强化学习(DRL)、卷积神经网络(CNN…

2026/7/24 22:26:55 阅读更多 →
多轮对话的前端状态机:上下文窗口与轮次的工程化治理

多轮对话的前端状态机:上下文窗口与轮次的工程化治理

多轮对话的前端状态机:上下文窗口与轮次的工程化治理 一、对话失控现场:当多轮上下文在前端堆成幽灵 大模型应用前端有一个高频踩坑点:把对话状态散落在 useEffect 与若干 useState 里,看起来能跑,实际状态机是隐式的。…

2026/7/24 22:25:55 阅读更多 →

日新闻

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…

2026/7/24 0:00:29 阅读更多 →
AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口 AppCertDlls 位于 HKLM\System\CurrentControlSet\Control\Session Manager\AppCertDlls。本文的程序功能是只读列出这个键在 64 位和 32 位注册表视图中的全部值,并显示每条值的来源、名称、类型和可安全显示的数…

2026/7/24 0:00:29 阅读更多 →
我的编程之路:第一篇博客

我的编程之路:第一篇博客

大家好,我是一名编程初学者,同时这也是我编程学习之路上的第一篇博客。在这里,我想要向大家介绍我的一些想法和规划。a.自我介绍我是一个刚刚接触编程的新手,目前在学习c语言,我对编程世界充满了强烈的好奇。当然&…

2026/7/24 0:00:29 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 3:59:20 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/24 18:52:18 阅读更多 →

月新闻