Datawhale组队学习-深度学习笔记(一)
文章目录第 1 章 神经网络简介第 2 章 PyTorch 入门总结第 1 章 神经网络简介神经网络的学习并不是灌输规则也不是理解概念而是通过反复调整参数让函数逐步逼近我们期望的映射关系。具体来说神经网络的学习过程可以分为 5 个步骤初始化参数训练开始前给参数θ \thetaθ赋予一组随机值此时模型的输出是粗糙、甚至无意义的模型预测将输入x xx输入模型根据当前的参数得到输出y yy计算偏差对比模型输出y yy和真实目标值判断模型做得好不好这一步会用到后续要学的损失函数调整参数根据偏差的大小和方向调整参数θ \thetaθ的取值让模型的输出更接近目标重复迭代重复步骤 2-4直到模型的输出足够准确参数不再需要大幅调整。 那神经网络真正学到的是什么一组最优的参数配置以及由这组参数所决定的函数行为。神经网络的学习本质上是在参数空间中寻找一组更好的参数使损失函数不断下降。回归任务的目标通常是预测一个连续数值。比如根据历史气温预测明天气温对于这类问题一个常见的损失函数是均方误差Mean Squared Error, MSE。计算每一个样本预测误差的平方然后取平均。预测越准确MSE 就越小。神经网络训练基本流程前向传播负责用当前参数产生预测损失函数负责衡量当前预测有多差反向传播负责计算每个参数对应的梯度优化算法负责根据梯度真正修改参数。最基本的参数更新方法就是梯度下降Gradient Descent![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/339fa00b2a4b44bebc0938bc334ea8d8.p其中η \etaη是学习率learning rate。梯度指向局部上升最快的方向因此负梯度指向局部下降最快的方向。第 2 章 PyTorch 入门前向传播负责计算数值同时记录依赖关系梯度要等到反向传播时才会真正出现。x.grad和y.grad此时都是None而不是0。这是因为梯度是一种反向回溯的产物只有当你明确发起回溯比如调用backward()时PyTorch 才会沿着刚才记录的依赖关系把梯度算出来并写回到叶子节点上。如果不调用PyTorch 就不会去计算梯度。requires_grad是张量的属性表示这个张量是否有资格被 Autograd 追踪no_grad()是上下文状态表示当前这段计算是否需要被记录。no_grad()只是暂时关闭记录离开这个代码块之后梯度记录会恢复。如果需要重新加入自动微分系统的话可以在之后设置requires_gradTrueenable_grad()局部恢复梯度记录inference_mode()纯推理不要再为反向传播保留任何可能性。虽然x.requires_gradTrue但y的计算发生在torch.no_grad()上下文中因此这次计算不会被 Autograd 记录得到的y也不会继续跟踪梯度。因为训练阶段需要反向传播计算模型参数的梯度因此前向计算需要记录相应的计算图而验证和推理阶段通常只需要得到模型的前向计算结果并不会进行反向传播或更新参数因此可以关闭梯度记录。这样可以避免保存反向传播所需的中间信息减少额外的内存占用和计算开销。第一个在no_grad里所以是False第二个在enable_grad里面所以是True。Dataset 负责定义一个样本长什么样以及如何取出一个样本。如果只是普通张量数据用TensorDataset就够了。但是一旦数据稍微复杂一点比如图片分类数据集或者文本分类数据集我们就需要自己写一个 Dataset在__getitem__()里实现读取文件、做预处理、返回标签的逻辑。-no_grad()是上下文状态表示当前这段计算是否需要被记录。no_grad()只是暂时关闭记录离开这个代码块之后梯度记录会恢复。如果需要重新加入自动微分系统的话可以在之后设置requires_gradTrueenable_grad()局部恢复梯度记录inference_mode()纯推理不要再为反向传播保留任何可能性。虽然x.requires_gradTrue但y的计算发生在torch.no_grad()上下文中因此这次计算不会被 Autograd 记录得到的y也不会继续跟踪梯度。因为训练阶段需要反向传播计算模型参数的梯度因此前向计算需要记录相应的计算图而验证和推理阶段通常只需要得到模型的前向计算结果并不会进行反向传播或更新参数因此可以关闭梯度记录。这样可以避免保存反向传播所需的中间信息减少额外的内存占用和计算开销。第一个在no_grad里所以是False第二个在enable_grad里面所以是True。classSimpleTensorDataset(utils.Dataset):Simple dataset that wraps training data and targets.def__init__(self,X:Tensor,y:Tensor):ifX.size(0)!y.size(0):raiseAssertionError(X and y must have the same length.)self.XX self.yydef__len__(self)-int:returnlen(self.X)def__getitem__(self,idx:int)-tuple[Tensor,Tensor]:Xself.X[idx]yself.y[idx]returnX,yDataLoader 负责把很多样本组织成 mini-batch并处理打乱、多进程加载、拼接 batch、pin memory 等训练时常见细节。dataloaderutils.DataLoader(dataset,batch_size32,shuffleTrue,)X,ynext(iter(dataloader))print(Input batch shape:,X.shape)print(Target batch shape:,y.shape)从 Dataset 中取出若干个样本由 batch_size 指定把这些样本拼成一个 batch如果 shuffleTrue每个 epoch 会打乱样本顺序返回可以直接用于模型训练的张量。Dataset: index - sampleDataLoader: samples - batch如果每个样本的形状不一样默认拼接就会失败。最常见的例子是自然语言处理中的变长序列需要自定义 collate_fn把这些样本整理成模型可以接收的 batch。例如我们可以把变长序列填充到当前 batch 中的最大长度在实际任务中collate_fn 很常用。比如文本任务中对变长句子做 padding目标检测中每张图的目标框数量不同不能简单 stack多模态任务中把图像、文本、mask、metadata 组织成字典对一个 batch 内的数据做额外整理。num_workers让 DataLoader 启动多个子进程来提前加载数据。num_workers0所有数据加载都发生在主进程里num_workers 0PyTorch 会启动多个 worker 进程它们负责提前从 dataset 里取样本、执行 collate_fn并把准备好的 batch 放到队列里。主进程训练时就可以从队列中取已经准备好的 batch这样数据加载和模型计算可以重叠persistent_workers控制这些子进程要不要跨 epoch 保留下来。总结本文从神经网络的基本原理出发梳理了其学习过程的 5 个核心步骤初始化参数、模型预测、计算偏差、调整参数与重复迭代。神经网络学习的本质是在参数空间中不断寻找一组更优的参数使损失函数持续下降而前向传播、损失函数、反向传播与优化算法四者共同构成了训练的基本流程。随后我们进入 PyTorch 的实践环节重点理解了 Autograd 自动微分机制requires_grad决定张量是否被追踪no_grad()与enable_grad()控制梯度记录的开关inference_mode()则用于纯推理场景。在数据加载方面Dataset负责定义样本的读取方式DataLoader负责将样本组织成 mini-batch并通过collate_fn处理变长序列等复杂情况num_workers与persistent_workers则进一步优化了数据加载的效率。掌握这些基础概念后具备了搭建并训练一个简单神经网络模型的能力。下一步可以尝试用 PyTorch 实现一个完整的分类任务在实践中加深对自动微分与数据流水线的理解。

相关新闻

轻量级校验库ValidX与Maven/Gradle的集成配置与排障实践

轻量级校验库ValidX与Maven/Gradle的集成配置与排障实践

1. 集成思路与方案选型1.1 ValidX是什么,为什么需要单独写集成指南先说清楚一件事:ValidX不是一个大而全的框架,它是一套专注于参数校验的轻量级工具库。很多团队在项目里已经用上了Spring的Validated或者Hibernate Validator,但遇…

2026/9/25 18:04:04 阅读更多 →
深入Linux USB协议栈:URB、枚举与驱动开发实战

深入Linux USB协议栈:URB、枚举与驱动开发实战

写Linux驱动的人,大概都绕不开USB。不管是做嵌入式、搞内核开发,还是日常接个U盘、鼠标、USB转串口调试单片机,背后都有一套成熟但不太容易看懂的机制在干活——这就是Linux内核里的USB协议栈框架。很多人能调通一个USB设备驱动,但…

2026/9/25 18:04:04 阅读更多 →
CLI-Anything 项目架构解析:用 TaoToken 统一 Key 打通 CLI Agent 配置链路

CLI-Anything 项目架构解析:用 TaoToken 统一 Key 打通 CLI Agent 配置链路

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 18:04:04 阅读更多 →

最新新闻

Docker 常见仓库与镜像使用指南(2026 实战版)

Docker 常见仓库与镜像使用指南(2026 实战版)

前阵子带一个新人,让他用 Docker 起个 MySQL,他从某篇博客抄了条命令:docker run --name some-mysql --link some-app:app -d mysql跑不通,来问我。我一看就知道这教程是七八年前的——--link 这个参数 Docker 官方早就标记废弃了…

2026/9/25 18:47:28 阅读更多 →
如何写好 Skills:用 TaoToken 统一 Key 打通 Agent 与 CC 的配置骨架

如何写好 Skills:用 TaoToken 统一 Key 打通 Agent 与 CC 的配置骨架

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 18:47:28 阅读更多 →
从粒子探测器到云数据库:三个“Atlas”背后的核心技术全景

从粒子探测器到云数据库:三个“Atlas”背后的核心技术全景

如果你最近经常刷到“atlas”这个词,你的第一反应可能和我一样:到底是哪家的产品?是那个会后空翻的机器人,还是某个大型云数据库,或者是粒子物理实验里的巨型探测器?答案是:都有可能。这也是“a…

2026/9/25 18:47:28 阅读更多 →
Hugging Face模型发布全指南:从本地训练到全球复用

Hugging Face模型发布全指南:从本地训练到全球复用

1. 这不是“上传”而是“发布一套可复现的模型资产” 你手头有个在本地跑通的 PyTorch 模型,可能是微调后的 BERT 分类器、自己搭的 ViT 图像分类器,或是用 LLaMA-Factory 训练出的小语言模型。现在你想让它被别人发现、下载、复用——不是发个 GitHub …

2026/9/25 18:46:28 阅读更多 →
沟通驱动型CRM:把客户沟通转化为可复用的客户资产

沟通驱动型CRM:把客户沟通转化为可复用的客户资产

做CRM这些年,我最大的感受是:大多数团队不是缺客户,而是缺"对客户关系的完整记忆"。销售手里攒了一堆微信聊天截图,客服在工单系统里反复问客户同一个问题,售后邮件散落在个人邮箱里,老板想看一眼…

2026/9/25 18:46:28 阅读更多 →
Go Workflow 引擎:从 Tempor 与 Cadence 到流程编排

Go Workflow 引擎:从 Tempor 与 Cadence 到流程编排

Go Workflow 引擎:从 Tempor 与 Cadence 到流程编排工作流引擎是后端组件的"粘合层"。Tempor / Cadence 是 Go 编写的开源流程编排引擎。本文讲清原理与集成。一、Temporal 是什么? Temporal 微服务编排 时间调度 容错。Google Uber 支持。…

2026/9/25 18:46:28 阅读更多 →

日新闻

AI元人文:从工具使用到思维重构的深度探索

AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决…

2026/9/25 0:00:41 阅读更多 →
Python+CNN车牌识别实战:从数据预处理到模型训练与部署

Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据…

2026/9/25 0:00:41 阅读更多 →
Vim基础操作全攻略:保存退出、模式切换与高频命令实战

Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保…

2026/9/25 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/25 11:15:26 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →