准大二学生从0开始学AI——机器学习Day16
---type: learning_notetitle: 树集成连续特征、随机森林与XGBoostdate: 2026-08-08course: Andrew Ng — Course 2 高级学习算法phase: C2 Day 10C2 收官videos: #94-#100---# 2026-08-08 学习笔记## 笔记区学的时候随手记### 核心观点- **连续值特征**#94连续特征有无限多个取值不能直接按类别分支要设一个**阈值**把数据切成≤阈值和阈值两边。候选阈值怎么找把所有训练样本按该特征排序取每两个相邻样本之间的**中点**当候选n 个样本 → n-1 个候选阈值每个候选都算一遍信息增益选增益最大的当分裂点。- **回归树**#95决策树也能做回归预测连续数值如猫的体重磅数。叶子节点存的是**该叶子内所有训练样本标签的平均值**预测时新样本走到哪个叶子就输出那个平均值。- **回归树分裂用方差不用熵**熵是用类别比例 p算的H-p·log p-(1-p)·log(1-p)分类树能算猫占 0.7但回归树的叶子装的是连续数值8、9、138 磅占多少比例没法问p 不存在熵公式没得算。所以改用**方差**衡量叶子数值的离散程度训练时选切完后左右子集加权方差之和最小的分裂——方差大的分裂是坏的。- **多个决策树**#96一棵深树对训练数据太敏感换点样本结构就大变、易过拟合。多棵树各自训练、一起投票各自的偏差互相抵消整体更稳更准。本质是减少单棵树的过拟合/高方差。- **有放回抽样**#97训练每棵树时用 sampling with replacement 抽子集**同一个样本可能被抽到多次**让每棵树的训练集各不相同。- **随机森林**#98不仅数据随机抽**每个分裂节点也只随机挑一部分特征**来选最优。因为如果每棵树每个节点都用全部特征树会长得差不多投票退化成一棵树投 N 次。只挑一部分特征是为了逼树之间产生差异**多样性是投票有效的根本**。- **XGBoost**#99与随机森林本质区别——随机森林的树**并行**训练、互不学习、最后投票XGBoost 的树**串行**训练第 B 棵树专门去纠正前面 B-1 棵树没学好的样本在后一棵的基础上提升。- **什么时候用决策树**#100完整对比见下方决策树 vs 神经网络表。一句话**表格数据结构化→ 树模型**快、可解释**图像/音频/文本非结构化→ 神经网络**。神经网络在所有类型数据上都能用含表格可能更慢但支持迁移学习且多模型串起来构建系统时更易组装。### 关键方法/流程**连续特征找阈值#94**1. 样本按特征值排序2. 相邻两个值之间取中点当候选阈值n 个样本 → n-1 个候选3. 每个候选阈值切一遍算信息增益4. 选信息增益最大的阈值当分裂点例体重 60、65、70、75、80 → 候选阈值 62.5、67.5、72.5、77.5不是 7070 是样本值不是中点。**分类树 vs 回归树的分裂标准**| | 分类树 | 回归树 || -------- | ------------------------ | -------------------------------- || 叶子输出 | 类别 | 叶子样本标签平均值 || 分裂度量 | 熵 / 信息增益选大的 | 方差选小的 || 为什么 | 熵依赖类别比例 p有类别 | 回归树没类别用方差衡量数值离散 |**决策树 vs 神经网络#100 课堂原文翻译**| 决策树与树集成Decision Trees Tree ensembles | 神经网络Neural Networks || ------------------------------------------------- | ------------------------------------------------------ || 在表格结构化数据上表现好 | 在所有类型数据上都表现好包括表格结构化与非结构化 || 不推荐用于非结构化数据图像、音频、文本 | 支持迁移学习transfer learning || 速度快 | 可能比决策树慢 || 小决策树可能可被人类理解human interpretable | 构建多模型协作系统时把多个神经网络串起来可能更容易 |### 实战记录- 出题验证 7 题全部通过#94-#100 每视频一题- #94 连续特征决策树分裂本质是值 阈值的数值比较连续值天生能直接比不需要先离散化分桶是拍脑袋定桶、丢信息试阈值是让数据用信息增益自己选最优切分点- #94 中点计算相邻对的中点才是候选62.5/67.5/72.5/77.5- #95 回归树①叶子精确存平均值 ②预测不看方差分裂才看方差且方向是选方差小的- #95 熵 vs 方差熵恰恰是判断分裂好坏的标尺真正原因是熵依赖类别比例 p回归树没有类别p 不存在- #95 应用判断甲数值 8、9、13用方差乙5猫1狗用熵熵是针对有类别的好使回归树可以直接看数值- #96 多棵树类比做实验有偶然性有人在旁边看着投票可以消除偶然性像多个 AI 交叉验证、agent 审查理解完全到位- #97 有放回抽样用高中概率统计类比4 个圆片抽 4 次有放回可能红红黄绿不放回必然是红黄蓝绿全排列- #98 随机森林提取全部特征的树长得差不多- #99 XGBoost根据前面的内容纠正之后的特征筛选- #100 选型决策树适合表格、快、人方便用神经网络什么数据都能搞但慢神经网络主场是非结构化数据图像/音频/文本---## 线索区学完后合上材料自问自答**Q: 连续特征的候选阈值怎么找中点是 70 吗**A: 排序 → 相邻样本取中点当候选。体重 60、65、70、75、80 的候选是 62.5、67.5、72.5、77.5不是 70——70 是样本值中点取的是相邻两个值的中间数。n 个样本 → n-1 个候选每个算信息增益选最大的。**Q: 连续特征为什么要试阈值直接分桶不行吗**A: 决策树分裂是值 阈值的数值比较连续值天生能直接比。分桶是拍脑袋定桶、丢信息试所有阈值是让数据用信息增益自己选出最优切分点跟昨天选耳朵形状是同一个标准。**Q: 回归树叶子存的是什么**A: 叶子内训练样本标签的平均值。叶子装 8、9、13 → 存 10。预测走到哪个叶子就输出哪个叶子的平均值。**Q: 回归树为什么不能用熵**A: 熵衡量纯度熵是判断分裂好坏的标尺。熵用类别比例 p算回归树叶子装连续数值8 磅占多少比例没法问p 不存在所以改用方差衡量数值离散程度选分裂让方差变小。**Q: 多个决策树投票为什么比单棵深树稳**A: 单棵树对数据敏感、易过拟合多棵树各自偏差互相抵消。**Q: 有放回抽样是什么意思**A: 有放回抽样同一个样本可能被抽到多次红红黄绿里红出现两次不放回每个元素最多一次。被抽到多次正是随机森林想要的——树的训练集各不相同才有差异。**Q: 随机森林为什么要随机挑特征**A: 核心是多样性——每棵树都用全部特征会选到同一个最优特征树与树差异只剩抽样随机性投票退化成一棵树投 N 次。只挑一部分特征是逼树产生差异。快是附带好处不是主要动机。**Q: 随机森林和 XGBoost 的本质区别**A: 随机森林并行——树独立训练、互不学习、最后投票XGBoost 串行——第 B 棵树专门纠正前 B-1 棵没学好的样本逐棵提升。**Q: 什么时候用树模型什么时候用神经网络**A: 表格数据结构化→ 树模型快、可解释、人能看懂规则图像/音频/文本非结构化→ 神经网络树模型做不了。神经网络通用且慢但真正主场是非结构化数据。---## 总结50字以内用自己的话概括今天学到了什么连续特征排序取中点选阈值回归树叶子存平均值、分裂看方差随机森林并行投票、XGBoost串行纠错表格用树、图像音频文本用神经网络。C2 收官。---## 复习卡片| 概念 | 一句话 | 我的场景 || ---------------- | ------------------------------------------------- | ---------------------------- || 连续特征阈值 | 排序 → 相邻取中点 → 每个算增益 → 选最大 | 中点是70吗→62.5/67.5... || 回归树 | 叶子存训练样本标签平均值预测直接输出 | 存的是具体的数值吧 || 回归树分裂标准 | 用方差不用熵选方差小的分裂 | 熵是针对有类别的好使 || 熵依赖类别比例 p | 没类别 p 就不存在回归树没法算熵 | 8磅占多少比例 || 多棵树投票 | 单棵树易过拟合多棵抵消偏差 | 有人在旁边看着投票 || 有放回抽样 | 同一样本可能被抽到多次 | 红红黄绿不放回是全排列 || 随机森林 | 并行投票随机挑特征逼树差异 | 树长得都差不多 || XGBoost | 串行逐棵纠正前面没学好的 | 这才是XGBoost我说错了 || 选型 | 表格→树图像音频文本→神经网络NN全能用迁移学习 | 决策树适合表格神经网络慢 |

相关新闻

如何实现小红书自动回复与客服自动化?异常自愈+全链路日志,7x24稳定运行不靠运气

如何实现小红书自动回复与客服自动化?异常自愈+全链路日志,7x24稳定运行不靠运气

如何实现小红书自动回复与客服自动化?异常自愈全链路日志,7x24稳定运行不靠运气 干电商的都明白一个道理:小红书的自动回复与客服,是店群运营中最耗人力也最容易出错的环节。 店群客服是纯人力消耗战。一个店日均50条咨询&#…

2026/9/19 1:07:25 阅读更多 →
四、国会立法程序

四、国会立法程序

一、国会职权按照美国宪法规定, 美国属于那种是采取立法之类 司法以及行政呈现出“三权分立”这种格局状态的联邦制国家, 其中国会去行使立法方面的权力, 将以总统为首之下的政府用来行使行政那块的权力, 而法院则来行使司法的权力, 国会它是联邦最高立法机构, 它是由参议院还有…

2026/9/22 19:08:43 阅读更多 →
如何实现小红书自动回复与客服自动化?夜间全自动客服,3分钟内回复率100%

如何实现小红书自动回复与客服自动化?夜间全自动客服,3分钟内回复率100%

如何实现小红书自动回复与客服自动化?夜间全自动客服,3分钟内回复率100% 店群运营的本质不是开多少店,而是单店运营成本能不能压到零。小红书的自动回复与客服,是店群运营中最耗人力也最容易出错的环节。 店群客服是纯人力消耗战…

2026/9/23 7:57:18 阅读更多 →

最新新闻

ESP32-C5-WROOM-1U双频Wi-Fi 6模组开发实战与选型指南

ESP32-C5-WROOM-1U双频Wi-Fi 6模组开发实战与选型指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 1:14:23 阅读更多 →
KITTI激光雷达点云投影到图像的ROS工程实践

KITTI激光雷达点云投影到图像的ROS工程实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 1:14:23 阅读更多 →
生物学重复与技术重复:实验设计与统计分析中的关键区别

生物学重复与技术重复:实验设计与统计分析中的关键区别

1. 为什么这两个词总让人在组会上被问住如果你做过一段时间的湿实验,大概率经历过这样的场景:组会上你汇报完一组数据,导师或者PI突然问一句——“你这个n是多少?是生物学重复还是技术重复?”你心里咯噔一下&#xff0…

2026/9/25 1:14:23 阅读更多 →
LLC谐振变换器多模态调试实战:ZVS/ZCS波形判据与工程落地

LLC谐振变换器多模态调试实战:ZVS/ZCS波形判据与工程落地

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 1:14:23 阅读更多 →
TensorFlow导入dtensor报错详解:ImportError排查与修复

TensorFlow导入dtensor报错详解:ImportError排查与修复

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 1:14:23 阅读更多 →
Multisim仿真二阶有源带通滤波器:1kHz中心频率Q≈5设计全流程

Multisim仿真二阶有源带通滤波器:1kHz中心频率Q≈5设计全流程

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 1:13:22 阅读更多 →

日新闻

AI元人文:从工具使用到思维重构的深度探索

AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决…

2026/9/25 0:00:41 阅读更多 →
Python+CNN车牌识别实战:从数据预处理到模型训练与部署

Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据…

2026/9/25 0:00:41 阅读更多 →
Vim基础操作全攻略:保存退出、模式切换与高频命令实战

Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保…

2026/9/25 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →