个人笔记:实用机器学习(b站李沐)2.3
2.3数据变换变形原始数据往往不符合模型输入要求数据转换是连接清洗后的数据和可训练的特征之间的桥梁针对不同数据类型有特定方法。*对数据整体进行操作变形特征值归一化处理1梯度下降更高效不同特征量级一致避免某些特征因数值大主导损失函数2避免数值溢出或下溢防止计算中出现极大或极小数3正则化效果某些归一化方法如 Batch Norm本身具有正则化作用4加速收敛优化器能在更圆的损失曲面上更快找到最优解四种常见归一化方法1将数据线性映射到指定区间 [a,b] 通常是 [0,1] 或 [−1,1] 2将数据转换为均值为 0标准差为 1 的分布最常见3小数缩放4对数缩放图像的变换*图像的存储开销很大核心是在大规模机器学习项目中如何降低图像存储和训练成本同时尽量保持模型性能。三种方法1裁剪Cropping去除无关区域如水印、黑边、无关背景聚焦 ROIRegion of Interest减少像素数量来降低存储和计算2下采样Downsampling降低图像分辨率3压缩Compression使用有损压缩格式如 JPEG进一步减小文件体积*中等质量80%-90%JPEG压缩可能导致 ImageNet准确率下降约 1%这意味着压缩率越高-文件越小、加载越快、存储越省但信息损失越大-模型性能可能下降需要根据需求自行权衡视频的变换核心挑战在于视频数据的高度可变性以及如何在预处理阶段做好存储、质量、加载速度的权衡。对于ML短视频片段更易处理理想情况每个片段是一个连贯的语义事件*但是长视频语义分割极难视频变换的核心是化长为短、化编码为帧在保持语义完整性的前提下把高可变性的原始视频转化为固定长度、易于加载、模型友好的输入格式同时接受存储空间的代价。*需要权衡存储质量和加载速度文本的变换核心是将原始文本转化为机器学习模型能处理的结构化形式包括两大步骤1词形还原与词干提取目标将词语的不同形态归约为统一的基干形式词干提取基于规则的截断准确率低速度快E2词干还原基于词典的词性标注准确率高速度慢E12分词Tokenization目标将文本字符串切分为模型能处理的最小单元tokensgp 是词根##u 表示它是前一个 token 的延续因为词典没”gpu”这个词需要分割能处理没在词典中的词

相关新闻

MGF矩生成函数实战指南:从分布编码到工业级建模

MGF矩生成函数实战指南:从分布编码到工业级建模

1. 这不是数学考试,而是你手头真实问题的“信号解码器”你有没有遇到过这样的场景:在做A/B测试时,发现两组用户留存率的分布形态很怪——不是对称的钟形,而是明显右偏,尾部拖得很长;或者在建模用户生命周期…

2026/7/23 9:10:25 阅读更多 →
Android模拟定位技术解析与应用实践

Android模拟定位技术解析与应用实践

1. Android模拟定位的技术背景与需求场景在移动互联网时代,GPS定位功能已成为智能手机的核心能力之一。从导航软件到社交应用,再到各类基于位置的服务(LBS),位置数据的准确性直接影响着用户体验。然而在某些特定场景下…

2026/7/23 9:50:12 阅读更多 →
【理财类-01-07】20260717 股票根据“股价*佣金费率大于等于5元”,推算最适合购买或卖出股数。(Python)

【理财类-01-07】20260717 股票根据“股价*佣金费率大于等于5元”,推算最适合购买或卖出股数。(Python)

背景需求 【理财类-01-06】20260716 股票“差价”收益计算和excel统计(Python)https://mp.csdn.net/mp_blog/creation/editor/162911231 我发现有些股数少,会导致佣金总额小于5元,但是实际支付是5元,就会损失佣金 所…

2026/7/23 8:28:06 阅读更多 →

最新新闻

基于RWEQ模型的2000-2025年中国逐年250米分辨率防风固沙量数据集

基于RWEQ模型的2000-2025年中国逐年250米分辨率防风固沙量数据集

摘要本数据集基于修正风蚀方程模型(RWEQ)生成,空间分辨率为250米,时间跨度为2000年至2025年,逐年提供了中国区域的防风固沙量空间分布信息。数据生产主要利用了同期遥感影像、气象、土壤、地形及土地利用等数据作为模型…

2026/7/23 14:38:02 阅读更多 →
Claude Code v2.1.199版本更新解析与性能优化

Claude Code v2.1.199版本更新解析与性能优化

1. Claude Code v2.1.199 版本更新深度解析 作为一名长期跟踪AI开发工具的技术博主,我第一时间对Claude Code的最新v2.1.199版本进行了全面测试。这次更新主要针对三个核心痛点进行了优化,这些改进看似细微,却实实在在地提升了开发体验。 1…

2026/7/23 14:38:02 阅读更多 →
AI量表生成技术:革新问卷设计效率与质量

AI量表生成技术:革新问卷设计效率与质量

1. 项目背景与核心价值去年帮心理学系做抑郁量表调研时,我深刻体会到传统问卷设计的痛苦——从文献综述到题目编制花了整整3天,结果信效度检验还不达标。最近接触到虎贲等考AI的学术量表生成功能,实测用20分钟就能产出符合心理测量学标准的问…

2026/7/23 14:38:02 阅读更多 →
UE5行为树实战指南:从巡逻AI到战斗系统开发

UE5行为树实战指南:从巡逻AI到战斗系统开发

1. 项目概述:为什么是UE5行为树? 如果你正在用虚幻引擎5(UE5)做游戏,尤其是涉及到任何形式的NPC、敌人或者伙伴,那么“行为树”这个词你肯定绕不过去。它不像蓝图那样直观地连接节点,也不像C那样…

2026/7/23 14:38:02 阅读更多 →
Composer 相关。

Composer 相关。

安装 curl -sS https://getcomposer.org/installer | php mv composer.phar /usr/bin/composer#composer退回到指定版本命令 sudo composer self-update 2.9.5 Composer1 早就停止维护,2025 年更是彻底无法使用,Composer2 向下兼容老旧包&#xff0c…

2026/7/23 14:38:02 阅读更多 →
生鲜视觉落地难题怎么破 | 果蔬图像数据集助力YOLO目标检测研发

生鲜视觉落地难题怎么破 | 果蔬图像数据集助力YOLO目标检测研发

生鲜视觉落地难题怎么破 | 果蔬图像数据集助力YOLO目标检测研发 | 果蔬数据集 | 目标检测 |YOLO格式 #深度学习 #目标检测 #YOLO数据集 #智慧农业 #果蔬识别 #计算机视觉清晨6点,华东某生鲜配送中心的分拣车间已经开工。分拣员依靠肉眼区分数十种果蔬品类&#xf…

2026/7/23 14:37:00 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻