day-034-NumPy统计与线性代数
Day 34NumPy 统计与线性代数今天用 NumPy 做统计分析和线性代数运算——相关性、矩阵乘法、解方程组。这是从数据处理迈向机器学习的关键一步。一、统计分析函数importnumpyasnp datanp.array([82,91,78,85,92,76,88,95,84,79])# 基本统计print(f均值:{np.mean(data):.2f})print(f中位数:{np.median(data):.2f})print(f总和:{np.sum(data)})# 离散程度print(f标准差:{np.std(data):.2f})# 标准差偏离均值多少print(f方差:{np.var(data):.2f})# 方差 标准差的平方# 百分位数print(f25分位:{np.percentile(data,25)})# 25% 的数据低于此值print(f50分位:{np.percentile(data,50)})# 中位数print(f75分位:{np.percentile(data,75)})# 极值print(f最大值:{np.max(data)})print(f最小值:{np.min(data)})print(f最大值的索引:{np.argmax(data)})# 第 7 个0-basedprint(f最小值的索引:{np.argmin(data)})样本方差 vs 总体方差np.var(data)→ 总体方差除以 nnp.var(data, ddof1)→ 样本方差除以 n-1统计上更常用二、相关系数——两个变量之间的关系# 学习时间 vs 考试成绩study_hoursnp.array([1,2,3,4,5,6,7,8,9,10])exam_scoresnp.array([52,58,63,65,72,74,78,82,88,91])# 皮尔逊相关系数corr_matrixnp.corrcoef(study_hours,exam_scores)print(corr_matrix)# [[1. 0.993... ]# [0.993... 1. ]]# 非对角线元素即两个变量的相关系数correlationcorr_matrix[0,1]print(f学习时间与成绩的相关系数{correlation:.4f})# 0.993... 表示强正相关学的时间越长成绩越高相关系数解读1完全正相关X 增加Y 增加0不相关-1完全负相关X 增加Y 减少一般认为|r| 0.7就是强相关三、矩阵运算基础# 矩阵乘法Anp.array([[1,2],[3,4]])Bnp.array([[5,6],[7,8]])# numpy.dot() 或 运算符Cnp.dot(A,B)# 传统写法CA B# Python 3.5 推荐写法print(C)# [[19 22]# [37 44]]# 结果[1*52*7, 1*62*8] → [19, 22]# [3*54*7, 3*64*8] → [37, 44]# 转置print(A.T)# [[1 3]# [2 4]]# 逆矩阵A_invnp.linalg.inv(A)print(A_inv)# [[-2. 1. ]# [ 1.5 -0.5]]print(A A_inv)# 接近单位矩阵四、解线性方程组假设方程组3x y 9 x 2y 8用 NumPy 一行求解# 系数矩阵Anp.array([[3,1],[1,2]])# 常数向量bnp.array([9,8])# 求解 Ax bxnp.linalg.solve(A,b)print(fx {x[0]}, y {x[1]})# x 2.0, y 3.0# 验证print(A x)# [9. 8.] 等于 b五、特征值与特征向量特征值和特征向量是机器学习中 PCA主成分分析的数学基础Anp.array([[4,-2],[1,1]])eigenvalues,eigenvectorsnp.linalg.eig(A)print(特征值,eigenvalues)# [3. 2.]print(特征向量)print(eigenvectors)# [[ 0.8944 0.7071]# [-0.4472 0.7071]]# 每列是一个特征向量# 验证A v λ vveigenvectors[:,0]# 第一个特征向量lameigenvalues[0]# 第一个特征值print(A v)# 应该等于 lam * vprint(lam*v)六、实战——用 NumPy 实现简单线性回归线性回归的解析解w (X^T X)^(-1) X^T yimportnumpyasnp# 模拟数据房价 2 * 面积 3 * 房间数 噪声np.random.seed(42)n_samples100areanp.random.uniform(50,200,n_samples)roomsnp.random.randint(1,6,n_samples)noisenp.random.normal(0,10,n_samples)price2*area3*rooms*50noise# 构建设计矩阵 X加一列 1 表示截距项Xnp.column_stack([np.ones(n_samples),area,rooms*50])yprice# 解析解wnp.linalg.inv(X.T X) X.T yprint(f截距{w[0]:.2f})print(f面积系数{w[1]:.2f})print(f房间系数{w[2]:.2f})# 面积系数约 2房间系数约 3接近真实值七、今日学习总结学习内容掌握情况一句话要点统计函数✅ 重点mean/median/std/percentile相关系数✅ 重点np.corrcoef分析变量关联矩阵乘法✅ 重点A B或np.dot(A, B)逆矩阵✅ 理解np.linalg.inv(A)解方程组✅ 了解np.linalg.solve(A, b)特征值分解✅ 了解PCA 的数学基础线性回归✅ 实战用线性代数做预测今日踩坑记录矩阵乘法维度要对齐(m, n) (n, p)→(m, p)。(2, 3) (2, 3)直接报错需要第二个矩阵转置。np.linalg.inv对奇异矩阵报错不是所有矩阵都能求逆。用np.linalg.pinv可以求伪逆。np.std(ddof0)vsnp.std(ddof1)默认ddof0是总体标准差。抽样数据应该用ddof1贝塞尔校正。八、明天学什么NumPy 最后一篇——随机数生成与数据科学综合实战。然后正式进入 Pandas 的世界。统计告诉你是什么线性代数告诉你怎么算。两者合在一起就是机器学习的数学基石。第34天打卡完成。明天见本系列是个人学习笔记如有错误欢迎在评论区指正交流。

相关新闻

0719一个月总结

0719一个月总结

2026.07.19 来深圳一个月了 实习转正式也一个月了 “在职时长30天” 今天提交了这个月的加班时长 刚刚好50h ——— 下周组里的实习生要返校 想起去年这个时候 也结束了我第一段互联网的实习 现想起这段实习“不简单” 有争取,幸运面上&放实习 非常幸运&#xf…

2026/7/24 4:36:39 阅读更多 →
gpt-tokenizer与OpenAI tiktoken对比:为什么选择这个JavaScript实现

gpt-tokenizer与OpenAI tiktoken对比:为什么选择这个JavaScript实现

gpt-tokenizer与OpenAI tiktoken对比:为什么选择这个JavaScript实现 【免费下载链接】gpt-tokenizer The fastest JavaScript BPE Tokenizer Encoder Decoder for OpenAIs GPT models (gpt-5, gpt-o*, gpt-4o, etc.). Port of OpenAIs tiktoken with additional fea…

2026/7/22 7:09:53 阅读更多 →
3分钟掌握OpenDataTools:用Python快速获取基金数据的完整指南

3分钟掌握OpenDataTools:用Python快速获取基金数据的完整指南

3分钟掌握OpenDataTools:用Python快速获取基金数据的完整指南 【免费下载链接】OpenData 开源的金融投资数据提取工具,专注在各类网站上爬取数据,并通过简单易用的API方式使用 项目地址: https://gitcode.com/gh_mirrors/op/OpenData …

2026/7/22 8:01:03 阅读更多 →

最新新闻

AI驱动的敏捷团队管理实践与优化

AI驱动的敏捷团队管理实践与优化

1. 项目背景与核心价值 去年带队做一个跨时区的敏捷项目时,我深刻体会到了传统管理方式的力不从心。当晨会变成"异步留言板",任务看板沦为"僵尸卡片坟场",我开始系统性地尝试将AI技术融入团队管理流程。经过三个迭代周期…

2026/7/24 13:46:46 阅读更多 →
AI如何变革学术专著写作:技术架构与应用实践

AI如何变革学术专著写作:技术架构与应用实践

1. 项目背景与行业痛点学术专著创作长期以来存在几个核心痛点:首先是写作周期漫长,从选题到成书往往需要3-5年时间;其次是文献处理效率低下,研究者需要人工筛选数百篇文献;第三是跨学科协作困难,不同领域专…

2026/7/24 13:46:46 阅读更多 →
TensorRT加速YOLOv7-tiny在边缘计算的工业质检实践

TensorRT加速YOLOv7-tiny在边缘计算的工业质检实践

1. 项目背景与核心价值在工业质检、智慧城市、自动驾驶等实时视觉场景中,算法部署的效率和成本直接决定商业落地的可行性。我们团队最近为某大型制造企业实施的缺陷检测系统,需要在200ms内完成产线上万件产品的实时检测,这对模型推理速度提出…

2026/7/24 13:46:46 阅读更多 →
2026影音分离工具全教程:免费无损无水印,电脑手机在线全覆盖

2026影音分离工具全教程:免费无损无水印,电脑手机在线全覆盖

日常剪辑、素材整理、音频提取场景中,影音分离是高频刚需操作,核心需求无非是免费无损、无水印、操作简单、设备适配广。2026年市面上的影音分离工具种类繁杂,有电脑客户端、手机APP、微信小程序以及在线网页工具,不同工具的无损效…

2026/7/24 13:46:46 阅读更多 →
视频怎么转文字?多工具分步实操完整指南

视频怎么转文字?多工具分步实操完整指南

2026 年,网课整理笔记、自媒体提取口播文案、工作复盘会议录像,经常需要把视频里的人声转换成可编辑文字。手动反复回放抄写效率很低,借助语音识别工具,就能快速完成视频转文字。市面上工具形态很多,包含微信小程序、剪…

2026/7/24 13:46:46 阅读更多 →
揭秘Windows的$WinREAgent文件夹:作用与安全删除指南

揭秘Windows的$WinREAgent文件夹:作用与安全删除指南

1. 认识神秘的$WinREAgent文件夹第一次在C盘根目录发现这个名为"$WinREAgent"的文件夹时,我的反应和大多数用户一样困惑。这个文件夹通常占用200MB到1GB不等的空间,但Windows系统本身并没有给出任何官方说明。作为一名长期与Windows系统打交道…

2026/7/24 13:45:46 阅读更多 →

日新闻

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…

2026/7/24 0:00:29 阅读更多 →
AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口 AppCertDlls 位于 HKLM\System\CurrentControlSet\Control\Session Manager\AppCertDlls。本文的程序功能是只读列出这个键在 64 位和 32 位注册表视图中的全部值,并显示每条值的来源、名称、类型和可安全显示的数…

2026/7/24 0:00:29 阅读更多 →
我的编程之路:第一篇博客

我的编程之路:第一篇博客

大家好,我是一名编程初学者,同时这也是我编程学习之路上的第一篇博客。在这里,我想要向大家介绍我的一些想法和规划。a.自我介绍我是一个刚刚接触编程的新手,目前在学习c语言,我对编程世界充满了强烈的好奇。当然&…

2026/7/24 0:00:29 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 3:59:20 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻