SciPy `kstwo` 分布详解:双样本 Kolmogorov-Smirnov 统计量的精确概率分布
SciPykstwo分布详解双样本 Kolmogorov-Smirnov 统计量的精确概率分布【免费下载链接】scipySciPy library main repository项目地址: https://gitcode.com/gh_mirrors/sc/scipy导读本文围绕 SciPy 官方教程文档 continuous_kstwo.rst 展开深入讲解scipy.stats.kstwo——双样本/双侧 Kolmogorov-SmirnovK-S检验统计量D_n的精确概率分布。你将掌握kstwo的数学定义、形状参数与支持域、cdf/sf/ppf/isf等 API 用法并通过完整的数值示例学会从一组样本手工构造经验 CDF、计算D_n⁺/D_n⁻/D_n并求尾概率最后结合仓库源码了解其背后 Simard LEcuyer 的混合数值算法以及ksone、kstwobign两个姊妹分布的适用场景。kstwo是什么双侧 K-S 统计量的分布kstwo描述的是经验分布函数ECDF与某个连续目标累积分布函数CDF之间最大绝对偏差的分布。设从样本观测值构造的经验分布函数为F_empirical,n(t)目标分布为连续 CDFF_target(t)定义D_n sup_t |F_empirical,n(t) - F_target(t)|那么kstwo就是D_n统计量在零假设样本确实来自目标分布下的分布。名字中的 “two” 指这是**双侧two-sided**偏差ksone描述单侧统计量D_n⁺的分布正向偏差即经验 CDF 高于目标 CDF 的最大值对应 ksone_gen 类kstwobign描述归一化最大偏差√n·D_n的极限分布n→∞ 时的渐近分布对应 kstwobign_gen 类。两种典型应用场景场景一样本 vs 连续目标分布。用n个观测值构造经验 CDF与某个连续 CDF 比较kstwo给出D_n的分布。场景二两组样本的经验 CDF 互比双样本。设两组观测分别有m和n个样本经验分布函数为F_1,m与F_2,n定义D_m,n sup_t |F_1,m(t) - F_2,n(t)|在适当条件下有近似关系Pr(D_m,n ≤ x) ≈ Pr(D_N ≤ x)其中N sqrt(m·n / (m n))即把双样本问题折算成等效单样本规模N这正是kstest/ks_2samp内部使用kstwo的依据见下文与 kstest 的关系。形状参数与支持域kstwo只有一个形状参数n一个正整数样本量。在 kstwo_gen._argcheck 中通过(n 1) (n np.round(n))强制要求n ≥ 1且为整数。支持域为x ∈ [0, 1]。更精确地kstwo_gen._get_support 给出的下界是0.5/n、上界是1.0——因为对于有限样本nD_n的最小可能取值为1/(2n)Ruben-Gambino 结果这也与底层算法在t n·x ≤ 0.5时概率为 0 的分支处理一致见 scipy/stats/_ksstats.py。快速上手sf尾概率示例文档给出了最简洁的用法——直接计算偏差至少为某值的概率即生存函数 SFimport numpy as np from scipy.stats import kstwo # 样本量 n5 时D_n 至少为 0、0.5、1.0 的概率 kstwo.sf([0, 0.5, 1.0], 5)输出array([1. , 0.112, 0. ])含义解读sf(0, 5) 1.0偏差至少为 0 的概率是 1任何样本都会与目标 CDF 有非零偏差sf(0.5, 5) 0.112偏差达到一半以上D_n ≥ 0.5的概率约为 11.2%sf(1.0, 5) 0.0偏差达到 1 的概率为 0最大绝对偏差不会超过 1。注意sf(1.0, 5) 0与支持域上界x1呼应尽管D_n理论上限是 1但对有限样本它几乎不可能达到因而尾概率被精确截断为 0底层_kolmogn在x ≥ 1.0时直接返回确定概率见 scipy/stats/_ksstats.py。完整实战手工计算 K-S 统计量并求尾概率文档提供了一个端到端示例从N(0.5, 1)分布抽取n5个样本与目标分布N(0, 1)的 CDF 比较。步骤 1生成并排序样本from scipy.stats import norm n 5 gendist norm(0.5, 1) # 生成分布均值 0.5标准差 1 x np.sort(gendist.rvs(sizen, random_statenp.random.default_rng())) x输出随机每次运行不同array([-1.59113056, -0.66335147, 0.54791569, 0.78009321, 1.27641365])步骤 2计算目标 CDF 值target norm(0, 1) cdfs target.cdf(x) cdfs输出array([0.0557901 , 0.25355274, 0.7081251 , 0.78233199, 0.89909533])cdfs[i]是目标分布 N(0,1) 在观测点x[i]处的累积概率。步骤 3构造经验 CDF 并逐列计算各类偏差# 经验 CDF第 k 个观测点处值为 k/n ecdfs np.arange(n1, dtypefloat)/n # 每列含义x, ECDF(右端点), 目标CDF, CDF-ECDF(左端点)Dn-, ECDF(右端点)-CDFDn cols np.column_stack([x, ecdfs[1:], cdfs, cdfs - ecdfs[:n], ecdfs[1:] - cdfs]) np.set_printoptions(precision3) cols输出array([[-1.591, 0.2 , 0.056, 0.056, 0.144], [-0.663, 0.4 , 0.254, 0.054, 0.146], [ 0.548, 0.6 , 0.708, 0.308, -0.108], [ 0.78 , 0.8 , 0.782, 0.182, 0.018], [ 1.276, 1. , 0.899, 0.099, 0.101]])表格解读倒数第二列是cdfs - ecdfs[:n]即F(x) - F_n(x⁻)取最大值得D_n⁻最后一列是ecdfs[1:] - cdfs即F_n(x) - F(x)取最大值得D_n⁺。步骤 4提取D_n⁻、D_n⁺与D_ngaps cols[:, -2:] Dnpm np.max(gaps, axis0) Dn np.max(Dnpm) iminus, iplus np.argmax(gaps, axis0) print(Dn- %f (at x%.2f) % (Dnpm[0], x[iminus])) print(Dn %f (at x%.2f) % (Dnpm[1], x[iplus])) print(Dn %f % (Dn))输出Dn- 0.246201 (at x-0.14) Dn 0.224726 (at x0.19) Dn 0.246201本例中负向偏差更大因此双侧统计量D_n D_n⁻ 0.246201。步骤 5用kstwo.sf求尾概率probs kstwo.sf(Dn, n) print(chr(10).join([For a sample of size %d drawn from a N(0, 1) distribution: % n, Kolmogorov-Smirnov 2-sided n%d: Prob(Dn %f) %.4f % (n, Dn, probs)]))输出For a sample of size 5 drawn from a N(0, 1) distribution: Kolmogorov-Smirnov 2-sided n5: Prob(Dn 0.246201) 0.8562尾概率 0.8562 意味着在零假设样本来自 N(0,1)下出现比当前D_n更大偏差的概率高达 85.6%——没有证据拒绝样本来自 N(0,1)的原假设。这正解释了为什么样本均值偏移 0.5 在n5的小样本下仍难以被检出kstwo的分布在小n时非常宽容。步骤 6可视化 ECDF 与目标 CDFimport matplotlib.pyplot as plt plt.step(np.concatenate([[-3], x]), ecdfs, wherepost, labelEmpirical CDF) x3 np.linspace(-3, 3, 100) plt.plot(x3, target.cdf(x3), labelCDF for N(0, 1)) plt.ylim([0, 1]); plt.grid(True); plt.legend() # 标注 Dn- 与 Dn 所在位置的垂直差距 plt.vlines([x[iminus]], ecdfs[iminus], cdfs[iminus], colorr, linestylesolid, lw4) plt.vlines([x[iplus]], cdfs[iplus], ecdfs[iplus1], colorm, linestylesolid, lw4) plt.annotate(Dn-, xy(x[iminus], (ecdfs[iminus] cdfs[iminus])/2), xytext(x[iminus]1, (ecdfs[iminus] cdfs[iminus])/2 - 0.02), arrowpropsdict(facecolorwhite, edgecolorr, shrink0.05), size15, colorr) plt.annotate(Dn, xy(x[iplus], (ecdfs[iplus1] cdfs[iplus])/2), xytext(x[iplus]-2, (ecdfs[iplus1] cdfs[iplus])/2 - 0.02), arrowpropsdict(facecolorwhite, edgecolorm, shrink0.05), size15, colorm) plt.show()红色竖线标注D_n⁻经验 CDF 低于目标 CDF 的最大缺口洋红色竖线标注D_n⁺经验 CDF 高于目标 CDF 的最大超出D_n取两者中的较大者。底层实现Simard LEcuyer 混合算法文档指出kstwo的实现遵循Simard LEcuyer (2011)将多种算法按不同区域组合以 5–15 位有效数字的精度计算 CDF。这一设计在源码 scipy/stats/_ksstats.py 中体现得非常清晰kstwo_gen的_cdf、_sf、_ppf、_isf分别委托给kolmogn、kolmognp、kolmogni三个公开函数见 kstwo_gen 类核心计算则在其私有函数_kolmogn中按t n·x与n·x²分区间切换算法。算法选择路径_kolmogn_kolmogn的分支策略scipy/stats/_ksstats.py可概括为条件使用算法说明t n·x ≤ 0.5概率为 0D_n不可能小于1/(2n)0.5 t ≤ 1Ruben-Gambino精确公式概率n!·(2t-1)ⁿ/nⁿn140时改用对数形式避免溢出t ≥ n-1Ruben-Gambino尾部公式2(1-x)ⁿx ≥ 0.52·smirnov双侧退化为单侧的 2 倍调用scipy.special.smirnovn ≤ 140且n·x² ≤ 0.754693DMTWDurbin 矩阵算法即 Durbin 精确算法小偏差中央区域n ≤ 140且n·x² ≤ 4Pomeranz (Algorithm 487)小样本精确算法n ≤ 140其余Miller近似2·smirnovn 140CDF 且n·x² ≥ 18CDF 直接取 1n 140n·x^1.5 ≤ 1.4DMTWn 140其余Pelz-Good渐近展开对应 Li-Chien、Pelz 与 Good 的渐近级数_kolmogn_PelzGood实现于 scipy/stats/_ksstats.py其中_kolmogn_PelzGood对K_0..K_3四项系数求和并除以n的幂次实现 Li-Chien/Pelz-Good 的渐近展开_kolmogn_DMTW与_kolmogn_Pomeranz分别是 Durbin 精确矩阵算法与 Pomeranz 算法在小样本区域的落地。这样分区的好处是任何输入都能落在某个数值稳定、代价可控的区间内且 CDF 与 SF 分别按各自最稳妥的方向计算例如n140时 SF 在n·x² ≥ 370直接取 0在≥ 2.2时用2·smirnov从而避免大数抵消误差。从ppf看数值求根_ppf/_isf由kolmogni提供scipy/stats/_ksstats.py其核心逻辑_kolmogni先用1/n或x -expm1(log(q/2)/n)等构造初值再用scipy.optimize.brentq在[1/n, x1]上对_kolmogn(n, x) - p 0做高精度求根xtol1e-14。这意味着kstwo.ppf(q, n)给出的分位数精度同样可达约 14 位小数。与ksone、kstwobign的关系kstwo是scipy.stats中 K-S 一族三个分布之一三者的分工如下分布统计量说明ksoneD_n⁺或D_n⁻单侧偏差分布底层调用sc.smirnov/scu._smirnovc等见 ksone_genkstwoD_n双侧最大绝对偏差的精确分布支持域[0.5/n, 1]kstwobign√n·D_nn→∞ 时的极限/渐近分布无形状参数底层为sc.kolmogorov见 kstwobign_gen三者共享支持域起点a0.0但只有kstwo通过_get_support将有效下界收紧到0.5/n。kstwobign通常用于大样本如 n 10000下避免精确计算开销ksone则用于单侧检验。在kstest/ks_2samp中的实际调用kstwo并非孤立存在它是 SciPy K-S 检验工具的底层概率引擎。在 scipy/stats/_stats_py.py 中kstest定义于 L8257的method参数支持auto / exact / approx / asympexact走kstwo.sf(D, N)精确计算approx用2 * ksone.sf(D, N)近似asymp走kstwobign.sf(D * N**0.5)渐近分布见 L7703-L7729。auto依据样本量自动在这些方法间选择。双样本场景下kstest与ks_2samp会按N sqrt(m·n/(mn))折算等效样本量后再调用kstwo.sf对应文档中D_m,n ≈ D_N的近似关系见 L8202。也就是说kstwo的精确尾概率直接决定了kstest在exact模式下 p 值的准确性。常见问题与注意事项n必须为正整数传入非整数会触发ValueError(n is not integral: ...)见 kolmognn ≤ 0返回nan。kstwo允许数组化输入n与x遵循 numpy 广播规则。x的合法范围是[0, 1]超出支持域时概率被截断x ≥ 1时 CDF 为 1、x ≤ 0时 CDF 为 0不会报错。小样本下D_n的最小值不是 0kstwo支持域从0.5/n开始做临界值/置信区间计算时应留意这一点。与kstest的关系若只需要做一次检验直接调用scipy.stats.kstest更省事需要自行控制检验方法如强制methodexact时理解kstwo/ksone/kstwobign的差别有助于正确解读 p 值。参考依据文档原文与对应实现文件教程文档doc/source/tutorial/stats/continuous_kstwo.rstkstwo/ksone/kstwobign分布类scipy/stats/_continuous_distns.py核心数值算法Simard LEcuyer 分区间实现scipy/stats/_ksstats.pykstest对三个分布的实际调用scipy/stats/_stats_py.py参数有效性测试中的分布参数表scipy/stats/_distr_params.py关键文献见原文档 ReferencesDurbin (1968) 精确概率、Pomeranz (1974) Algorithm 487、Li-Chien (1956) 与 Pelz-Good (1976) 渐近展开以及综合这些方法的Simard LEcuyer, Computing the Two-Sided Kolmogorov-Smirnov Distribution, Journal of Statistical Software, Vol 39, 11 (2011)——kstwo的精度承诺5–15 位有效数字即来源于此。【免费下载链接】scipySciPy library main repository项目地址: https://gitcode.com/gh_mirrors/sc/scipy创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Python实现商店阶梯折扣计算:从基础到优化

Python实现商店阶梯折扣计算:从基础到优化

1. 项目背景与需求解析商店折扣计算是商业活动中最基础的财务场景之一,也是编程初学者练习条件判断的经典案例。这个题目模拟了真实购物场景中常见的阶梯式折扣策略,要求根据消费金额自动计算最终应付金额。在实际商业环境中,这种定价策略被称…

2026/9/23 14:05:02 阅读更多 →
高速信号采集卡性能优化:3个源码细节搞定数据丢包

高速信号采集卡性能优化:3个源码细节搞定数据丢包

高速信号采集卡性能优化:3个源码细节搞定数据丢包 看了一堆教程还是不会写项目?别急,问题往往不在算法,而在底层数据链路。很多应届生做嵌入式或物联网项目时,一上高速信号采集卡,数据就丢、延迟就高,调了几天参数也没用。今天直接上干货,拆解一款基…

2026/9/23 14:04:01 阅读更多 →
3个坑搞定h5开发外包最佳实践源码解析

3个坑搞定h5开发外包最佳实践源码解析

3个坑搞定h5开发外包最佳实践源码解析 配置环境就卡半天,是不是你的常态?明明照着文档敲命令,结果Node版本不对、依赖包冲突,折腾一下午还没跑起来。很多刚接触前端外包的朋友,或者正在做H5页面的开发者,都在这一步栽了跟头。其实,…

2026/9/23 14:04:01 阅读更多 →

最新新闻

GKL内核下载与部署实战:从环境配置到任务编排

GKL内核下载与部署实战:从环境配置到任务编排

最开始接触 GKL 这个项目时,我的第一反应是:这不就是一个内核工具包嘛,装好就能用。真等自己上手之后才发现,光“下载内核”这一步就能劝退一半新手。尤其是大家在搜索 GKL 相关资源时,经常会看到“内核下载”“核心组…

2026/9/23 14:40:57 阅读更多 →
搞定区域规则图片解析,这3个高频面试题别丢分

搞定区域规则图片解析,这3个高频面试题别丢分

搞定区域规则图片解析,这3个高频面试题别丢分 面试被问原理答不上来,那种尴尬你懂吗?面试官盯着你问“怎么识别图片里的违规区域”,你只能支支吾吾说“调个API”。别慌,这其实是前端和后端结合的高频面试题,更是实际业务里的刚需。…

2026/9/23 14:40:56 阅读更多 →
DeepSeek Harness 中 ACP v1/v2 版本错位排查与修复指南

DeepSeek Harness 中 ACP v1/v2 版本错位排查与修复指南

1. 版本错位这件事,比想象中更常见如果你最近在折腾 DeepSeek Harness 这套工具链,大概率会撞上一个让人挠头的问题:ACP 协议已经升到 v2 了,可你手里的 dsh 还停在 v1,两边握手的时候直接对不上。这不是个例&#xff…

2026/9/23 14:40:56 阅读更多 →
现代CPU性能优化:从微架构到实战技巧

现代CPU性能优化:从微架构到实战技巧

1. 程序性能瓶颈的本质探究当我们在终端按下回车键执行程序时,屏幕上那个闪烁的光标背后,隐藏着从晶体管到操作系统的复杂协作链条。作为从业十余年的系统性能调优专家,我见过太多"看似简单"的性能问题背后,往往潜伏着对…

2026/9/23 14:40:55 阅读更多 →
高效回归测试套件构建与优化实践

高效回归测试套件构建与优化实践

1. 回归测试套件的价值与挑战在持续交付成为主流的今天,每周甚至每天发布新版本已成为许多互联网公司的常态。作为某电商平台的质量保障负责人,我亲历过因回归测试不到位导致的线上事故:一次促销活动前的代码更新,由于测试用例覆盖…

2026/9/23 14:40:53 阅读更多 →
G6 常见问题排查指南:Extension 与 Plugin、样式覆盖、交互冲突与渲染细节(FAQ 全解)

G6 常见问题排查指南:Extension 与 Plugin、样式覆盖、交互冲突与渲染细节(FAQ 全解)

G6 常见问题排查指南:Extension 与 Plugin、样式覆盖、交互冲突与渲染细节(FAQ 全解) 【免费下载链接】G6 ♾ A Graph Visualization Framework in JavaScript. 项目地址: https://gitcode.com/gh_mirrors/g6/G6 导读 本文面向使用 J…

2026/9/23 14:39:52 阅读更多 →

日新闻

3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析 面试被问“手机怎么下载微信”背后的原理,90%的人答不上来。别笑,这看似弱智的问题,实则是考察你对移动应用分发机制、安全校验及网络协议理解的试金石。我带过不少校招新人,他们背了八股文,却连一个A…

2026/9/23 0:00:23 阅读更多 →
2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我

2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我

2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我 刚把开发环境的显示器从1080P换到2K,跑老项目直接报错,版本升级后 API…

2026/9/23 0:01:25 阅读更多 →
3步搞定美眉图实战项目,告别官方文档抓不住重点

3步搞定美眉图实战项目,告别官方文档抓不住重点

3步搞定美眉图实战项目,告别官方文档抓不住重点 官方文档翻了三遍还是云里雾里?别急,美眉图在实战项目中常被用来做数据可视化,但它的原理比你想的简单。今天咱们直接上手,用一个完整的小项目把美眉图跑通,不再死磕那些冗长的理论说明。…

2026/9/23 0:01:25 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/23 4:55:02 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/23 4:49:06 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/23 9:53:41 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/23 9:53:40 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/23 9:53:40 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/23 9:53:40 阅读更多 →