statsmodels.othermod 模块实战指南:用 BetaModel 对单位区间连续因变量建模(Beta 回归)
数据分析数据科学科研【免费下载链接】statsmodelsStatsmodels: statistical modeling and econometrics in Python项目地址https://gitcode.com/gh_mirrors/st/statsmodels点击查看免费下载statsmodels.othermod是 statsmodels 中专门容纳难以归入其他类别的模型类的子模块目前的核心成员是 Beta 回归模型BetaModel——面向取值落在单位区间(0, 1)内的连续因变量如比例、分数、甲基化水平等采用全极大似然Full Maximum Likelihood估计。本文以 docs/source/other_models.rst 为主线结合 betareg.py 的源码与 test_beta.py 测试用例完整讲解其定位、API、建模流程、预测与结果解读并深入剖析其均值 精度双线性预测子的底层实现。读完本文你将能够独立使用BetaModel完成比例型数据的回归建模、公式化精度子模型设定、多种预测量的提取与模型诊断。模块定位othermod 与 miscmodels 的分工在 statsmodels 中othermod即 other models是一个较新的子模块其设计意图在文档中写得很明确它包含不属于任何其他类别的模型类典型场景是响应变量endog的支持集为单位区间、正数或非负数的模型它收录的是已经或将要被完整开发的模型与statsmodels.miscmodels形成对比——后者主要存放通用似然模型框架GenericLikelihoodModel的用法示例。从源码看othermod的公开 API 目前非常聚焦api.py 仅导出了BetaModel一个类并写入__all__ [BetaModel]init.py 则提供了标准的test测试入口基于PytestTester。在构建层面statsmodels/meson.build 将othermod列入模块列表说明它是一个正式的、随包编译分发的一等公民子模块。需要特别说明的是实验性状态文档明确标注 Status is experimentalbetareg.py 中也注明 new in 0.13、Core results are verified, but api can change。也就是说核心估计结果是经过验证的但 API 形态会随着未来支持更多模型类型例如多个exog、多个链接函数而调整。Beta 回归的适用场景单位区间连续因变量othermod目前聚焦的模型是Beta 回归Beta Regression用于连续取值且落在单位区间内的因变量典型例子包括家庭支出中用于食物的比例如测试数据中的food/income甲基化测序中的甲基化水平如测试数据中的methylation取值 0~1 的连续比率各种以百分比、份额、覆盖率形式存在的比例数据。文档特别强调了一个重要的建模选择单位区间上的因变量也可以用二元endog模型如Logit和GLM-Binomial通过**拟极大似然Quasi Maximum Likelihood, QMLE**来估计但discrete.Probit的实现假设了二元endog无法为连续因变量估计 QMLE。这意味着对同一类数据你至少有三条技术路线专门的 Beta 回归本文主角、Logit/GLM-Binomial 的 QMLE 近似。BetaModel的优势在于它针对单位区间连续响应建立了完整的参数化似然直接估计均值与精度两套结构。BetaModel 的建模思想均值与精度双重参数化Beta 分布通常用形状参数(a, b)描述但BetaModel采用了更利于回归建模的均值–精度参数化。模型对每个观测定义均值mu E[endog | exog]通过均值设计矩阵exog与链接函数link关联精度precisionphi一个正值参数通过独立的精度设计矩阵exog_precision与精度链接函数link_precision关联。从 betareg.py 的对数似然实现可见其分布形式alpha mu * phi beta (1 - mu) * phi ll lgamma(phi) - lgamma(alpha) - lgamma(beta) (mu * phi - 1) * log(y) ((1 - mu) * phi - 1) * log(1 - y)这正是 Beta 分布Beta(alpha, beta)的对数密度其中alpha mu*phi、beta (1-mu)*phi。相应的条件方差由_predict_var给出var_endog mean * (1 - mean) / (1 precision)可以看出精度phi越大围绕均值的方差越小分布越集中——这直观地对应了 Beta 分布的集中度含义。构造函数参数BetaModel.__init__的完整参数如下参数类型默认值说明endogarray_like必填一维响应变量必须严格落在 (0, 1) 开区间源码中用assert np.all((0 etmp) (etmp 1))强制校验exogarray_like必填nobs × k的均值设计矩阵。默认不含截距需用户自行添加公式接口默认带截距exog_precisionarray_like可选精度部分的设计矩阵默认退化为常数列仅一个 precision 参数linkLink 实例Logit()均值链接函数要求值域落在 [0, 1]可使用 statsmodels.genmod.families.links 中的任意链接link_precisionLink 实例Log()精度链接函数要求值域在正半轴**kwdsdict—传递给父类GenericLikelihoodModel的额外关键字在构造内部BetaModel会把精度参数名注册为precision或precision-{列名}当exog_precision是多列时并通过extra_params_names传给父类这也是为什么最终results.params中会出现precision之类的参数名。快速上手以 foodexpenditure 数据为例最简洁的用法是直接传数组使用默认的 logit 链接均值与 log 链接精度from statsmodels.othermod.betareg import BetaModel mod BetaModel(endog, exog) rslt mod.fit() print(rslt.summary())测试套件 test_beta.py 中使用的是 R 经典数据集 FoodExpenditure 的公式写法import pandas as pd from statsmodels.othermod.betareg import BetaModel income pd.read_csv(statsmodels/othermod/tests/results/foodexpenditure.csv) model I(food/income) ~ income persons fit BetaModel.from_formula(model, income).fit()该用例把食品支出占收入比例作为因变量用income和家庭人数persons建模均值精度部分使用默认的仅常数项。测试中与 R 包betareg的结果对齐的系数为截距约-0.6225、income约-0.0123、persons约0.1185常数精度phi ≈ 35.61R 结果见 test_beta.py。公式接口与精度子模型from_formula 详解BetaModel.from_formula是更常用的入口它通过 patsy 风格的公式同时支持均值与精度两套设计矩阵。其签名见 betareg.pyBetaModel.from_formula(formula, data, exog_precision_formulaNone, *args, **kwargs)formula描述均值模型的公式字符串dataDataFrame 数据exog_precision_formula可选描述精度模型的公式若为None精度部分仅含常数项等价于exog_precision缺省时的单精度参数设定*args, **kwargs透传给BetaModel的其他参数如link_precision。文档内置示例给出了两种典型的公式化用法。用法一显式传入精度设计矩阵如 identity 链接from statsmodels.genmod.families.links import identity import patsy Z patsy.dmatrix(~ temp, dat, return_typedataframe) mod BetaModel.from_formula(iyield ~ C(batch, Treatment(10)) temp, dat, exog_precisionZ, link_precisionidentity())这里均值公式中含有分类变量batch指定 Treatment 编码和连续变量temp精度部分单独用temp建模并改用恒等链接。用法二比例数据场景——精度依赖测量次数文档给出的甲基化数据示例非常贴近真实业务当观测是比例型数据时精度可能取决于测量次数如覆盖某个位点的测序读段数Z patsy.dmatrix(~ coverage, df) formula methylation ~ disease age gender coverage mod BetaModel.from_formula(formula, df, exog_precisionZ) rslt mod.fit()用法三直接用精度公式字符串。测试代码 test_beta.py 展示了exog_precision_formula与exog_precision两种写法等价m BetaModel.from_formula(methylation ~ gender CpG, methylation, exog_precision_formula~ age, link_precisionlinks.Identity()) rslt m.fit()该测试断言两种方式得到的参数完全一致rtol1e-10并验证了公式接口返回的参数是带索引的pd.Series。此外test_beta.py 的test_eval_env用例表明公式中的任意 Python 函数如times_two(income)也会被正确解析到参数名中且数值关系保持income系数是times_two(income)系数的 2 倍。提示由于exog_precision_formula的实现基于内部FormulaManager.get_matrices见 betareg.py精度公式的用法与均值公式略有差异测试中也提示目前predict对exog_precision的公式变换支持尚有限制。拟合fit 方法与优化选项BetaModel.fit的签名与选项如下fit(start_paramsNone, maxiter1000, dispFalse, methodbfgs, **kwds)参数默认值说明start_paramsNone起始参数向量为None时自动计算见下文_start_paramsmaxiter1000最大迭代次数dispFalse是否输出收敛信息methodbfgs优化方法测试中亦使用newtonkwds—优化器附加参数特殊地传入cov_typeeim会切换信息矩阵类型起始值的选取_start_paramsbetareg.py实现了一个两阶段的加权最小二乘WLS逼近——先用 OLS 拟合link(endog)得到均值的初值再从残差构造精度初值prec_i fitted*(1-fitted)/max(|resid|,1e-2)^2 - 1然后交替迭代 WLS 若干轮默认 2 轮得到最终起点。文档源码注释也引用了 Ferrari 关于精度初始化的经典论文见 betareg.py 附近。协方差矩阵类型模型属性hess_type默认取oimobserved information matrix观测信息矩阵即负 Hessian当fit收到cov_typeeim时会改写为eimexpected information matrix期望信息矩阵这是对父类GenericLikelihoodModel不支持直接传cov_type的变通处理。测试 test_beta.py 验证了hessian(observedTrue/False)结果不同且显式传参优先于hess_type默认值。predict五种预测量BetaModel.predict通过which参数控制返回的统计量这在同类模型中相当完整which取值返回内容mean默认条件期望E(endog | exog)即link.inverse(线性预测)precision预测精度philinear均值部分的线性预测子X params_meanlinear-precision精度部分的线性预测子var模型隐含的条件方差mean*(1-mean)/(1precision)为兼容旧名称与拼写linpred会被归一化为linearlinpred_precision/linear_precision归一化为linear-precision。调用时支持传入新的exog与exog_precision进行样本外预测。在结果对象上还可以通过get_prediction(...)获得带置信区间的预测汇总summary_frame()测试 test_beta.py 验证了whichmean/var/precision/linear/linear-precision各模式以及average、agg_weights加权平均等用法。BetaResults结果对象与诊断工具拟合返回BetaResults继承GenericLikelihoodModelResults并混入_LLRMixin其常用只读属性见 betareg.py属性/方法含义fittedvalues样本内预测均值fitted_precision样本内预测精度resid响应残差endog - fittedvaluesresid_pearsonPearson 标准化残差除以条件标准差prsquaredCox-Snell 似然比伪 R²1 - exp((llnull - llf) * (2 / nobs))get_distribution(...)基于估计参数返回 scipy 冻结的stats.beta预测分布get_influence()返回MLEInfluence实例提供 Cook 距离、hat 矩阵对角线、学生化残差等影响与离群点度量其中get_distribution与get_distribution_params在模型与结果类上都有实现模型方法需要显式传入params结果方法则自动使用已估参数且支持公式变换transformTrue。测试 test_beta.py 验证了distr.stats()返回的均值、方差与fittedvalues、_predict_var高度一致rtol1e-13并对照了 R 中predict(typevariance)的结果。get_influence的实现betareg.py在文档中明确说明其与 Rbetareg的差异R 使用线性近似 hat 矩阵做标准化而本实现使用广义 leveragegeneralized leverage作为hat_matrix_diag残差分析采用 Pearson 残差。测试 test_beta.py 对cooks_distance、d_fittedvalues、dfbetas、hat_matrix_diag、resid_studentized等做了冒烟验证。源码级原理score 与 Hessian 的实现策略BetaModel的梯度与二阶信息在 betareg.py 中实现得相当精细理解这些有助于排查数值问题score_factor返回对数似然关于两个线性预测子的得分因子sf1, sf2其中sf1 phi * t * (ystar - mustar)t为均值链接导数的倒数sf2 h * (mu*(ystar-mustar) yt - mut)h为精度链接导数的倒数真正的score_obs由sf1[:, None] * exog与sf2[:, None] * exog_precision拼接而成score_hessian_factor同时计算得分因子与 Hessian 的三个分块因子(-jbb, -jbg, -jgg)对应上三角通过observed参数切换观测/期望信息计算中用trigammapolygamma(1, ·)表达二阶 digammahessian由分块因子按X.T * j * X的逐元素乘法重组为完整分块矩阵。数值上值得注意的细节是eps_lb 1e-200的下界裁剪在mu*phi或(1-mu)*phi接近 0 时digamma 会趋于-inf裁剪避免了溢出见 betareg.py。测试 test_beta.py 断言了解析 score 与父类数值差分 score 的一致rtol1e-6test_hessian_factor_reassembles_hessian 则验证了从hessian_factor重组出的 Hessian 与hessian()直接结果一致。验证与参考与 R betareg 的对照模型的正确性通过与 R 生态对照来保证。statsmodels/othermod/tests/目录提供了完整证据链数据foodexpenditure.csvRbetareg包的 FoodExpenditure、methylation-test.csv参考结果results_betareg.py来自 Rbetareg输出的系数表、方差协方差矩阵、对数似然、伪 R² 等测试test_beta.py 覆盖系数对齐test_income_coefficients、test_methylation_coefficients、OIM/EIM 两种标准误test_oim、似然比检验统计量test_basic中llnull/llr/llr_pvalue对照 R 的lrtest、score testtest_score_test等。以甲基化数据为例Rbetareg参考结果test_beta.py显示均值部分系数截距、genderM、CpGCpG_1、CpGCpG_2精度部分截距、age而精度公式为~ age、链接为 Log。测试中还演示了cov_typeeim与默认 OIM 两种标准误都能与 R 结果对齐test_beta.py这为使用者提供了交叉验证的信心。状态与使用建议综合文档与源码使用BetaModel时有几点需要留意endog 约束严格endog必须满足0 y 1开区间0 或 1 的观测需要先做边界处理如经典的 Smithson Verkuilen 变换否则构造时直接断言失败实验性 API模型自 0.13 版本引入核心结果已验证但部分附属功能如公式化predict对精度变量的变换、MLEInfluence对多链接/多 exog 的支持仍标记为实验性替代路线对单位区间数据可考虑 Logit 或 GLM-Binomial 的 QMLE 作为快速基线但discrete.Probit不可用于连续因变量扩展方向文档指出未来模块将支持多exog、多链接函数的模型API 会随之演进编写依赖该模块的代码时建议固定 statsmodels 版本。想要亲自动手验证可以在仓库根目录运行对应测试pytest statsmodels/othermod/tests/test_beta.py或用 methylation-test.csv 与 foodexpenditure.csv 复现本文中的建模示例。赞分享数据分析数据科学科研【免费下载链接】statsmodelsStatsmodels: statistical modeling and econometrics in Python项目地址https://gitcode.com/gh_mirrors/st/statsmodels点击查看免费下载相关推荐python_for_data_analysis_2nd_chinese_version回归分析变量间关系的建模方法python_for_data_analysis_2nd_chinese_version回归分析变量间关系的建模方法 你是否还在为如何分析销售数据中的价格与销教程文档数据分析如何快速构建TensorFlow回归模型连续值预测完整指南如何快速构建TensorFlow回归模型连续值预测完整指南 TensorFlow Course是一个专为初学者设计的开源项目提供简单易用的TensorFlo教程深度学习机器学习ML-For-Beginners 回归模块2-Regression以北美南瓜价格为案例的 Scikit-learn 回归建模实战ML For Beginners 回归模块2 Regression以北美南瓜价格为案例的 Scikit learn 回归建模实战 本篇基于 ML For教程机器学习人工智能上一篇保护数据隐私gh_mirrors/json1/json本地转换功能深度解析下一篇Alpine.js 模板语法终极指南掌握插值、指令与表达式创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

棋类博弈引擎开发:从规则建模到高效搜索实现

棋类博弈引擎开发:从规则建模到高效搜索实现

简介:本资源是面向计算机专业学生、人工智能初学者及算法竞赛备赛者的计算机博弈系统性入门讲义,由东北大学机器博弈研究室出品,聚焦博弈原理、软件实现与多棋类实战分析。内容覆盖博弈树搜索、Alpha-Beta剪枝、蒙特卡罗树搜索等核心算法&…

2026/9/23 21:49:43 阅读更多 →
Talos Linux SideroLinkConfig 配置指南:连接 SideroLink API 的机器配置文档详解

Talos Linux SideroLinkConfig 配置指南:连接 SideroLink API 的机器配置文档详解

云原生操作系统容器编排 【免费下载链接】talos Talos Linux is a modern Linux distribution built for Kubernetes. 项目地址: https://gitcode.com/gh_mirrors/ta/talos 点击查看 免费下载 SideroLinkConfig 是 Talos Linux 中用于建立 SideroLink 连接的机器配…

2026/9/23 21:48:42 阅读更多 →
基于 MindSpore 与鲲鹏硬件的语音识别系统案例

基于 MindSpore 与鲲鹏硬件的语音识别系统案例

一、项目概述本项目面向政企信创场景,采用MindSpore 深度学习框架、鲲鹏 920 CPU、昇腾 910B NPU、openEuler 操作系统搭建国产化语音识别(ASR)平台,选用工业主流 ConformerCTC 架构,完成客服通话录音批量转写、实时流…

2026/9/23 21:48:42 阅读更多 →

最新新闻

Windows系统安装全指南:从U盘启动盘制作到UEFI/GPT分区方案

Windows系统安装全指南:从U盘启动盘制作到UEFI/GPT分区方案

不管是给老电脑续命,还是给新装的机器做首次引导,Windows系统的安装都属于那种“看着简单,做起来全是细节”的活儿。我前前后后帮同事、朋友装了不下几十台机器,自己也因为手贱删错分区、改了引导方式导致安装失败过好多次&#x…

2026/9/24 0:00:20 阅读更多 →
齿轮箱故障诊断中的传递路径分析:原理、Matlab实现与工程应用

齿轮箱故障诊断中的传递路径分析:原理、Matlab实现与工程应用

前阵子有朋友拿来一组齿轮箱振动数据,说频谱图上能看到好几个啮合频率边带,但就是说不清振动到底是从啮合点直接传出来的,还是先传到轴承、再经过箱体共振放大出来的。这个问题其实特别典型——齿轮箱故障诊断里,传感器只能装在箱…

2026/9/24 0:00:20 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
水下生物目标检测实战:YOLO工程与PyTorch训练推理全流程解析

水下生物目标检测实战:YOLO工程与PyTorch训练推理全流程解析

简介:面向水下生物目标检测场景,这份基于Python与PyTorch的深度学习资源包,整合了YOLO模型训练与推理所需的数据集、脚本及预训练权重,适合有一定深度学习基础、希望快速上手目标检测项目的开发者。资源共1830个文件,压…

2026/9/23 23:59:18 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/23 4:55:02 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/23 4:49:06 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/23 9:53:41 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/23 9:53:40 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/23 9:53:40 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/23 9:53:40 阅读更多 →