关于提升机器学习算法做预测回归任务精度的方法分享
关于提升机器学习算法做预测回归任务精度的方法分享1. 问题的来源​ 目前做过一些小数据集100-1000的预测任务经常会出现一个问题拿到数据后写完模型代码然后运行测试发现R2很低MAE之类的指标也很高。​ 这个时候会发现单纯调整模型参数并不能提高模型精度。​ 而这个问题就是今天想要探讨的问题。2. 方法分享​ 这里仅分享我自己目前能够想到的方法如果大家还有其他方法欢迎补充在评论区让后来的人可以少走一些弯路。​ 我觉得这个问题出现的根本原因在于数据集。现在很认可一句话做这种机器学习的工作80%的时间都在处理数据20%的时间在调参和写代码。​ 比如我现在有一个700条的数据集但是只有5个特征其中一个还是目标变量。这个时候即使数据量看着还不错但4个特征所包含的信息有限模型训练后的泛化能力大概率很弱除非你的数据隐含的关系非常简单不然大概率R2都非常低。​ 意识到“模型本质学的是数据的信息”当你数据包含的信息越多的时候模型自然能够学习到的东西也越多最终的泛化能力自然也就越高。​ 因此提高精度的本质是提高数据信息量体现在具体方法有如下新增物理特征纯数学特征可能效果不好或者存在天花板。可以引入一些更具有物理意义的复合特征。本质上来说是增加信息含量因为单纯的数字可能包含的信息有限因此需要人为增加信息量。去除某些杂糅信息特征有的时候并不是越多信息越好有的信息如果本身是噪声与没有意义的特征可以抛去尝试看看效果如何如果没有提升或者减弱了再加上即可。构建新的目标变量有的时候原本的目标变量可能区分度不够或者其他原因可以构建出新的目标变量更具辨识度比如对数化处理注意训练前对数化预测的时候要将预测输出的还原然后进行模型的评估聚类公共数据点把一些具有类似特征的数据聚类在一块相当于新增了数据列具有更多信息和辨识度明确上限与优先性如果特征数很少、数据量小有的时候的确预测效果存在一定上限难以准确预测如果存在多个数据集的时候数据集的数据大小由少变多优先调整数据大的明确最优结果才能去评价其他相对更差的结果。删除数据异常点如果目标变量具有物理意义比如输入的是总重量预测的是长途过程中损失后的最终重量如果目标变量即最终重量比总重量还大或者小特别多可以标记为异常数据而去掉。当然是否去掉还是要根据业务场景来判断。3. 补充​ 关于派生特征的构造任务是有领域的有的时候可以根据领域知识进行构建比如将某两个特征相加或者相除得到总的量或者比例之类的特征听从AI的建议AI的知识库很丰富常见的简单新特征构建它基本都可以给出建议​根据我自己的尝试新增特征是最有用的手段了如改变目标变量等方法效果不是确定偶尔能提升偶尔也会变差。

相关新闻

为什么92%的AI编程项目6个月内失败?Gartner最新调研揭示3个被忽视的致命盲区

为什么92%的AI编程项目6个月内失败?Gartner最新调研揭示3个被忽视的致命盲区

更多请点击: https://intelliparadigm.com 第一章:AI编程失败率背后的结构性真相 当开发者将自然语言指令输入AI编程助手后,生成的代码在约68%的中等复杂度任务中首次运行即失败——这一数字并非源于模型能力不足,而是暴露了人机…

2026/7/23 13:24:27 阅读更多 →
Jmeter自动化测试实施方案

Jmeter自动化测试实施方案

🍅 点击文末小卡片 ,免费获取软件测试全套资料,资料在手,涨薪更快Jmeter是目前最流行的一种测试工具,基于此工具我们搭建了一整套的自动化方案,包括了脚本添加配置、本地配置和运行、服务器配置等内容&…

2026/7/23 13:24:27 阅读更多 →
没技术背景,怎么转 AI 产品经理

没技术背景,怎么转 AI 产品经理

那个报错让我手心出汗 我盯着屏幕上那行红色报错,手心出汗。这是我第一次打开 Dify,想试着搭个智能问答,结果卡在"模型 API Key 怎么填"。旁边做开发的同事扫了一眼:“你连这个都不会?” 那一刻我特别想关掉…

2026/7/23 13:23:26 阅读更多 →

最新新闻

家庭KTV音响系统选型与调试指南:从核心组件到声学优化

家庭KTV音响系统选型与调试指南:从核心组件到声学优化

家庭KTV音响系统从简单的蓝牙音箱到专业级设备,选择范围很广。山水(SANSUI) Q52S作为一款卡拉OK一体机,集成了功放、混响、无线麦克风和音箱功能,适合不想折腾复杂接线的家庭用户。但真正决定KTV体验的不仅是设备品牌,更是声学环境…

2026/7/23 13:40:39 阅读更多 →
Claude工具使用:从基础调用到生产实践

Claude工具使用:从基础调用到生产实践

1. Claude工具使用基础解析在大模型应用开发领域,Claude的Tool Use功能正在改变人机交互的方式。作为Anthropic推出的核心能力之一,它允许模型主动调用外部工具来扩展自身功能边界。与传统的API调用不同,Tool Use实现了真正的"工具自主选…

2026/7/23 13:40:39 阅读更多 →
员工远程入职,劳动合同不签纸质版真的合规吗?

员工远程入职,劳动合同不签纸质版真的合规吗?

这两年远程办公和异地用人越来越普遍,不少 HR 都遇到过同一个尴尬:offer 发出去了,人也在线上入职了,可劳动合同还躺在快递单里没寄到。有人干脆发个电子版让员工打印签字再寄回,也有人直接在微信里传个 PDF 让对方&qu…

2026/7/23 13:40:39 阅读更多 →
深度学习模型部署优化:从ONNX到TensorRT实战

深度学习模型部署优化:从ONNX到TensorRT实战

1. 项目概述 "模型转换、加速与推理优化【Plan 8】"是一个专注于深度学习模型部署优化的技术方案。这个方案的核心目标是通过格式转换、计算加速和推理优化三个关键环节,显著提升模型在生产环境中的推理性能。在实际业务场景中,我们经常遇到训…

2026/7/23 13:40:39 阅读更多 →
【通义千问论文写作黄金法则】:20年学术导师亲授AI时代高效写作的5大禁忌与3个提效公式

【通义千问论文写作黄金法则】:20年学术导师亲授AI时代高效写作的5大禁忌与3个提效公式

更多请点击: https://intelliparadigm.com 第一章:通义千问论文写作黄金法则的底层逻辑 通义千问在学术写作场景中的高效表现,并非源于泛化的语言生成能力,而是建立在三重协同机制之上:领域知识蒸馏、结构化推理约束与…

2026/7/23 13:40:39 阅读更多 →
遗传算法优化BP神经网络的MATLAB实现与应用

遗传算法优化BP神经网络的MATLAB实现与应用

1. 项目概述在工程预测和数据分析领域,神经网络因其强大的非线性拟合能力而广受青睐。然而,传统神经网络(尤其是BP神经网络)存在训练速度慢、易陷入局部最优等固有缺陷。遗传算法作为一种模拟自然进化过程的全局优化方法&#xff…

2026/7/23 13:39:38 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻