Evidently 数据质量检测实操缺失、重复、异常一次查清【免费下载链接】evidentlyEvidently is an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100 metrics.项目地址: https://gitcode.com/GitHub_Trending/ev/evidently模型上线一周后准确率突然下滑排查半天才发现某特征列混进一批空值和重复订单。这类问题在均值、总行数这些汇总指标上完全看不出来只能靠逐列的数据质量检测抓出来。这正是 Evidently 数据质量检测要解决的场景。Evidently 是什么、为什么选它做 ML 数据监控Evidently 是一个开源 Python 框架用于评估、测试和监控 ML 与 LLM 系统。选它的理由开源pip install evidently即可使用报告可导出为 HTML、JSON覆盖验证到生产监控全链路离线报告、测试套件、监控看板同一套框架支持 LLM 评估数据和模型指标可以放一起盯。三步跑通数据质量检测安装 Evidently 与最小依赖pip install evidently数据源就是一份 pandas DataFrame无需额外依赖。写一份最小检测配置最小可运行配置缺失值检测、重复值筛查、异常值统计一次覆盖import pandas as pd from evidently import Report from evidently.metrics import ( MissingValueCount, DuplicatedRowCount, MinValue, MaxValue, MeanValue, StdValue, ) report Report([ MissingValueCount(columnuser_age), DuplicatedRowCount(), MinValue(columnuser_age), MaxValue(columnuser_age), MeanValue(columnuser_age), StdValue(columnuser_age), ], include_testsTrue)这些指标都在src/evidently/metrics/dataset_statistics.py和src/evidently/metrics/column_statistics.py中实现。生成并打开报告snapshot report.run(current_datadf) snapshot.save_html(report.html)run返回 Snapshotsave_html导出后用浏览器打开即可。带include_testsTrue时每个指标附默认测试未通过项会在报告里标红。报告里的三类指标怎么读缺失值看什么、什么阈值算异常MissingValueCount给两个数count缺失数和 share占比。默认测试是缺失数为 0 才通过提供reference_data后会对比缺失占比相对参考数据的差异是否超过 10%。实操阈值关键特征列 share 1% 就该排查上游某列接近 100% 缺失通常是字段映射错了而不是数据量问题。重复值行级 vs 列级各自危险在哪DuplicatedRowCount看整条记录被重复写入危险点在订单、日志这类事件流重复会直接扭曲指标和训练样本权重。DuplicatedColumnsCount看列级重复两列数值完全一致多数是特征冗余而非数据错误先想到降维而不是急着修数据。异常值用 min / max / mean / std 做初步判断不依赖复杂算法先看四个统计量max 远大于 mean 说明有极端高值点min 为负或出现不可能取值就是脏数据std 相对参考数据明显变大说明整列离散度变了。要进一步量化换OutRangeValueCount(columnuser_age, left0, right150)直接统计超出业务合法区间的值数。用 Grafana 看板持续盯数据单次报告只是快照持续盯才叫 ML 数据监控。做法是把 report 按天定时跑、导出快照再交给 Grafana 渲染成时间序列。仓库自带现成示例examples/grafana/下有数据漂移和 LLM 评估两套看板含 docker-compose可以直接参考部署。几个容易踩的坑 先统一列的编码和类型再统计缺失上游传 N/A、0 占位按 NaN 统计会漏掉。 重复列先怀疑特征冗余不是数据错误列间相关性高不等于列重复可用相关矩阵区分。 报告里基于统计检验的 p-value 别只看大小大样本下微小差异也显著要结合业务量级判断。⚙️ 很多默认测试在给了reference_data后阈值更严对比结果前先确认参考数据的口径和日期范围。Evidently 数据质量检测这套流程配几个指标、跑一次报告、盯住失败项值得放进日常迭代和上线前检查。指标清单与部署方式见 Evidently 官方文档和仓库主页。【免费下载链接】evidentlyEvidently is an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100 metrics.项目地址: https://gitcode.com/GitHub_Trending/ev/evidently创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考