没有标签时,聚类图上分成两团就算成功吗?KMeans 总能给出指定数量的簇,DBSCAN 却可能把一部分点标成噪声;当数据呈弯月形,前者的“每个点都有归属”反而可能是错误的约束。未知簇数与噪声并存时,先判断距离和几何形状,再看分数。本文用两组有已知生成标签的模拟数据对照 KMeans、层次聚类和 DBSCAN。真实无监督任务往往没有这份真值;本文计算的 ARI 只用于检验模拟实验,不能在实际无标签项目里作为选型捷径。文章目录先看距离、尺度、簇形状和噪声未知簇数时怎样缩小候选范围KMeans、层次聚类与密度聚类如何选择用不同数据形状验证聚类结果轮廓系数好看但分群无用时怎么办总结先看距离、尺度、簇形状和噪声聚类方法处理的是某种相似性定义,而不是天然存在的“正确组别”。收入与年龄若直接用欧氏距离,数值大的字段可能主导结果;客户、设备或地理位置的数据还可能需要不同距离。本文只有二维数值特征,先用StandardScaler在每个模拟数据集内部统一尺度,然后比较三种方法。观察角度需要回答的问题对方法选择的影响尺度与距离特征单位差异大吗?欧氏距离有业务意义吗?先处理量纲,再讨论算法。簇形状是紧凑的近球形群体,还是弯曲、环形或链状结构?KMeans 偏好紧凑簇;密度方法能识别部分非凸形状。噪声是否允许“暂不归类”?固定簇数方法通常把每个点分配到某簇;DBSCAN 可标记-1。密度差异各群密度相近吗?单一eps的 DBSCAN 对差异密度可能不合适。未知簇数时怎样缩小候选范围未知簇数不