双峰分布

统计与概率

shuāng fēng fēn bù

双峰分布具有两个明显的峰值,表明数据聚集在两个不同的值附近。

Visualization

Definition

双峰分布是一个具有两个不同峰值或聚集点,而非单一最常见值的数据集,通常表明数据来自被合并在一起的两个不同子总体。它的频数分布或概率分布中有两个不同的局部最大值,整体均值落在两个峰值之间,可能既不能很好地代表其中任何一个组。形式上,双峰分布有两个众数,意味着其概率密度函数有两个局部最大值;混合模型将其表示为若干成分分布的加权和,$f(x) = \pi f_1(x) + (1-\pi) f_2(x)$,其中 $f_1$ 和 $f_2$ 通常是正态概率密度函数,$\pi$ 是混合比例,参数通过 EM(期望最大化)算法估计。

Example

一个班级中一半学生喜欢某堂课、一半不喜欢,调查分数可能会聚集在 $2/10$ 和 $9/10$ 附近,形成两个峰值。一群成人与儿童混合的身高会呈现双峰:一个峰值在成人平均身高附近(5 英尺 7 英寸),一个在儿童身高附近(4 英尺 2 英寸),整体均值无法代表任何一个组。一个高斯混合模型,成分为 $N(\mu_1=3, \sigma_1=1)$ 和 $N(\mu_2=8, \sigma_2=1.5)$,混合权重为 $\pi=0.4$,其峰值大约在 $3$ 和 $8$ 处,EM 算法通过在分配软成员资格和更新参数之间迭代,直至收敛。

Key Insight

两个峰值通常意味着两个不同的组被混在了一起,因此把它们分开单独分析通常比报告一个整体平均值更有意义;双峰分布是提示存在隐藏结构的信号,聚类算法可以帮助识别并分离这两个峰。哈蒂根双峰检验是一种正式的非参数检验,用于检验单峰性与多峰性,而西尔弗曼带宽检验则利用 KDE 检验是否只有一个峰,二者都可作为应用混合模型之前的诊断工具。