众数
zhòng shù
众数是数据集中出现次数最多的值。
Definition
众数是一组数据中出现次数最多的值;一个数据集可以有一个众数、两个众数(双峰)或者当所有值出现频率相同时没有众数,对于定性数据,众数是频数最高的类别。数据集可以是单峰、双峰或多峰的,如果所有值频率相同则没有众数。形式上,连续分布的众数是使概率密度函数最大化的值 $x^*$($f'(x^*) = 0$ 且 $f''(x^*) < 0$);对样本而言,样本众数对连续数据来说并不是一个定义良好的统计量,因此连续分布的众数估计使用核密度估计,将 KDE 曲线的峰值识别为众数。
Example
一个 $7$ 人班级的鞋码为 $8$、$8$、$9$、$9$、$9$、$10$、$10$,众数是 $9$,因为它出现了 $3$ 次,比其他任何尺码都多。关于最喜欢类型的类别调查数据,动作片($45$)、喜剧片($30$)、剧情片($45$)、恐怖片($20$),是双峰的,因为动作片和剧情片都出现了 $45$ 次。正态分布 $N(\mu, \sigma^2)$ 是单峰的,众数 $= \mu = 均值 = 中位数$,这是对称分布的一个特殊性质,而当 $\alpha > 1$ 且 $\beta > 1$ 时,贝塔分布 $\text{Beta}(\alpha, \beta)$ 的众数 $= (\alpha-1)/(\alpha+\beta-2)$。
Key Insight
众数是唯一适用于类别的集中趋势度量:你可以找出最受欢迎的口味、颜色或答案,但无法对它们求平均,它对应于频数分布的峰值。在贝叶斯统计中,后验分布的众数称为 MAP(最大后验)估计,它对应于带惩罚项的最大似然估计,是在后验难以处理时常用的一种点估计。