中位数

统计与概率

zhōng wèi shù

中位数是数据按顺序排列后位于正中间的值,把数据分成相等的两半。

Visualization

Definition

中位数是把所有数据从小到大排列后位于正中间的值:一半的值低于它,一半的值高于它。当数据个数 $n$ 为奇数时,它是排序后第 $((n+1)/2)$ 个值;当 $n$ 为偶数时,它是排序后第 $(n/2)$ 个和第 $(n/2+1)$ 个值的平均值,它对异常值具有抵抗力。形式上,中位数是经验分布的第 $50$ 百分位数($Q_2$);作为总体位置的估计量,根据顺序统计量的渐近理论,样本中位数是一致的,且近似服从均值为 $\mu$、方差为 $1/(4nf(\mu)^2)$ 的正态分布,其中 $f(\mu)$ 是真实中位数处的概率密度值。

Example

身高 $58$、$60$、$62$、$65$、$70$ 英寸的中位数是 $62$,因为它位于正中间;对于偶数个数值(例如 $58$、$60$、$62$、$65$),中位数是中间两个值的平均:$(60+62)/2 = 61$。薪资(以千美元计)为 $40$、$45$、$48$、$52$、$55$、$60$、$500$,均值 $= 114.3$,但中位数 $= 52$,后者更能代表典型薪资,因为异常值($500$)不会影响它。对于正态数据,中位数相对于均值的渐近相对效率(ARE)为 $2/\pi$,约等于 $0.637$,意味着在正态性成立的情况下,中位数需要约多 $57\%$ 的数据才能达到与均值相同的精度。

Key Insight

中位数不会被极大或极小的值所迷惑,这就是为什么房价和收入常常报告中位数,因为少数极高的值会使均值发生偏斜;它还使绝对离差和最小:$\sum |x_i - c|$ 在 $c = \text{median}$ 时取得最小值,这将它与 L1 优化和稳健统计联系起来。在重尾分布(例如均值并不存在的柯西分布)中,中位数是首选的位置度量,稳健统计正是建立在这一基础上:胡贝尔 M 估计量等估计量在均值和中位数的行为之间插值。