四分位数

统计与概率

sì fēn wèi shù

四分位数把数据集分成四等份,Q1、Q2(中位数)和 Q3 标出各部分的边界。

Visualization

Definition

四分位数是把排序后的数据集分成四等份的三个值:$Q_1$ 是低于前 $25\%$ 的边界,$Q_2$ 是中位数($50\%$),$Q_3$ 是低于前 $75\%$ 的边界。$Q_1$ 是下半部分的中位数,$Q_3$ 是上半部分的中位数,不过不同的方法(是否将中位数本身纳入上下两半)可能会给出略有不同的结果。形式上,四分位数是分位数的特例:$Q_1 = F^{-1}(0.25)$,$Q_2 = F^{-1}(0.50)$,$Q_3 = F^{-1}(0.75)$;对于有限样本,分位数的计算使用插值法,R 语言实现了九种不同的分位数算法(类型 $1$ 到 $9$),默认为类型 $7$(顺序统计量的线性插值)。

Example

排序后的分数 $10$、$20$、$30$、$40$、$50$、$60$、$70$、$80$ 给出 $Q_1 = 25$(第一和第二四分之一之间的边界)、$Q_2 = 45$(中位数)以及 $Q_3 = 65$(第三和第四四分之一之间的边界)。对于数据 $3$、$5$、$7$、$8$、$9$、$11$、$14$、$16$、$21$:中位数($Q_2$)$= 9$;下半部分 $3$、$5$、$7$、$8$ 给出 $Q_1 = (5+7)/2 = 6$;上半部分 $11$、$14$、$16$、$21$ 给出 $Q_3 = (14+16)/2 = 15$;因此 $\text{IQR} = 15 - 6 = 9$。对于标准正态分布,$Q_1 = -0.6745$,$Q_2 = 0$,$Q_3 = 0.6745$,得 $\text{IQR} = 1.349$,这些精确值用于校准正态数据的稳健尺度估计量。

Key Insight

可以把四分位数想象成按身高把一排学生分成四个人数相等的组,$Q_1$、$Q_2$、$Q_3$ 就是三个分界点;连同 IQR 一起,五数概括(最小值、$Q_1$、$Q_2$、$Q_3$、最大值)以简洁的方式捕捉了一个分布的形状,且不受异常值影响。样本第 $p$ 分位数的渐近方差为 $p(1-p)/(nf(Q_p)^2)$,其中 $f$ 是概率密度函数,这表明极端处($p$ 接近 $0$ 或 $1$)的分位数估计精度较低,这也解释了为什么极端百分位数需要大得多的样本才能可靠估计。