相对频数

统计与概率

xiāng duì pín shù

相对频数是某个值在一组数据中出现的比例,用占总数的分数或百分比表示。

Formula

\text{Relative Frequency} = \dfrac{\text{frequency}}{\text{total number of values}}

Definition

相对频数是一个分数或百分比,告诉你某件事发生的次数相对于你观察总次数的比例,即某个值或类别的频数与观测总数之比:相对频数 $= f_i/n$。相对频数之和为 $1$,可以用百分比表示,并且可以在不同大小的数据集之间直接比较。形式上,$f_i/n$ 是第 $i$ 个类别的经验概率,是对底层概率的一种非参数估计,经验分布函数 $F_n(x) = \frac{1}{n}\sum \mathbb{1}(X_i \le x)$ 根据格里文科-坎特利定理一致收敛到真实的累积分布函数 $F(x)$。

Example

如果你抛硬币 $20$ 次,得到正面 $12$ 次,正面的相对频数是 $12/20 = 0.6$,即 $60\%$。在一个 $25$ 人的班级里,$10$ 人偏爱科学,$8$ 人偏爱数学,$7$ 人偏爱英语,相对频数为:科学 $= 10/25 = 0.40$,数学 $= 8/25 = 0.32$,英语 $= 7/25 = 0.28$,总和为 $1.00$。德沃雷茨基-基弗-沃尔福维茨不等式给出 $P(\sup|F_n(x)-F(x)| > \epsilon) \le 2e^{-2n\epsilon^2}$,为经验累积分布函数提供了一个带有明确概率保证的置信带。

Key Insight

在比较不同规模的群体时,相对频数很有用:与"$200$ 人中有 $30$ 人偏爱它"相比,说"$60\%$ 偏爱选项 A"更有意义。它是概率的经验估计,根据大数定律,随着 $n$ 增大,它会收敛到真实概率;这一思路是自助法(bootstrap)重抽样的基础,将经验分布视为对真实分布的近似,并从中重新抽样以估计不确定性。