随机样本

统计与概率

suí jī yàng běn

随机样本是总体的一个子集,其中每个成员被选中的机会都相等。

Definition

随机样本意味着一个群体中的每个成员都有相等且公平的机会被选入研究,就像从帽子里抽签一样。形式上,简单随机样本(SRS)是这样一种样本:容量为 $n$ 的每一种可能样本都有相等的被选中概率,这能减少偏差,并确保样本统计量是总体参数的有效估计量。在容量为 $N$ 的有限总体中,容量为 $n$ 的每个子集被选为样本的概率都是 $1/\binom{N}{n}$;在独立同分布假设下,样本统计量是无偏估计量,中心极限定理也适用,从而支持基于正态分布的推断。

Example

一位教师把每个学生的名字写在纸条上,混合后抽出 $10$ 个名字进行调查,这就是在使用随机样本。一所学校可能给它的 $800$ 名学生每人编一个从 $1$ 到 $800$ 的号码,然后用随机数生成器抽取 $80$ 个号码,组成一个用于学习习惯研究的简单随机样本。分层随机抽样将总体划分为 $H$ 层,并从每层中抽取容量为 $n_h$ 的简单随机样本;当层内方差相对于层间方差较小时,分层估计量的方差小于简单随机抽样的方差。

Key Insight

随机选取是避免偏差的最佳方法:当选取是随机的,样本就很可能公平地反映整个总体。其他方法还包括分层抽样(先划分子群)、整群抽样和系统抽样,各自在成本、精度和可行性上存在权衡。调查抽样理论(Cochran, 1977)将这些思想扩展到具有不等概率的复杂设计中,需要在估计中使用设计权重以保持无偏性。