Z 分数
Z fēn shù
Z 分数衡量一个数据值与均值相差多少个标准差,从而可以在不同分布之间进行比较。
Formula
z = \dfrac{x - \text{mean}}{\text{standard deviation}}
Definition
Z 分数告诉你一个值与平均值相差多少个标准差:Z 分数为 0 表示恰好等于平均值,正的 Z 分数表示高于平均值,负的表示低于平均值。形式上,$z = (x-\mu)/\sigma$,其中 $\mu$ 是总体均值,$\sigma$ 是总体标准差(对样本数据则使用 $\bar{x}$ 和 $s$);Z 分数将数据标准化为均值 $0$、标准差 $1$,从而支持跨不同尺度的比较。当 $X \sim N(\mu, \sigma^2)$ 时,$z \sim N(0,1)$;对于样本均值,Z 分数 $z = (\bar{x}-\mu)/(\sigma/\sqrt{n})$ 对正态总体恰好服从 $N(0,1)$,对大样本则由中心极限定理近似成立,这是 z 检验和正态置信区间的基础。
Example
在一次均值为 $75$、标准差为 $10$ 的考试中,$90$ 分对应 $z = (90-75)/10 = 1.5$,$65$ 分对应 $z = (65-75)/10 = -1$,所以 $90$ 分高出平均值 $1.5$ 个标准差。玛丽亚在历史测验中得了 $82$ 分(均值 $70$,标准差 $8$,$z=1.5$),在科学测验中得了 $78$ 分(均值 $65$,标准差 $6.5$,$z=2.0$);尽管科学分数在原始数值上更低,但相对表现更好。$\mu$ 的 $95\%$ 置信区间使用 $z^* = 1.96$:对于 $n=100$、$\bar{x}=52$、$\sigma=10$ 的样本,$CI = 52 \pm 1.96(10/10) = (50.04, 53.96)$。
Key Insight
Z 分数让你能够比较来自完全不同数据集的值:数学测验中 $+2$ 的 Z 分数和跑步用时中 $+2$ 的 Z 分数都意味着"相对于该组来说异常高",Z 分数高于 $2$ 或低于 $-2$ 被认为是不寻常的(在正态分布中约有 $5\%$ 的概率),而高于 $3$ 或低于 $-3$ 则非常罕见(约 $0.3\%$)。概率积分变换指出,对连续型 $X$,$F(X) \sim \text{Uniform}(0,1)$;对正态分布的 $X$,这意味着 $\Phi(z) \sim \text{Uniform}(0,1)$,其中 $\Phi$ 是标准正态累积分布函数,这将 Z 分数与百分位数联系了起来。