连续数据

统计与概率

lián xù shù jù

连续数据可以取某个范围内的任意值,包括小数和分数,例如身高或温度。

Definition

连续数据可以是某个范围内的任意值,包括小数;它是被测量的,而不是被数出来的,并且总能变得更加精确。它可以取实数轴上某个区间(或若干区间的并集)内的任意值,由于可能取值的数量不可数,单个取值的概率为零,因此概率是在区间上计算的。形式上,连续随机变量 $X$ 有一个概率密度函数 $f(x)$,使得 $P(a \le X \le b) = \int_a^b f(x)\,dx$,满足 $f(x) \ge 0$ 且积分总和为 $1$;主要的连续分布包括正态分布、指数分布、均匀分布、贝塔分布、伽马分布和卡方分布,累积分布函数 $F(x) = P(X \le x)$ 是绝对连续的。

Example

一个人的身高可能是 $5.3$ 英尺,或更精确地说是 $5.28$ 英尺,甚至 $5.279$ 英尺;温度、体重和时间都是连续的。一名跑者完成比赛所用的时间可能是 $27.3$ 秒、$27.31$ 秒或 $27.314$ 秒,样本空间是区间 $[0, \infty)$,用直方图展示,并用正态分布或指数分布建模。若 $X \sim \text{Normal}(\mu=0, \sigma=1)$,则 $P(-1 \le X \le 1) = \int_{-1}^{1} \frac{1}{\sqrt{2\pi}} e^{-x^2/2}\,dx$,约等于 $0.6827$,这正是经验法则背后的数值。

Key Insight

连续数据存在于一条没有间隙的数轴上:你总能放大并在任意两个测量值之间找到一个新的值,连续随机变量由概率密度函数(PDF)描述,某个取值范围的概率等于 PDF 曲线在该范围上方的面积。离散分布与连续分布之间的关系(例如二项分布通过中心极限定理收敛到正态分布,几何分布在极限下收敛到指数分布)揭示了概率世界中深刻的联系。