定性数据

统计与概率

dìng xìng shù jù

定性数据由描述特征的类别或标签组成,而非数值测量。

Definition

定性数据是用文字或类别而非数字描述的信息,回答的是"哪一种?"或"哪个组?"这样的问题。它将观测值分类到没有固有数值的组别中,可以是名义型(无顺序,例如眼睛颜色)或顺序型(有序类别,例如班级排名)。形式上,定性(类别型)变量取值于一个有限的类别集合:名义型变量用卡方检验和列联表分析,顺序型变量则可以使用非参数检验(曼-惠特尼检验、克鲁斯卡尔-沃利斯检验)或有序逻辑回归。

Example

学生最喜欢的学校科目(数学、科学、艺术、阅读)或停车场里汽车的颜色都是定性数据。血型(A、B、AB、O)是名义型定性数据,而"非常不同意"到"非常同意"量表上的调查回答则是顺序型定性数据。卡方拟合优度检验将观察到的类别频数与原假设下的期望频数进行比较:一个骰子掷 $60$ 次,每一面的期望频数为 $10$,检验统计量为 $\chi^2 = \sum \frac{(O-E)^2}{E}$。

Key Insight

定性数据告诉你类型或类别,而定量数据告诉你数量,二者对不同的问题都很有用。顺序数据有顺序但各级别之间的间隔不一定相等,因此把它当作定量数据处理(例如把"非常同意 = 5"取平均)在统计上是有争议的。在回归中将类别变量编码为虚拟(指示)变量,使得定性预测变量能够纳入定量模型,这正是方差分析和逻辑回归的基础。