方法进阶抽样估计与假设检验
分层抽样
也叫:Stratified Random Sampling
先把总体分层,再在每层内简单随机抽样并汇总。
核心讲解
分层抽样分两步:第一步把总体按某种特征分成不同类别,也就是“层”;第二步在每一层内部进行简单随机抽样,最后按各层的权重把结果汇总成样本。例如调查中国人身高,先按东北、西北、西南、东南分层,再让各层按人口比例抽取,合成1000万人的样本。
它的优势在于避免简单随机抽样可能出现的极端巧合。若纯随机抽1000万人里竟有700万来自北方,估计就会严重偏差;分层后各区域按比例入样,样本结构更接近总体的真实构成。
因此分层抽样通常能减小抽样误差、提高估计精度,代价是需要事先掌握总体的分层信息。它与简单随机抽样的根本差别,就在于是否先用已知信息对总体分类。
费曼版:用大白话再讲一遍
调查全校学生身高,与其随手抽,不如先在每个年级里按人数比例各抽一部分,再把各年级的结果拼起来。这样无论高年级还是低年级都不会被漏掉或多抽,拼出来的样本更像整个学校的样子。
要点
- 第一步按特征把总体分层,第二步在层内简单随机抽样。
- 各层按权重汇总,样本结构更接近总体。
- 优点是可以减小抽样误差、提高精度。
- 与简单随机抽样的核心差别是“是否先用已知信息分层”。
常见误区
- 以为分层抽样就是简单随机抽样,忽略“先分类”这一步。
- 以为各层抽取同样的人数,忽略应按各层权重分配。
- 认为分层一定增加工作量就否定它,忽略其精度收益。