方法进阶抽样估计与假设检验
总体均值置信区间
也叫:confidence interval for population mean
用样本均值加减置信因子乘标准误,算出一个区间。
核心讲解
总体均值置信区间的一般公式是:点估计量 ± 置信因子 × 标准误。其中置信因子的取值取决于总体分布与置信水平1−α。
具体用哪种分布,要看总体方差是否已知。总体方差已知时,用标准正态分布的z分位数;总体方差未知时,用样本方差代替总体方差,标准化后的量不再服从正态分布而是服从学生t分布,改用自由度为n−1的t分位数。
有两个细节容易错。一是分位数取α/2而不是α;二是标准误是样本标准差除以根号n,而不是样本标准差本身。当t分布自由度变大时它趋近正态分布,所以n≥30时可用标准正态分位数近似。
例如样本容量41、样本均值19.0、样本标准差6.6,求95%置信区间:方差未知但n>30,取z约等于1.96,标准误为6.6/√41约等于1.03,代入得19±1.96×1.03,即约[16.98,21.02]。
费曼版:用大白话再讲一遍
要报出“这群人的平均身高”,你先量一批人算出平均值,再从分布表里查一个系数,乘上“估计的误差幅度”,往两边各让出这么多。平均值减掉一段到加上一段,中间那段就是你有把握覆盖真值的范围。
要点
- 公式:点估计量 ± 置信因子 × 标准误。
- 总体方差已知用z分位数,未知用t分位数(自由度n−1)。
- 分位数取α/2,标准误为 s/√n。
- n≥30时t分布接近正态,可用z分位数近似。
常见误区
- 把样本标准差当成标准误,忘记除以根号n。
- 分位数误取α而不是α/2。
- 总体方差未知时仍用z分位数,而没有改用t分位数。
编者注
- 补充置信区间公式中的精度项是标准误,等于样本标准差除以根号n;原书例题11.2的算式疑为漏写这一步,详见待人工确认框。