概念进阶抽样估计与假设检验业绩呈现标准GIPS
样本选择偏误
也叫:Sample Selection Bias、幸存者偏差、Survivorship bias
因样本选取方式不当导致结论系统偏离,典型为幸存者偏差。
核心讲解
样本选择偏误是投资过程中最常见的一种抽样偏误,指样本的选取过程本身存在问题,使样本不能代表总体,从而系统性高估或低估真实情况。问题不在数据分析,而在“一开始就选错了对象”。
最典型的表现是幸存者偏差。有研究统计一段时期内所有基金的历史业绩发现,现存基金看起来收益高于普通投资者,但那是因为被关停的、业绩差的基金没有算进去;若把清盘的基金也纳入统计,基金整体平均收益其实更低。
它与数据挖掘偏误的区别在于成因:数据挖掘偏误是“挖得太多、碰巧显著”,样本选择偏误是“样本一开始就没选全”。识别它的要害是追问一句——我的样本是不是漏掉了那些因为失败而消失的对象。
费曼版:用大白话再讲一遍
想知道学游泳的人里有多少能学会,你只问了游泳池里还在游的人,当然个个都会。那些因为学不会而早就放弃的人不在池子里,所以你会高估学会的比例。漏掉失败者,结论就会偏。
要点
- 样本选择偏误指样本选取本身不能代表总体。
- 典型表现是幸存者偏差,剔除了已消失的失败对象。
- 会系统性高估或低估真实情况。
- 与数据挖掘偏误、抽样误差的成因都不同。
常见误区
- 以为只要计算准确就没有偏误,忽略样本从选取起就偏了。
- 只把幸存者偏差当成基金宣传问题,看不出它是抽样偏误。
- 把它与数据挖掘偏误混为一谈,忽略两者成因不同。