知识卡片登录注册
概念进阶抽样估计与假设检验业绩呈现标准GIPS

样本选择偏误

也叫:Sample Selection Bias、幸存者偏差、Survivorship bias

因样本选取方式不当导致结论系统偏离,典型为幸存者偏差。

核心讲解

样本选择偏误是投资过程中最常见的一种抽样偏误,指样本的选取过程本身存在问题,使样本不能代表总体,从而系统性高估或低估真实情况。问题不在数据分析,而在“一开始就选错了对象”。

最典型的表现是幸存者偏差。有研究统计一段时期内所有基金的历史业绩发现,现存基金看起来收益高于普通投资者,但那是因为被关停的、业绩差的基金没有算进去;若把清盘的基金也纳入统计,基金整体平均收益其实更低。

它与数据挖掘偏误的区别在于成因:数据挖掘偏误是“挖得太多、碰巧显著”,样本选择偏误是“样本一开始就没选全”。识别它的要害是追问一句——我的样本是不是漏掉了那些因为失败而消失的对象。

费曼版:用大白话再讲一遍

想知道学游泳的人里有多少能学会,你只问了游泳池里还在游的人,当然个个都会。那些因为学不会而早就放弃的人不在池子里,所以你会高估学会的比例。漏掉失败者,结论就会偏。

要点

  • 样本选择偏误指样本选取本身不能代表总体。
  • 典型表现是幸存者偏差,剔除了已消失的失败对象。
  • 会系统性高估或低估真实情况。
  • 与数据挖掘偏误、抽样误差的成因都不同。

常见误区

  • 以为只要计算准确就没有偏误,忽略样本从选取起就偏了。
  • 只把幸存者偏差当成基金宣传问题,看不出它是抽样偏误。
  • 把它与数据挖掘偏误混为一谈,忽略两者成因不同。

邀请你加入学习

今天的免费浏览次数用完了,加入学习后可以看全部内容。

想真正学会?

加入学习后可以看全部卡片,按路线学习,每张卡都有自测题,系统按遗忘规律安排复习。

一起看