知识卡片登录注册
概念进阶抽样估计与假设检验

数据挖掘偏误

也叫:Data-mining Bias

过度挖掘数据只得到统计显著、无法预测未来的结论。

核心讲解

数据挖掘本意是用计算机从海量数据中寻找规律,但“过度挖掘”就会产生数据挖掘偏误:得到的结论只是在样本里统计显著,却不能推广到未来,也无法用于预测。

典型情形是“碰巧显著”。分析师在50个自变量中筛选影响股票收益率的因子,若把显著性水平设为10%,光靠概率也会挑出约5个在统计上“显著”的变量;用这5个去预测未来毫无意义。这就像守株待兔,偶然捡到一只撞死的兔子,不代表天天守在树下都能捡到。

避免的方法是检查结论背后有没有经济理论支持:只有统计显著、缺乏经济逻辑的发现不能当作规律使用。它属于抽样偏误的一种,容易与样本选择偏误混淆。

费曼版:用大白话再讲一遍

把一大堆毫无关系的数据反复翻找,总能凑出一些“看起来很有规律”的巧合。就像连抛硬币,也总会出现一串连续正面。发现巧合不等于找到规律,关键要看它背后有没有说得通的道理。

要点

  • 过度挖掘数据会得到仅统计显著、无法预测未来的结论。
  • 显著性水平本身会随机“选中”约5%的变量。
  • 避免方法是看结论是否有经济理论支持。
  • 它属于抽样偏误的一种。

常见误区

  • 把统计显著直接当成有预测能力。
  • 以为数据越多、挖掘越深,找到的规律就越可靠。
  • 混淆数据挖掘偏误与样本选择偏误的成因。

邀请你加入学习

今天的免费浏览次数用完了,加入学习后可以看全部内容。

想真正学会?

加入学习后可以看全部卡片,按路线学习,每张卡都有自测题,系统按遗忘规律安排复习。

一起看