概念进阶抽样估计与假设检验
数据挖掘偏误
也叫:Data-mining Bias
过度挖掘数据只得到统计显著、无法预测未来的结论。
核心讲解
数据挖掘本意是用计算机从海量数据中寻找规律,但“过度挖掘”就会产生数据挖掘偏误:得到的结论只是在样本里统计显著,却不能推广到未来,也无法用于预测。
典型情形是“碰巧显著”。分析师在50个自变量中筛选影响股票收益率的因子,若把显著性水平设为10%,光靠概率也会挑出约5个在统计上“显著”的变量;用这5个去预测未来毫无意义。这就像守株待兔,偶然捡到一只撞死的兔子,不代表天天守在树下都能捡到。
避免的方法是检查结论背后有没有经济理论支持:只有统计显著、缺乏经济逻辑的发现不能当作规律使用。它属于抽样偏误的一种,容易与样本选择偏误混淆。
费曼版:用大白话再讲一遍
把一大堆毫无关系的数据反复翻找,总能凑出一些“看起来很有规律”的巧合。就像连抛硬币,也总会出现一串连续正面。发现巧合不等于找到规律,关键要看它背后有没有说得通的道理。
要点
- 过度挖掘数据会得到仅统计显著、无法预测未来的结论。
- 显著性水平本身会随机“选中”约5%的变量。
- 避免方法是看结论是否有经济理论支持。
- 它属于抽样偏误的一种。
常见误区
- 把统计显著直接当成有预测能力。
- 以为数据越多、挖掘越深,找到的规律就越可靠。
- 混淆数据挖掘偏误与样本选择偏误的成因。