概念进阶经济思想与学派新:数据探索
数据挖掘
也叫:数据探索、过度配适
在同一批历史数据上反复试,总能试出一条纯靠运气的“规律”。
核心讲解
数据挖掘,作者又称数据探索或过度配适,指的是这样一种做法:在历史数据上反复尝试成百上千条规则、参数和组合,总能挑出一条恰好对过去数据拟合得特别漂亮的法则。问题在于,只要你试的次数足够多,即使数据完全是随机噪声,也必然会有某几条组合碰巧和历史走势对上——这正是多重假设检验中的假发现书外。作者把它描述为“在一堆可能行得通的法则里找幸存者”。这条法则对过去解释得天衣无缝,却对未来毫无预测力。现实中,券商研报和量化回测里堆满了这类“历史上每年都赚”的模型,本质都是在同一批数据上试出来的幸存者。要避免它,就得在看数据之前先形成假设,并用样本外的数据检验,而不是先把数据榨干再编故事。
费曼版:用大白话再讲一遍
你让一只猴子在钢琴上乱弹,录上几小时,再从中剪出一段最好听的旋律,对外说这是“猴子的作曲”。旋律是真的好听,但它是事后挑出来的,下一次猴子再弹不出同样的。
要点
- 反复试足够多的规则,必能拟合出漂亮的历史法则。
- 这是多重检验的假阳性,不等于真规律。
- 对过去拟合越好,对未来预测往往越差。
- 应先有假设再检验,而非先榨数据再编故事。
常见误区
- 把回测拟合度高当成策略有效的证据。
- 在同一批数据上反复试参数。
- 用样本内拟合去外推未来表现。
编者注
- 补充怀特2000年的“现实检验”理论指出,多重假设检验若不校正假发现率,必然产生数据窥探偏差书外。