知识卡片登录注册
概念进阶经济思想与学派新:数据探索

数据挖掘

也叫:数据探索、过度配适

在同一批历史数据上反复试,总能试出一条纯靠运气的“规律”。

核心讲解

数据挖掘,作者又称数据探索或过度配适,指的是这样一种做法:在历史数据上反复尝试成百上千条规则、参数和组合,总能挑出一条恰好对过去数据拟合得特别漂亮的法则。问题在于,只要你试的次数足够多,即使数据完全是随机噪声,也必然会有某几条组合碰巧和历史走势对上——这正是多重假设检验中的假发现书外。作者把它描述为“在一堆可能行得通的法则里找幸存者”。这条法则对过去解释得天衣无缝,却对未来毫无预测力。现实中,券商研报和量化回测里堆满了这类“历史上每年都赚”的模型,本质都是在同一批数据上试出来的幸存者。要避免它,就得在看数据之前先形成假设,并用样本外的数据检验,而不是先把数据榨干再编故事。

费曼版:用大白话再讲一遍

你让一只猴子在钢琴上乱弹,录上几小时,再从中剪出一段最好听的旋律,对外说这是“猴子的作曲”。旋律是真的好听,但它是事后挑出来的,下一次猴子再弹不出同样的。

要点

  • 反复试足够多的规则,必能拟合出漂亮的历史法则。
  • 这是多重检验的假阳性,不等于真规律。
  • 对过去拟合越好,对未来预测往往越差。
  • 应先有假设再检验,而非先榨数据再编故事。

常见误区

  • 把回测拟合度高当成策略有效的证据。
  • 在同一批数据上反复试参数。
  • 用样本内拟合去外推未来表现。

编者注

  • 补充怀特2000年的“现实检验”理论指出,多重假设检验若不校正假发现率,必然产生数据窥探偏差书外。

邀请你加入学习

今天的免费浏览次数用完了,加入学习后可以看全部内容。

想真正学会?

加入学习后可以看全部卡片,按路线学习,每张卡都有自测题,系统按遗忘规律安排复习。

一起看