知识卡片登录注册
概念高级新:决策与认知

大数据与研究者选择权

研究者可过滤式选有利统计;变量越多虚假相关增长快于信号。

核心讲解

作者的核心观察:研究人员手里的免费选择权在于他能够挑选任何能够证实其观点,或展现出良好结果的统计数据。Simmons, Nelson & Simonsohn (2011)证明"研究者自由度"(p值操纵)会使假阳性率大幅上升。Calude & Longo (2017)证明随着数据量增大,伪相关必然出现,且增长快于真实相关。作者的核心主张是:大数据让研究者可以更容易地找到想要的结论。当然,预注册、多重检验校正与外部验证可以抑制这种选择。但作者的核心主张是:研究者有免费选择权——过滤式选有利统计。

费曼版:用大白话再讲一遍

就像一个人在沙滩上找沙子:他可以找他想要的颜色的沙子,忽略其他颜色。大数据就是沙滩,研究者就是找沙子的人——他可以找他想要的结论。

要点

  • 研究者可以挑选能证实观点的统计数据。
  • p值操纵使假阳性率大幅上升。
  • 数据越多,伪相关越多。
  • 边界:预注册、多重检验校正可抑制。

常见误区

  • 以为"大数据=客观"——研究者可以过滤式选择。
  • 以为"统计显著=真实"——可能是p值操纵。

编者注

  • 无。

多方视角

作者的看法

大数据让研究者可以更容易地找到想要的结论。

不同的看法

  • 预注册、多重检验校正与外部验证可以抑制这种选择。

支持作者的理由

  • 再现性危机的大规模复现研究(Open Science Collaboration 2015)支持。

留给你的问题

你看到的"研究表明",有多少是研究者过滤出来的?

邀请你加入学习

今天的免费浏览次数用完了,加入学习后可以看全部内容。

想真正学会?

加入学习后可以看全部卡片,按路线学习,每张卡都有自测题,系统按遗忘规律安排复习。

一起看