概念高级新:决策与认知
大数据与研究者选择权
研究者可过滤式选有利统计;变量越多虚假相关增长快于信号。
核心讲解
作者的核心观察:研究人员手里的免费选择权在于他能够挑选任何能够证实其观点,或展现出良好结果的统计数据。Simmons, Nelson & Simonsohn (2011)证明"研究者自由度"(p值操纵)会使假阳性率大幅上升。Calude & Longo (2017)证明随着数据量增大,伪相关必然出现,且增长快于真实相关。作者的核心主张是:大数据让研究者可以更容易地找到想要的结论。当然,预注册、多重检验校正与外部验证可以抑制这种选择。但作者的核心主张是:研究者有免费选择权——过滤式选有利统计。
费曼版:用大白话再讲一遍
就像一个人在沙滩上找沙子:他可以找他想要的颜色的沙子,忽略其他颜色。大数据就是沙滩,研究者就是找沙子的人——他可以找他想要的结论。
要点
- 研究者可以挑选能证实观点的统计数据。
- p值操纵使假阳性率大幅上升。
- 数据越多,伪相关越多。
- 边界:预注册、多重检验校正可抑制。
常见误区
- 以为"大数据=客观"——研究者可以过滤式选择。
- 以为"统计显著=真实"——可能是p值操纵。
编者注
- 无。
多方视角
作者的看法
大数据让研究者可以更容易地找到想要的结论。
不同的看法
- 预注册、多重检验校正与外部验证可以抑制这种选择。
支持作者的理由
- 再现性危机的大规模复现研究(Open Science Collaboration 2015)支持。
留给你的问题
你看到的"研究表明",有多少是研究者过滤出来的?