Stop Using the Wilcoxon Test: Myth, Misconception and Misuse in IR Research
本文认为,在信息检索基准测试中广泛使用 Wilcoxon 符号秩检验是基于一种具有误导性的叙事,且在方法论上站不住脚,因为它经常无法控制第一类错误率,因此应当被弃用,转而采用更可靠的统计方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位烹饪比赛的评委。你有两位厨师,厨师 X 和厨师 Y,你要求他们烹饪同样的 50 道菜。你想知道:厨师 X 真的更优秀,还是仅仅因为分到的特定食材运气好?
为了回答这个问题,信息检索(搜索引擎领域)的研究人员几十年来一直使用一种特定的数学工具,称为威尔科克森检验(Wilcoxon test)。教科书告诉他们,当数据看起来杂乱无章或怪异时,这个工具是“安全、可靠的备用方案”。他们曾认为它是统计学中的“安全带”。
本文论证道:这条安全带实际上是一个陷阱。 作者朱利安·乌尔巴诺(Julián Urbano)表示,我们应该立即停止使用威尔科克森检验,因为它不仅会失效,还会主动欺骗我们,尤其是在搜索引擎领域。
以下是用简单类比对本文论点的拆解:
1. 巨大的神话:“非参数意味着没有规则”
神话: 教科书教导研究人员,威尔科克森检验是“非参数”的,这听起来像是“它没有规则”或“它能处理任何类型的数据”。人们心想:“如果我的数据不是完美的平滑钟形曲线,我就用威尔科克森检验,因为它是‘随意’选项。”
现实: 本文揭示,威尔科克森检验并非随意选项。它有一条非常严格、隐蔽的规则:对称性。
- 类比: 想象一个跷跷板。威尔科克森检验只有在跷跷板完美平衡时才有效。如果一侧的重量略重于另一侧(不对称),检验就会失效。
- 问题: 在搜索引擎(信息检索数据)的现实世界中,数据几乎从未完美平衡。它是倾斜的。在倾斜的数据上使用威尔科克森检验,研究人员本质上是在试图平衡一个已经倾斜的跷跷板。结果呢?即使没有差异,检验也会大喊“存在差异!”
2. 误解:"T 检验需要完美数据”
误解: 人们被告知,标准的学生 t 检验(Student's t-test)(即“普通”检验)只有在数据是完美、平滑的钟形曲线时才有效。由于搜索引擎的评分通常是锯齿状或离散的,人们认为:“哦,t 检验会失败,所以我必须使用威尔科克森检验。”
现实: t 检验实际上比人们想象的要坚韧得多。
- 类比: 把 t 检验想象成一辆重型卡车。它设计用于在平滑的高速公路(完美钟形曲线)上行驶,但得益于“中心极限定理”这一原理,它实际上完全能够应对颠簸、崎岖和锯齿状的道路。只要你有足够的数据点(就像行驶了足够长的距离),卡车就能抚平颠簸。
- 发现: 本文表明,即使数据很怪异,t 检验也能保持在道路上并给出正确答案。它不会翻车。
3. 灾难性的误用:为什么威尔科克森检验会失败
本文使用真实的搜索引擎数据进行了数千次计算机模拟,以观察在“杂乱”数据上使用这些检验会发生什么。
- T 检验: 当数据怪异(偏斜、重尾或离散)时,t 检验将其错误率稳定保持在 5%。它是可靠的。
- 威尔科克森检验: 当数据略微倾斜(不对称)时,威尔科克森检验就会失控。
- 类比: 想象一个烟雾探测器,它如此敏感,以至于你只是烤了一片面包它就会报警。在本文的模拟中,随着样本量增大,威尔科克森检验开始大喊“着火了!”(拒绝零假设),即使根本没有火,这种情况也几乎发生了 100%。
- 为什么? 因为它不再检验“谁更好”,而是开始检验“数据是否倾斜”。由于搜索引擎数据几乎总是倾斜的,该检验会错误地宣称存在获胜者,而实际上并没有。
4. 结论:停止使用“安全”选项
作者总结道,认为威尔科克森检验是“安全替代方案”的信念是一个危险的谎言。
- T 检验是能够应对现实世界颠簸的坚固卡车。
- 威尔科克森检验是一座脆弱的玻璃屋,一旦风吹(不对称)就会粉碎。
裁决: 本文敦促信息检索社区完全停止使用威尔科克森检验。继续使用它会制造一种虚假的安全感,导致研究人员误以为他们在搜索引擎中发现了改进,而实际上他们发现的只是统计噪声。
简而言之: 所谓的“备用方案”实际上是导致最多事故的方案。是时候让它退役,并坚持使用真正有效的工具:t 检验。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。