← 最新论文
📊 statistics

The Judge Knows When It Knows: Calibrated Abstention for LLM-Based A/B-Test Prediction

本研究表明,尽管多模态大语言模型由于存在对不可靠标签的共同偏差,无法仅凭截图可靠地预测真实的 A/B 测试结果,但通过校准其预测以识别并放弃不确定案例,它们可以实现具有意义的准确率,这一局限性反映了人类专家尽管具有高度的评分者间一致性,却仍无法超越随机水平的现象。

原作者: Tyler Dooskin, Squoosh Technical Staff

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Tyler Dooskin, Squoosh Technical Staff

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜题的侦探:“这两个嫌疑人中,谁才是罪犯?”在网站的世界里,“嫌疑人”是两个略有不同的页面版本,而“罪犯”则是那个能让更多人购买商品或注册账号的版本。这被称为 A/B 测试。通常情况下,为了找出赢家,你必须等待并观察真实的人们与网站互动数天或数周。但最近,一种新型的侦探出现了:人工智能。大家都在问一个大问题:“人工智能能否仅仅通过看一张这两个网站的照片,就能瞬间告诉我们哪一个会胜出,从而为我们节省所有的等待时间?”

要理解这篇论文,你需要了解一些关于我们如何衡量科学中“好坏”的标准。首先,要区分是“靠运气变对”还是“靠实力变对”。如果你在抛硬币时猜“正面”,你有 50% 的概率只是靠运气猜对。如果一名侦探声称自己是天才,但实际正确率只有 51%,那么他其实并没有表现出任何特别之处。科学家使用一种特殊的评分指标——“科恩的 Kappa 值”(我们可以称之为“技能得分”)来剔除运气成分,看看这位侦探是否真的动了脑子。其次,是“共同偏见”的问题。想象一下,一位老师和一位学生都在同一个小镇长大。他们可能对所有事情都意见一致,并不是因为学生聪明,而是因为他们都从父母那里学到了同样的错误知识。如果人工智能和创建测试数据的人都学习了相同的“民间智慧”,他们可能会对答案达成一致,但这并不意味着人工智能可以预测未来。

这篇论文来自一个名为 Squoosh 的团队,他们非常诚实、非常严谨地报告了尝试回答这个大问题的过程。他们不仅仅是让 AI 去猜测;他们设置了一个陷阱。他们在开始之前就锁定了规则,就像科学家在烹饪前写下食谱一样,这样他们就不能为了让 AI 看起来表现更好而中途更改规则。他们使用了一个庞大的真实世界网站测试库,来观察人工智能是否真的能预测赢家。

转折点在于:人工智能在其主要任务上的表现基本是失败的。当团队要求 AI 每次都观察 330 个真实的测试并选出一个赢家时,它的表现几乎只比随机猜测好一点点。事实上,AI 与那些“不可靠”的测试(即结果不明确的测试)达成共识的情况,似乎比与“可靠”测试达成共识的情况还要多。事实证明,人工智能和创建测试数据的人都在重复关于“什么样网站才算好”的陈旧迷思,而不是在真正预测结果。即使使用更聪明、更昂贵的 AI,情况也没有好转;它依然表现糟糕。这篇论文明确排除了这样一个观点:即我们不能仅仅通过“购买”更好的 AI 或编写更好的提示词来解决问题。那个仅凭截图就能预测网站赢家的“魔力水晶球”?并不存在。

然而,论文并没有说 AI 是没用的。它说 AI 是一个“诚实的”侦探。团队发现了一个特别的技巧:如果他们告诉 AI,“只有当你绝对确定时才进行猜测,否则请说‘我不知道’”,那么在 AI 确实开口说话的时候,它的表现会变得非常出色。当 AI 内部的“评审团”对某个答案达成强烈共识时,它在可靠测试中的正确率达到了 31%。这听起来很低,但请记住,现实中的人类专家(拥有多年经验的人)平均也只能在 29% 的情况下猜对。AI 不是超级天才;它只是一个知道什么时候在瞎猜、什么时候在认真回答的工具。

最重要的发现是关于信任的。论文表明,当一群 AI 彼此达成一致时,并不意味着它们是对的;这往往意味着它们都在重复同一种共同偏见。这就像一个陪审团,如果所有成员都是亲戚,他们都会投出相同的票,但这并不代表判决是正确的。论文证明了这种“共同偏见”在人类身上同样存在。当他们询问 15 位真实的专家去猜测赢家时,专家们彼此之间的意见高度一致,但他们出错的频率与 AI 一样高。

那么,最终的结论是什么?论文得出结论,我们无法构建一个能以 100% 确定性预测网站赢家的工具。相反,最好的工具是一个“经过校准的筛选工具”。它是一个能够说出“我有信心这个会赢”或者“我不确定,别问我”的系统。它对自己的局限性是诚实的。论文还表明,你不需要一个超级昂贵、庞大的 AI 来做这件事;如果你使用“诚实”技巧,一个更小、更便宜的版本同样有效。真正的价值不在于每次都得到答案,而在于清楚地知道哪些时候你不应该相信那个答案。论文最后发布了所有的数据、失败的实验以及规则,以此证明:有时,最重要的发现是承认那个魔术并不奏效,但一个非常谨慎、非常诚实的版本或许确实有用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →