← 最新论文
💬 NLP

ABCD: All Biases Come Disguised

该论文提出了一种通过统一无序标签并结合句子相似度模型来评估大语言模型的多项选择题评估协议,有效消除了位置、标签及提示分布等偏见,在显著降低答案排列方差的同时仅轻微牺牲了模型性能,从而更真实地反映了模型的推理能力。

原作者: Mateusz Nowak, Xavier Cadet, Peter Chin

发布于 2026-02-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Mateusz Nowak, Xavier Cadet, Peter Chin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM)做一场“体检”,目的是发现它们是不是在作弊,而不是真的在思考

想象一下,你正在给一群学生(AI 模型)做一场多项选择题考试。传统的考试方式是这样的:

  • 题目后面跟着 A、B、C、D 四个选项。
  • 学生只需要在答题卡上涂黑一个字母(比如涂"C")。
  • 老师只看那个字母对不对,不管学生是怎么想的。

这篇论文发现了一个大问题:
很多聪明的 AI 学生并没有真正读懂题目,它们学会了“走捷径”:

  1. 位置依赖:它们发现正确答案经常藏在"C"的位置,所以不管题目问什么,它们都选 C。
  2. 标签依赖:它们发现"A"看起来像正确答案,或者"D"看起来像错误答案,于是它们根据字母本身的“气质”来猜。
  3. 小抄依赖(少样本偏见):如果在考试前给了几个例题(Few-shot),例题里正确答案大多是"B",那么 AI 就会觉得“哦,这次考试肯定也是选 B 多”,于是它就开始疯狂选 B,哪怕题目完全没看懂。

这就好比学生不是在做题,而是在猜出题人的心理,或者在数数(比如数一下前面几个题选了什么,就跟着选什么)。

论文做了什么?(核心方案)

作者们设计了一套新的“考试规则”,叫 M&D 协议(Matched-and-Dashed,匹配与虚线法),并造了一个叫 NonsenseQA 的“假考题”来测试 AI。

1. 造了一个“无意义”的考场 (NonsenseQA)

他们给 AI 出了一套由随机乱码组成的题目。

  • 题目:“如果紫色的香蕉在星期二跳舞,那么答案是什么?”
  • 选项:A. 苹果 B. 石头 C. 云朵 D. 桌子
  • 真相:这道题毫无逻辑,正确答案是随机定的。
  • 目的:如果 AI 在这种乱码题上还能考出 90 分,那它肯定不是靠逻辑,而是靠作弊(比如它发现所有题目的正确答案都在"D"的位置,或者它发现少样本例题里全是"D")。

结果很惊人:在旧规则下,有些 AI 在这种乱码题上能考到 95% 以上!而在新规则下,它们的分数瞬间跌到了 25%(也就是纯瞎猜的水平)。这证明它们之前确实是在作弊。

2. 新的考试规则 (M&D 协议)

为了堵住这些作弊漏洞,作者们改了两条规则:

  • 规则一:把选项标签换成“虚线”

    • 旧规则:A. 苹果,B. 石头...(AI 会盯着 A、B、C、D 看)。
    • 新规则:- 苹果,- 石头,- 云朵,- 桌子...(所有选项前面都是同样的短横线)。
    • 比喻:就像把试卷上的"A、B、C、D"都擦掉了,换成了四个一模一样的空位。这样 AI 就没法通过“选 C"或者“选 A"来作弊了。
  • 规则二:不许只填字母,要写整句话

    • 旧规则:AI 只要输出"C"。
    • 新规则:AI 必须输出“答案是:石头”。
    • 比喻:以前学生只要涂个卡,现在必须写小作文解释为什么选这个。如果 AI 还是想靠“数数”或者“猜位置”,它就得把整句话写出来,这就很难再钻空子了。
  • 规则三:用“语义相似度”来打分

    • 因为 AI 写的是整句话,可能不会完全照抄选项。比如选项是“石头”,AI 写的是“一块大石头”。
    • 以前老师(评分系统)会直接判错。
    • 现在,老师用一种智能翻译器(语义相似度模型)来比对:虽然字不一样,但意思一样,所以算对!

实验结果怎么样?

作者用这套新规则测试了 13 种不同的 AI 模型(包括 Llama, Qwen, Gemma 等)和 5 个著名的考试榜单。

  • 更诚实了:AI 在乱码题上的分数大幅下降,说明它们不再靠“猜位置”或“看少样本小抄”来蒙混过关了。
  • 更稳定了:以前把正确答案的位置打乱(比如把 C 换成 A),AI 的分数就会剧烈波动。现在用新规则,不管怎么打乱,AI 的分数都很稳定。
  • 分数没怎么掉:虽然 AI 不能作弊了,但在真正的难题(如科学推理、常识问答)上,它们的分数只下降了很少一点点。这说明它们真的会做题,只是以前被“作弊分”掩盖了。

总结与比喻

如果把 AI 比作一个学生:

  • 以前:这个学生很聪明,但他是个“投机取巧”的学霸。考试时,他不看题,只看选项的排列顺序,或者看前面几道题的答案分布,然后就能蒙对 90% 的题。老师以为他全都会,其实他根本不懂。
  • 现在:老师换了个考法。把选项的字母都涂黑,强迫学生写出完整的答案句子,并且用智能系统来理解句子的意思。
  • 结果:那个“投机取巧”的学生瞬间原形毕露,乱码题直接不及格。而那些真正有实力的学生,虽然分数稍微降了一点(因为不能蒙了),但排名更真实了,大家能看出谁是真的懂,谁是在装懂。

这篇论文的意义在于:
它告诉我们,现在的 AI 评估标准(多选题)有很多漏洞,让 AI 看起来比实际更聪明。作者提出了一套简单、低成本的新标准,能帮我们要去伪存真,更准确地评估 AI 到底有没有真正的推理能力,而不是只会“猜题”。这对于未来让 AI 在医疗、法律等高风险领域做决策非常重要——我们不想让 AI 靠“猜”来救命。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →