← 最新论文
💬 NLP

The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

本文揭示了一种“基准错觉”,即经过剪枝的大型语言模型在多项选择评估中表现得看似胜任,却在开放式生成任务中失败,因为剪枝是降低了正确答案的权重而非将其抹除,这表明压缩后的模型必须通过其生成能力而非仅仅是识别能力来进行测试。

原作者: Rui Wen, Lu Sun, Jiayang Liu, Zesheng Xu, Tianshuo Cong, Zheng Li

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Rui Wen, Lu Sun, Jiayang Liu, Zesheng Xu, Tianshuo Cong, Zheng Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位才华横溢、博学多才的图书管理员(一个大型语言模型),他几乎知道任何问题的答案。为了节省成本和空间,你决定对图书馆进行“修剪”。你移除了大量的书籍和书架,只保留了最核心的部分。

这篇研究你所询问的论文,调查了在测试这个缩减后的图书馆时会发生什么。

“多选题幻觉”

这里有一个陷阱:当你向图书管理员提问时,你可以通过两种方式测试他们:

  1. 开放式问题: 你问:“谁发现了亚速尔群岛?”然后等待他们凭记忆说出答案。
  2. 多选题测试: 你问:“谁发现了亚速尔群岛?A) 1427年,B) 1500年,C) 1600年,D) 1700年。”

论文发现了一个令人惊讶的“幻觉”。修剪之后,图书管理员在“开放式问题”上经常失败。他们可能会说:“我想是在15世纪,”这既模糊又不准确。但如果给予他们“多选题测试”,他们能轻松通关。他们会立即指出“1427年”并答对。

标准的基准测试(用于评估 AI 的测试)通常依赖于这种多选题格式。这创造了一种虚假的安全感。测试显示:“你的图书馆依然完美无缺!”但实际上,图书管理员已经失去了在没有帮助的情况下进行回忆的能力。他们仍然可以识别答案(如果展示给他们看),但无法在没有提示的情况下生成答案。

“降级”与“抹除”理论

作者提出了一个关键问题:修剪是抹除了知识(图书管理员完全忘记了这个事实),还是仅仅降级了知识(图书管理员仍然知道这个事实,但它不再是他们的首选答案)?

他们发现,这主要是降级

把图书管理员的思想想象成一个挤满了想法的房间。修剪之前,正确的答案就站在门口,向你挥手。修剪之后,正确的答案仍然在房间里,但它被推到了第三或第四排。

  • 贪婪解码(默认设置): 图书管理员只看站在门口的人。既然正确答案现在在第三排,图书管理员就会选择站在门口的错误的人。
  • 多选题: 你递给图书管理员一份房间里的人员名单。即使正确的人在第三排,图书管理员仍然能在名单中看到他们并选中他们。

如何修复“降级”

由于知识并未被抹除,只是被推后了,论文表明你通常可以通过一点小小的帮助找回答案:

  • 扩大搜索范围: 不要只看门口(贪婪解码),如果你告诉图书管理员去看房间里的前 5 个人(束搜索/Beam Search)或者进行几次尝试(采样/Sampling),他们就能再次找到正确答案。
  • 一个小提示: 如果你给图书管理员一个如何回答类似问题的例子(一个“上下文内”示例),这有助于他们将正确的答案重新推回队伍的最前面。

难点所在

这种“降级”效应经常发生,尤其是在模型规模较大且该模型擅长的语言中。然而,论文指出,对于较小的模型或非常困难的语言,修剪有时确实会抹除知识。在这种情况下,即使你把名单展示给图书管理员看,他们也找不到答案,因为知识已经消失了。

核心结论

这篇论文警告我们,在评价压缩后的 AI 模型时,不要过度信任“多选题”的分数。一个模型在给你提供选项的测试中可能表现完美,但在真实用户直接提问时却可能表现得一败涂地。要了解一个压缩后的模型是否真正有用,我们需要测试它能自主生成什么,而不仅仅是当我们将答案举在它面前时,它能识别出什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →