← 最新论文
💬 NLP

Do Large Language Models Plan Answer Positions? Position Bias in Multiple-Choice Question Generation

本文揭示,大型语言模型在生成多项选择题时因隐藏表征中对答案位置的隐式规划而表现出系统性的位置偏差,并证明激活导向能够有效操控这些内部状态以控制和纠正此类偏差。

原作者: Xuemei Tang, Xufeng Duan, Zhenguang G. Cai

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuemei Tang, Xufeng Duan, Zhenguang G. Cai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在聘请一位机器人厨师来烘烤一批“多项选择题”蛋糕。你告诉机器人:“制作 100 个蛋糕,并确保‘正确答案’这一配料被随机隐藏在 A、B、C 或 D 槽位中,就像一场公平的游戏一样。”

你期望机器人能做到完全随机。但当你品尝这些蛋糕时,你发现了一种模式:机器人 A 总是将正确答案隐藏在 A 槽位;机器人 B 总是将其隐藏在 B 或 C 槽位;机器人 C 如此钟爱 A 槽位,以至于完全忘记了使用 D 槽位。

这篇论文《大型语言模型会规划答案位置吗?》旨在探究为何这些机器人厨师(即大型语言模型,LLMs)在制作测验时会有如此强烈且可预测的习惯。

以下是他们研究发现的拆解,使用了简单的类比:

1. “隐藏的习惯”(问题所在)

研究人员测试了 10 种不同的机器人厨师(LLMs)以及 5 种还能“看”到图片的机器人厨师(视觉语言模型)。他们要求这些机器人在三个不同的“厨房”中制作测验:

  • 知识厨房:通用事实(如历史或数学)。
  • 阅读厨房:基于新闻文章的问题。
  • 视觉厨房:基于图像的问题。

发现:机器人并非随机的。它们存在“位置偏差”。

  • 某些模型(如 Llama)对第一个槽位(A) 情有独钟。
  • 其他模型(如 Gemini)则偏爱中间槽位(B 和 C)
  • 几乎所有人都忽略了最后一个槽位(D)

这就像每位厨师都有一个秘密的“最爱架子”,无论食谱如何规定,他们都会本能地将获胜的饼干放在那里。

2. “水晶球”(调查过程)

核心问题是:机器人仅仅是根据字母 A、B、C、D 进行猜测,还是它在开始撰写选项之前就已经在“规划”答案了?

为了查明真相,研究人员在机器人撰写测验的问题部分(甚至在它写下答案之前)时,深入观察了机器人的大脑(其内部代码)。

发现:他们在机器人的大脑中发现了一个“水晶球”。
即使机器人仅仅是在撰写题干(例如:“法国的首都是什么?”),其内部代码已经“决定”了正确答案将放在哪里。这就像机器人在写下字母"B"之前,就已经在自言自语:“我要把答案放在 B 槽位。”

这表明,这种偏差并非仅仅是表面层的错误,而是在思维过程早期形成的深层隐性规划

3. “遥控器”(解决方案)

既然他们在机器人的大脑中发现了这个“规划”,研究人员便尝试使用“遥控器”来改变机器人的想法。他们使用了一种称为激活调控(Activation Steering) 的技术。

可以将机器人的大脑想象成一条流向特定目的地(例如 A 槽位)的河流。研究人员找到了一种方法,通过建造一个小水坝或使用船桨,将河流稍微推向另一个目的地(例如 B 槽位)。

发现

  • 它奏效了! 通过微调内部代码,他们成功迫使机器人更频繁地选择不同的槽位。
  • 时机至关重要:他们发现,在机器人即将完成问题(即“倒数第二个”时刻)时进行微调,比在完全结束时进行微调要有效得多。这就像在撞墙之前调整方向盘比撞墙之后更容易控制车辆。
  • 权衡取舍:虽然他们可以改变槽位,但有时机器人会感到困惑。它可能会选中正确的槽位,却改变了问题的含义或导致答案错误。这就像强迫机器人在香草模具中烘烤巧克力蛋糕;形状变了,但味道可能会变得怪异。

4. “标签陷阱”(一个惊人的转折)

研究人员还测试了,如果你让机器人在撰写答案时不带 A、B、C、D 这些字母,会发生什么。你可能会认为这会让结果更随机。

发现:这实际上使偏差恶化了。在没有字母引导的情况下,机器人变得更加痴迷于将正确答案放在它们生成的第一个位置。事实证明,A、B、C、D 这些字母实际上有助于机器人保持更平衡的状态,它们就像护栏一样,防止机器人过度偏向左侧。

总结

  • LLMs 并非随机:它们在测验中放置正确答案的位置上,拥有强烈且可预测的习惯。
  • 它们会提前规划:它们在撰写选项之前,很早就已经决定了答案的位置。
  • 我们可以引导它们:我们可以利用内部的“调控”来改变这些习惯,但这是一种微妙的操作,有时会破坏问题的逻辑。
  • 标签有帮助:令人惊讶的是,为选项添加标签(A、B、C、D)有助于减少偏差,而移除它们则会让机器人在选择第一个选项时变得更加固执。

核心结论:如果你使用 AI 生成测试,不能仅仅信任其公平性。它有自己的隐藏偏好,如果你想要真正随机的测验,就需要主动干预,或使用特定的提示词来迫使其打破习惯。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →