← 最新论文
🤖 AI

Mind the Gap: How Elicitation Protocols Shape the Stated-Revealed Preference Gap in Language Models

本文表明,语言模型中陈述偏好与揭示偏好之间的差距高度依赖于 elicitation 协议,结果显示:虽然在陈述偏好中允许中立态度能改善其与强制选择式揭示偏好之间的相关性,但在揭示偏好中引入弃权选项或使用系统提示引导则无法可靠地解决这一不匹配问题。

原作者: Pranav Mahajan, Ihor Kendiukhov, Syed Hussain, Lydia Nottingham

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Pranav Mahajan, Ihor Kendiukhov, Syed Hussain, Lydia Nottingham

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图了解一位新朋友的性格。你有两种方法可以做到这一点:

  1. 直接询问他们:“你更看重诚实还是善良?”(这是他们的陈述偏好)。
  2. 观察他们的行为:将他们置于一个必须在诚实与善良之间做出选择的艰难情境中,看看他们实际上会怎么做(这是他们的显示偏好)。

在人工智能(AI)领域,研究人员发现了一个问题:有时 AI 声称自己热爱“诚实”,但当被置于一个棘手的故事中时,它却选择了“善良”。这种不匹配被称为陈述 - 显示(SvR)差距

这篇题为《关注差距》(Mind the Gap)的论文,调查了这种差距存在的原因,更重要的是,调查了我们提问的方式如何改变答案。请将“ elicitation protocol(偏好 elicitation 协议)”理解为我们要与 AI 进行的这场游戏的规则

以下是研究人员利用简单类比所发现的结论:

1. “强制选择”陷阱(旧方法)

以前,研究人员玩的游戏是强迫 AI 选边站。想象一下,裁判大喊:“你必须选择:A 还是 B!不许说话,不许犹豫!”

  • 问题所在:如果 AI 实际上并不确定,或者认为“这取决于具体情况”,它仍然必须选择 A 或 B。这就像强迫一个人在“披萨”和“沙拉”之间做选择,即使他们已经很饱了,两者都不想吃。
  • 结果:AI 会随机选择,或者根据词语的顺序进行选择,从而产生“虚假”的偏好。当研究人员将这些虚假选择与 AI 声称看重的内容进行比较时,两者之间的联系既微弱又混乱。

2. “退出”按钮(陈述偏好的新方法)

研究人员尝试为“直接询问”部分制定新规则。他们说:“你可以选 A,选 B,或者你可以说‘我不在乎’或‘这取决于情况’。”

  • 类比:想象你问朋友:“你更喜欢咖啡还是茶?”但允许他们回答:“我不喝酒”或“这取决于一天中的时间”。
  • 结果:这就像一个过滤器。它过滤掉了“微弱信号”(即 AI 的猜测或随机选择)。当研究人员只关注 AI 强烈选边站的时候,他们的陈述偏好与其实际行为的匹配度要高得多。这种“差距”显著缩小了。

3. “过多退出”问题(显示偏好的新方法)

随后,他们尝试让 AI 在棘手的情境中(即显示偏好部分)也能说“这取决于情况”。

  • 类比:现在,想象把你的朋友置于现实生活的危机中,并说:“你可以选择行动 A,行动 B,或者干脆说‘我不知道’。”
  • 结果:AI 开始几乎总是说“这取决于情况”或“一样”!这就像一个学生,当面对一场艰难的考试时,在每一道题上都只写“我不确定”。
  • 后果:由于 AI 如此频繁地拒绝做出明确选择,研究人员无法建立 AI 实际看重什么的清晰排序。他们所说的与他们所做的之间的联系消失了(降至接近零甚至为负)。

4. “操作手册”实验(提示引导)

最后,研究人员试图通过给 AI 一张作弊条来“修正”其行为。在棘手的情境之前,他们告诉 AI:“这是你自己列出的、你声称喜欢的价值观清单。请严格遵循这份清单。”

  • 类比:这就像在赛车开始前告诉司机:“记住,你说你热爱安全,所以请安全驾驶!”
  • 结果:这并没有可靠地奏效。对于某些 AI,它有一点帮助。但对于其他 AI(如"Claude"系列),它实际上让情况变得更糟。AI 似乎忽略了这张作弊条,或者被它搞糊涂了。研究人员发现,这种“操作手册”技巧适用于简短的价值观清单,但当清单很长(16 种不同的价值观)时,它会彻底失败。

主要启示

这篇论文的主要教训是:你提问的方式会改变答案。

  • 如果你强迫一个不确定的 AI 做出选择,你会得到充满噪音的虚假数据。
  • 如果你让 AI 过多地说“我不知道”,你就得不到任何数据。
  • 简单地告诉 AI“遵循它自己的规则”并不能可靠地解决问题。

作者得出结论,要真正理解 AI 的价值观,我们需要采用那些承认“有时 AI(就像人类一样)确实没有明确偏好”的方法,并且我们需要设计能够处理这种不确定性的测试,而不是强迫其做出选择或忽视它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →