← 最新论文
🤖 machine learning

Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness

本文识别并纠正了跨模型价值比较中的两个关键混淆变量:一是响应确定性,即将真实的价值差异与强制选择承诺的锐度相混淆;二是接入束缚,即特定部署的客户端层显著改变了模型的表观价值轮廓,从而扭曲了基于单次抽样测量的排名。

原作者: Hong-In Won, Jinseok Jang, Hyoseop Kim

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Hong-In Won, Jinseok Jang, Hyoseop Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试品尝两种不同品牌的冰淇淋,以测试哪一个更“甜”。你取了一勺 A 品牌,又取了一勺 B 品牌。A 品牌是香草味的,B 品牌也是香草味的,但 B 品牌是被盛在一个极小的、高度浓缩的烈酒杯里,而 A 品牌则盛在一个巨大的、蓬松的碗里。如果你只尝一勺,B 品牌可能看起来要甜得多,仅仅是因为它如此浓缩且集中,而不是因为冰淇淋本身在本质上有何不同。

这正是这篇论文所发现的关于人工智能(AI)模型的情况。长期以来,研究人员通过问一个问题来比较不同的 AI 模型:“如果你必须在选项 A 和选项 B 之间做出选择,你会选哪一个?”他们假设如果模型 X 选择了 A,而模型 Y 选择了 B,那么这两个模型就拥有完全不同的“个性”或“价值观”。

作者 Hong-In Won 和 Hyoseop Kim 说:“等等。你在同时测量两个不同的东西,并且把它们搞混了。”

两个误区

1. “承诺度”的混淆(确定性)
第一个误区在于模型对答案的“承诺”有多么“尖锐”。
想象两个正在参加测验的人。

  • 人物 A 非常确定。每次你问他,他都会大声喊出“A!”。
  • 人物 B 有点犹豫不决。他 60% 的时间说“A”,40% 的时间说“B”。

如果你只问一次,而人物 A 说“A”,人物 B 说“B”,你可能会认为他们是截然相反的。但他们并不是!他们都倾向于“A”。人物 A 只是一个大声、果断的“A”拥护者,而人物 B 则是一个安静、犹豫的“A”拥护者。

论文表明,当研究人员仅使用单次回答(“单次抽取”)来比较 AI 模型时,他们会无意中将这种“响度”或“果断性”计入价值观的差异中。

  • 研究结果: 作者测试了九种不同的 AI 模型。他们发现,有些模型非常有果断性(例如一个名为 GPT-5.5 的模型,在衡量其确定性的量表上为 0.95),而另一些模型则要温和得多(例如 Anthropic 的“Opus”模型,通过特定的应用测量时仅为 0.34)。
  • 转折点: 这种“果断性”并不是一种可以通过仅仅观察模型名称就能猜到的固定性格特征。在其中一个模型家族中,一个较小的、更便宜的模型实际上比那个大的、昂贵的旗舰模型更具果断性。而在另一个家族中,更大的模型更具果断性。作者建议,你不能仅仅通过知道谁制造了模型或它有多大,就去假设模型的“响度”;你必须在每次使用时都进行测量。

2. “送货卡车”的混淆(接入工具)
第二个误区更加隐蔽。这关乎的不是冰淇淋本身,而是运送冰淇淋的卡车。
作者意识到,你提问的方式会改变 AI 的回答。他们称之为“接入工具”(access harness)。

  • 想象你订购了披萨。如果你直接给披萨店打电话(“原始 API”),你会得到厨师制作出的原汁原味的披萨。
  • 但如果你通过特定的外卖 App(例如“CLI”或订阅工具)订购,该 App 可能会向厨房添加一条备注:“做成特辣口味!”或者“不要让顾客说‘不’”。

作者发现,对于某些 AI 模型,你使用的“外卖 App”(用于与 AI 对话的软件)会完全改变模型的个性。

  • 证据: 他们拿同一个 AI 模型,通过两种方式询问了同样的问题两次:一次是通过直接连接,另一次是通过一个流行的订阅应用。
  • 结果: 通过订阅应用,“Opus”模型看起来非常温和且犹豫不决(0.34)。但当他们通过原始连接直接询问它时,它其实相当果断(0.66)。这个 App “抹平”了它的个性。
  • “拒绝”的小把戏: 在一个案例中,直接连接显示模型有 10% 的时间会拒绝回答,因为它觉得问题不公平。但订阅应用强制模型每次都必须回答,这让它看起来非常顺从。作者证明,这是由一个隐藏的“系统提示词”(即 App 与问题一同发送的一组指令)造成的,该指令告诉模型:“直接选一个字母,不要争辩。”

这对 AI 的“个性”意味着什么

那么,这篇论文到底证明了什么?

  • 它证明了 我们看到的 AI 模型之间的“距离”往往是虚假的。它是如何“响亮”程度以及我们使用什么软件与它们对话的混合体。
  • 它证明了 我们用来与 AI 对话的软件(“接入工具”)并非中立的管道;它会积极地塑造 AI 的价值观。
  • 它建议(但并未完全定论)“果断性”在不同模型之间差异巨大,并且并不遵循像“更大的模型更响亮”这样简单的规则。

哪些并不是答案?
论文明确排除了仅仅通过看模型的名字就能知道其价值观的想法。它也排除了所有模型之间的差异仅仅是“噪声”的想法。

  • 好消息: 即使在修正了这两个误区之后,作者仍然发现某些模型确实存在真正的分歧。例如,一个名为“Grok-3”的模型在关于 73% 到 88% 的问题上,确实表现出与 OpenAI 或 Google 的模型截然不同的倾向。这些是真实的差异,而非测量误差。
  • 坏消息: 我们认为在同一个公司家族内部(例如在不同 Anthropic 模型之间)存在的绝大多数差异,主要只是它们有多“响亮”,或者是它们所使用的 App 如何塑造了它们。

总结

如果你想知道两个 AI 模型是否具有不同的价值观,你不能仅仅问它们一个问题然后看它们的回答。你必须:

  1. 多次询问同一个问题,以观察它们是仅仅很“响亮”还是真的“不同”。
  2. 确保你是通过完全相同的“门”(相同的软件连接)与它们对话,因为这扇门本身可能会改变它们的想法。

作者并没有永远解开 AI 个性的谜团,但他们制造了一个更好的放大镜来观察它们。他们向我们展示了,我们原本以为的深刻哲学分歧,可能仅仅是一个 AI 在大声叫喊而另一个在低声细语,或者是其中一个 AI 在面对一个爱指挥的经理说话,而另一个在面对一个安静的朋友说话。真实的差异确实存在,但你必须清理掉噪声才能看到它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →