LLMs Should Not Yet Be Credited with Decision Explanation
本立场论文主张,鉴于现有证据主要支持预测与合理化而非真正的解释,大型语言模型尚不应被赋予解释人类决策的功绩,相反应倡导一种经过校准的标准以区分这些能力,从而防止对解释性进展的过早重新定义。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,试图弄清楚一个人为何做出某个特定选择,比如买了一辆红色汽车而不是蓝色汽车。
现在,想象你有一个非常聪明、博览群书的机器人(大语言模型),它可以观察情况并告诉你两件事:
- 预测:“我敢打赌他们买了那辆红色汽车。”
- 故事:“他们买了红色汽车,因为他们喜欢红色,而且这符合他们的个性。”
王闻硕的论文认为,我们目前正犯一个大错。我们将机器人的“故事”当作对人类心智的“科学解释”。作者指出:在机器人拥有更确凿的证据之前,不要给予它“解释”人类决策的赞誉。
以下是用简单类比进行的分解:
1. 三种“赞誉”层级
论文指出,机器人能做的三件事需要不同层级的证据。这就像一款拥有三个难度等级的电子游戏:
等级 1:算命先生(决策预测)
- 它做什么:机器人猜对了结果。“他们选了红色汽车。”
- 证据:它只需要经常猜对即可。
- 论文观点:这很棒!我们应该认可机器人是个优秀的猜测者。但猜对并不意味着你知道他们为何选择它。也许机器人只是注意到大多数人在周二会选择红色,而不是因为那个人对红色的喜爱。
等级 2:巧言者(理由生成)
- 它做什么:机器人写出了一个令人信服的故事。“他们选了红色汽车,因为它很时尚且与他们的鞋子相配。”
- 证据:人类阅读这个故事后说:“这听起来合理且合乎逻辑。”
- 论文观点:这也很有用!机器人擅长写作。但一个流畅的故事并不等同于真相。律师可以为一位实际上有罪的当事人写出完美的辩护词。故事听起来很好,但这并不能证明当事人内心实际发生了什么。
等级 3:读心者(决策解释)
- 它做什么:机器人证明它确实追踪了导致该选择的人类大脑中具体运转的思维齿轮。
- 证据:这是最难的部分。你不能只让机器人写个故事。你必须对它进行测试。
- 论文观点:我们尚未达到这一水平。 目前,机器人只是一个等级 1 的算命先生和一个等级 2 的巧言者。我们错误地将其称为等级 3 的读心者。
2. 问题所在:“有说服力的叙述者”
论文警告说,我们正落入一个陷阱。因为机器人非常擅长写作(等级 2)且非常擅长猜测(等级 1),我们便假设它一定也理解了原因(等级 3)。
类比:
想象一位魔术师从帽子里变出一只兔子。
- 预测:魔术师说:“我会变出一只兔子。”(他说对了)。
- 理由:他说:“我变出兔子是因为我使用了一个特殊的魔法咒语。”(这听起来既合理又神奇)。
- 解释:要真正解释它,你需要展示帽子内部的秘密隔层或他使用的机制。
目前,大语言模型只是那个告诉我们咒语的魔术师。它们尚未向我们展示秘密隔层。它们只是在为已经预测到的结果进行“合理化”(编造一个很好的理由)。
3. 解决方案:“桥梁标准”
作者提出了一条新规则,用于界定我们何时可以说:“好吧,这个机器人确实解释了人类决策。”机器人需要在它的故事与真实的人类心智之间搭建一座桥梁。
要跨越这座桥梁,机器人的主张必须通过四项测试:
- 明确目标:不要只说“它解释了选择”。要确切说明它正在追踪什么。它是在追踪“对亏钱的恐惧”吗?还是在追踪“对鲜艳颜色的关注”?你必须选择一个具体的事物进行测量。
- 击败“虚假”替代方案:你必须证明机器人不仅仅是一个“聪明猜测 + 流畅叙述”的组合。你需要证明,如果你欺骗机器人(例如,先隐藏答案),它无法仅仅编造一个碰巧正确的故事。它必须证明它找到了真正的原因,而不仅仅是一个方便的借口。
- 使用正确的工具:如果你声称机器人追踪了“注意力”,你不应该只让它写一篇文章。你应该使用眼动仪或反应时间等工具,来查看机器人的故事是否与人类眼睛的实际行为相匹配。
- 保持范围狭小:不要说“这个机器人解释了所有人类决策”。要说“这个机器人解释了特定类型的选择,针对特定群体的人”。
4. 为何这很重要
这篇论文并非说机器人无用。它指出我们需要诚实地看待它们擅长什么。
- 当前状态:我们将机器人视为通灵故事家。因为它们能写出令人信服的故事,我们就认为它们揭示了人类心智的深层秘密。
- 建议状态:我们应该将它们视为强大的工具,它们擅长猜测和生成想法,但在通过严格测试之前,不应称它们为“解释者”。
核心结论:
如果我们继续给予机器人“解释”那些它们尚未真正证明之事的赞誉,我们可能会停止寻找真正的答案。通过校准我们的赞誉(给予它们对其实际所做之事的赞誉,而非我们希望它们做到的赞誉),我们可以将它们从有说服力的故事讲述者转变为发现人类行为真相的可靠工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。