← 最新论文
🤖 AI

Does a Tool Result Carry More Authority Than Plain Text? Three Prospective Studies of False-Claim Adoption in a Synthetic Assignment Task with Claude Opus 5

关于 Claude Opus 5 的三项前瞻性研究显示,尽管工具-结果元数据最初表现出比纯断言更容易增加虚假声明的采纳率,但随后的预注册复制实验表明,这种效应既不一致,也不优于显式宣布的行内文本所产生的影响。

原作者: Justin Bronder

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Justin Bronder

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的世界里,被称为语言模型的计算机程序正日益扮演着能够记忆事物、查找信息并为自己撰写笔记的智能体角色。想象一个记录自己工作的数字助手:它可能会阅读自己之前写下的一条笔记,将其视为事实,并在稍后据此做出决策。这种从它同时也进行写入的存储库中读取信息的能力创造了一个独特的循环:一个仅仅是被记录下来的说法,在稍后回来时,看起来却像是一条经过验证的记录。研究人员现在提出的问题是,信息的封装方式是否会改变计算机对待它的方式。一条出现在正式、结构化的“工具结果”(一种用于数据检索的特定数字格式)中的笔记,是否比同样的笔记以纯文本形式出现时具有更强的权重?如果仅仅是格式本身就让计算机更容易相信一个错误的说法,这便表明该系统可能会被“权威的外表”所迷惑。

为了调查这一点,研究人员贾斯汀·布隆德(Justin Bronker)使用一个名为 Claude Opus 5 的特定版本 AI 模型,设计了一系列受控实验。其目标是观察模型是否会仅仅因为信息以某种特定的格式到达,就采纳一条错误的信息。实验设置了一个合成任务,要求模型识别一个特定物品的代码。正确的代码对模型是隐藏的,但一个错误的代码被秘密地植入了对话历史中。模型必须在错误的编码、另一个正确的编码或承认不知道之间做出选择。研究人员测试了如果该错误编码出现在“工具结果”格式中,与它作为助手的简单陈述出现时相比,模型是否会盲目接受它。

在研究的第一阶段,模型看到了一段历史记录:之前的助手提出了一个主张,而一个单独的“工具结果”包含了一条记录。当这个错误的编码出现在助手的纯文本陈述中时,模型几乎从未接受它;它正确地忽略了这条错误信息或承认不知道。然而,当同一个错误编码出现在结构化的工具结果内部时,模型在 24 次尝试中有 14 次接受了它。这一初步发现表明,工具结果格式确实可能携带了纯文本所缺乏的一种特殊权威感。模型似乎将这个结构化记录视为一次经过验证的查询,尽管它只是一个植入的错误。

为了确保这不是偶然现象,研究人员在第二个严格规划的实验中重复了这一对比。这一次,模型再次忽略了来自助手文本的错误主张,但在工具结果格式中,它在 24 次尝试中有 7 次接受了该错误主张。这证实了这种差异是真实存在且在这些特定条件下可复现的。工具结果包似乎比纯文本断言对模型的决策过程有着更强的拉力。

然而,故事在第三个也是最后一个研究中发生了重大转折。研究人员意识到之前的测试可能是不公平的,因为纯文本和工具结果是以不同的方式和时间呈现的。在这个新设置中,模型预先被告知它将看到两条记录:一条在工具结果格式中,另一条作为纯文本。两者同时出现在最终的问题中。研究人员随后交换了哪条记录包含错误编码。当错误编码位于纯文本中时,模型在所有 60 次试验中都接受了它,达到了 60 出 60。当错误编码位于工具结果中时,模型在 60 次试验中有 57 次接受了它。

这个最终结果推翻了最初关于“工具结果格式本质上更强大”的观点。它表明,当模型被明确告知要查看两条记录时,纯文本与工具结果一样具有说服力。早期的差异并不是因为工具结果格式具有某种神奇的权威,而是因为前两个研究中的呈现方式使得工具结果看起来像是检索任务中唯一的有效答案。模型是在遵循任务结构的指令,而不是在判断信息的来源。

研究结论是,该模型并没有一个内置规则说“工具结果总是真实的”。相反,模型对任务的框架设定非常敏感。如果任务看起来像是一个预期答案应为工具结果的查询任务,模型就会信任这种格式。如果任务将两个选项并排呈现,模型会将它们视为同等对待,并且无论信息是在工具结果中还是纯文本中,都会相信错误的信息。研究结果表明,错误的危险不仅在于信息以何种格式到达,更在于整个对话是如何被构建,从而让模型觉得它有理由去信任该信息。这项研究强调,在这些系统中,经过验证的记录的外表可以通过改变封装方式来伪造,但当模型被要求直接比较来源时,这种效应就会消失。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →