← 最新论文
🤖 AI

DiagFlowBench: Evaluating How Language Models Handle Off-Procedure Inputs in Grounded Diagnostic Dialogue

本文介绍了 DiagFlowBench,这是一个源自工业诊断流程图的新型基准数据集,用于评估语言模型如何处理程序外输入,并揭示了模型往往提供看似合理但上下文错误的建议而非拒绝回答,从而暴露了基于事实的诊断系统中的一个关键漏洞。

原作者: Guillermo Gil de Avalle, Laura Maruster, Shaina Raza, Christos Emmanouilidis

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Guillermo Gil de Avalle, Laura Maruster, Shaina Raza, Christos Emmanouilidis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明、乐于助人的机器人助手,专门用于修理复杂的机器。这个机器人被赋予了一份严格的、循序渐进的说明书(流程图),并被告知:“只能严格遵守这些步骤。如果你不知道答案,请说‘我不知道’。”

开发这个研究成果的研究人员们,通过 DIAGFLOWBENCH,想要观察这个机器人在人类操作员在维修过程中提出奇怪、出乎意料或离题的问题时,是否真的能恪守规则。

以下是他们发现的研究结果,用简单的语言进行了解释:

1. 设置:一个严格的 GPS

把机器人的手册想象成一个 GPS 导航系统

  • 目标: 机器人应该引导人类通过特定的路线(诊断流程图)来修理一台损坏的机器。
  • 规则: 只有当驾驶员(操作员)说出了 GPS 预期的内容时,机器人才能建议下一个转弯。
  • 问题: 现实中的驾驶员并不总是使用 GPS 语言。有时他们会说,“嘿,我看到侧面有一个奇怪的划痕,”或者“你知道最近的咖啡店在哪里吗?”这些是 程序外输入——这些内容在地图中并没有对应的路线。

2. 测试:“陷阱”对话

研究人员创建了一个庞大的测试集,名为 DIAGFLOWBENCH

  • 他们将 50 份来自工厂的真实维修手册转化成了 1,676 场对话。
  • 其中一半对话是完美的:人类提出了正确的问题,机器人遵循了地图。
  • 另一半则是“陷阱”:研究人员在对话中间秘密地注入了奇怪的问题。
    • 例子: 机器人正在询问发动机机油,但人类突然说,“顺便说一下,门上的油漆在剥落。”(手册中没有针对油漆剥落的步骤)。

他们测试了 10 种不同的 AI 模型(包括像 GPT-4 这样的大型商业模型和像 Llama 这样的开源模型),以观察它们如何处理这些陷阱。

3. 大惊喜:“伪专家”

研究人员原本预期机器人要么会:

  1. 胡编乱造: 捏造一个手册中不存在的虚假步骤(比如“检查隐形的哥布林”)。
  2. 说“我不知道”: 正确地承认该问题超出了手册范围。

实际发生了什么?
大多数机器人既没有这样做,也没有那样做。相反,它们陷入了一个研究人员称之为 “强制映射”(Forced Mapping) 的陷阱。

类比:
想象你正在按照一份 巧克力蛋糕 的食谱进行操作。

  • 问题: 你问,“如何修复烤焦的面包?”(这是离题的)。
  • “胡编乱造”的失败: 机器人说,“在面糊里加入一条龙。”(这显然是错误的)。
  • “我不知道”的成功: 机器人说,“我不知道如何修复吐司;我只知道如何做蛋糕。”
  • “强制映射”的失败(真正的问题): 机器人看着你关于烤焦面包的问题,心想,“嗯,‘烤焦’听起来像‘煮过头了’……我知道怎么处理煮过头的蛋糕!”然后它说,“在蛋糕里多加点糖。”
    机器人并没有捏造一个虚假的步骤。它选择了手册中一个 真实的、有效的步骤(加糖),但它将其应用到了 错误的情况 上。它表现得很自信,听起来很有帮助,而且这个步骤确实存在于书中,但对于当前的问题来说却是毫无用处的。

4. 为什么这很危险

论文指出,这实际上比胡编乱造更危险。

  • 如果机器人发明了一个虚假的步骤,人类可能会察觉并说,“等等,这不在手册里。”
  • 但如果机器人给出了一个 真实的 步骤,只是不适用于当前的情况,人类可能会想,“哦,手册就是这么说的,那我就照做吧。” 机器人就这样诱导人类去遵循一条通往死胡同的有效路径。

5. 结果:规模并不重要

研究人员测试了从小型、廉价的模型到庞大、昂贵的超级模型的各种模型。

  • 发现: 更大、更聪明的模型并不能更好地识别这些陷阱。事实上,一些被设计用来“深度思考”的 推理模型 反而表现得更差,它们更难说出“我不知道”。它们太努力地想要变得乐于助人,从而在并不存在的联系中强行建立了关联。
  • 恢复能力: 一旦机器人犯了这种错误,它通常会彻底迷失方向。它无法回到正轨,就像一个给出了错误转弯建议,然后就忘记了如何回到主路的 GPS。

6. 结论

论文得出结论,仅仅给 AI 一个手册并告诉它“不要产生幻觉”是不够的。AI 仍然可能通过将一个真实的答案强加于一个并不配得到该答案的问题上,从而产生“幻觉”。

为了解决这个问题,我们不能仅仅依赖 AI 的规模或智能。我们需要 第二层安全机制(比如人类监督员或独立的软件检查),去观察 AI 选择那个步骤的 原因,而不仅仅是看它选择了 哪个 步骤。我们需要在机器人自信地为一个错误的问题给出正确答案时,及时抓住它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →