← 最新论文
💬 NLP

Grounding or Guessing? Visual Signals for Detecting Hallucinations in Sign Language Translation

本文提出了一种新颖的词元级视觉可靠性度量方法,该方法结合了特征敏感性和反事实信号,通过量化模型在多大程度上依赖视觉证据而非语言先验,来有效地检测并诊断手语翻译中的幻觉问题。

原作者: Yasser Hamidullah, Koel Dutta Chowdhury, Yusser Al Ghussin, Shakib Yazdani, Cennet Oguz, Josef van Genabith, Cristina España-Bonet

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yasser Hamidullah, Koel Dutta Chowdhury, Yusser Al Ghussin, Shakib Yazdani, Cennet Oguz, Josef van Genabith, Cristina España-Bonet

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心背景: “盲视”的翻译员

想象一位正在尝试将手语视频(通过手势表达)翻译成口语文本的翻译员。

  • 目标: 翻译员应该观察双手,并准确说出对方正在表达的内容。
  • 问题: 有时,翻译员会变得偷懒或过度自信。他们不再观察双手,而是根据句子通常的逻辑规律来“猜”对方可能说了什么。他们生成的句子听起来可能非常完美且符合语法,但却与签名者的实际动作毫无关系。在人工智能领域,这被称为幻觉(Hallucination)

本文指出,那些跳过了中间步骤(称为“词汇标注/glosses”)的新型、“更聪明”的翻译模型,表现反而更差。因为它们太擅长根据语言模式进行猜测,以至于经常停止观察视频内容。

核心理念:“落地” vs. “猜测”

作者引入了一种衡量 AI 究竟是在观察视频,还是在凭空捏造的新方法。他们称之为可靠性(Reliability)

这就像是侦探在核查不在场证明:

  • 落地(观察证据): AI 说:“我选择这个词是因为我看到了签名者手部特定的动作。”
  • 猜测(依赖记忆): AI 说:“我选择这个词是因为在英语中,人们通常在说‘早上好’之后会说‘你好’。”

本文的主要任务就是构建一个“测谎仪”,能够区分这两种行为。

“测谎仪”是如何工作的

作者创建了一个测试,用以观察 AI 对视频的依赖程度。他们让翻译过程在三个并行通道中运行:

  1. 真实情况: AI 看到真实的视频。
  2. 黑屏: AI 看到视频,但屏幕是黑色的(没有视觉数据)。
  3. 错误的视频: AI 看到的是完全不同的视频(比如一段猫的视频,而不是签名者的视频)。

测试标准:

  • 如果 AI 在移除或更换视频后,其回答发生了显著变化,说明它是落地的(Grounded)(即它确实在观察视频)。
  • 如果 AI 即使在视频消失或错误的情况下,依然保持完全相同的回答,则说明它是在猜测(Guessing)(即它仅仅是在依赖其内在的语言习惯)。

他们将这些测试结合在一起,形成了一个单一的分数,称为可靠性(Reliability)。高分意味着 AI 正在关注视频;低分则意味着它正在产生幻觉。

“无词汇标注”陷阱

论文对比了两类翻译模型:

  1. 基于词汇标注的模型(旧方法): 这些模型使用一个“中间人”。它们先将视频翻译成“词汇标注”(对手部动作的简单标签),然后再翻译成文本。这就像是一位严厉的老师,强迫学生在命名物体之前必须先指向该物体。这能让他们保持诚实。
  2. 无词汇标注的模型(新方法): 这些模型直接从视频跳转到文本。它们就像是一个被告知“直接说出你看到的”的学生,而没有强制性的标签约束。

研究发现: “无词汇标注”的模型更容易产生幻觉。因为它们不需要被迫停下来为动作贴标签,所以往往会跳过观察视频的过程,转而用听起来通顺的话来“填补空白”。论文证明了这些模型“猜测”的频率远高于旧模型。

为什么这很重要

通常,当我们检查 AI 是否在撒谎时,我们会看它听起来有多“自信”。如果它表现得非常有信心,我们就假设它是正确的。

  • 论文的转折点: 在手语翻译中,“自信”是一个陷 Van。一个模型可以 100% 确定正在下雨,即便视频显示的是晴天,因为它只是根据之前读到的天气预报在进行猜测。

作者展示了他们的可靠性评分在捕捉这些谎言方面,比单纯检查“自信度”要有效得多。它的工作原理是询问:“你是为了决定这个词而观察了视频,还是仅仅在进行猜测?”

结果总结

  • 有效性: 新的“可靠性”评分成功预测了 AI 何时产生幻觉。
  • 普适性: 它适用于不同的数据集和不同类型的 AI 模型。
  • 解释了“为什么”: 它证明了较新的、无词汇标注的模型之所以更容易产生幻觉,是因为它们停止使用视觉信息,转而过度依赖其语言训练。
  • 安全工具: 通过将这种视觉检查与标准的文本检查相结合,我们可以更清晰地了解 AI 何时在编造内容。

简而言之,这篇论文告诉我们,对于手语翻译而言,你不能仅仅信任 AI 的自信程度;你必须检查它是否真的在观看视频。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →