Grounding or Guessing? Visual Signals for Detecting Hallucinations in Sign Language Translation
本文提出了一种新颖的词元级视觉可靠性度量方法,该方法结合了特征敏感性和反事实信号,通过量化模型在多大程度上依赖视觉证据而非语言先验,来有效地检测并诊断手语翻译中的幻觉问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心背景: “盲视”的翻译员
想象一位正在尝试将手语视频(通过手势表达)翻译成口语文本的翻译员。
- 目标: 翻译员应该观察双手,并准确说出对方正在表达的内容。
- 问题: 有时,翻译员会变得偷懒或过度自信。他们不再观察双手,而是根据句子通常的逻辑规律来“猜”对方可能说了什么。他们生成的句子听起来可能非常完美且符合语法,但却与签名者的实际动作毫无关系。在人工智能领域,这被称为幻觉(Hallucination)。
本文指出,那些跳过了中间步骤(称为“词汇标注/glosses”)的新型、“更聪明”的翻译模型,表现反而更差。因为它们太擅长根据语言模式进行猜测,以至于经常停止观察视频内容。
核心理念:“落地” vs. “猜测”
作者引入了一种衡量 AI 究竟是在观察视频,还是在凭空捏造的新方法。他们称之为可靠性(Reliability)。
这就像是侦探在核查不在场证明:
- 落地(观察证据): AI 说:“我选择这个词是因为我看到了签名者手部特定的动作。”
- 猜测(依赖记忆): AI 说:“我选择这个词是因为在英语中,人们通常在说‘早上好’之后会说‘你好’。”
本文的主要任务就是构建一个“测谎仪”,能够区分这两种行为。
“测谎仪”是如何工作的
作者创建了一个测试,用以观察 AI 对视频的依赖程度。他们让翻译过程在三个并行通道中运行:
- 真实情况: AI 看到真实的视频。
- 黑屏: AI 看到视频,但屏幕是黑色的(没有视觉数据)。
- 错误的视频: AI 看到的是完全不同的视频(比如一段猫的视频,而不是签名者的视频)。
测试标准:
- 如果 AI 在移除或更换视频后,其回答发生了显著变化,说明它是落地的(Grounded)(即它确实在观察视频)。
- 如果 AI 即使在视频消失或错误的情况下,依然保持完全相同的回答,则说明它是在猜测(Guessing)(即它仅仅是在依赖其内在的语言习惯)。
他们将这些测试结合在一起,形成了一个单一的分数,称为可靠性(Reliability)。高分意味着 AI 正在关注视频;低分则意味着它正在产生幻觉。
“无词汇标注”陷阱
论文对比了两类翻译模型:
- 基于词汇标注的模型(旧方法): 这些模型使用一个“中间人”。它们先将视频翻译成“词汇标注”(对手部动作的简单标签),然后再翻译成文本。这就像是一位严厉的老师,强迫学生在命名物体之前必须先指向该物体。这能让他们保持诚实。
- 无词汇标注的模型(新方法): 这些模型直接从视频跳转到文本。它们就像是一个被告知“直接说出你看到的”的学生,而没有强制性的标签约束。
研究发现: “无词汇标注”的模型更容易产生幻觉。因为它们不需要被迫停下来为动作贴标签,所以往往会跳过观察视频的过程,转而用听起来通顺的话来“填补空白”。论文证明了这些模型“猜测”的频率远高于旧模型。
为什么这很重要
通常,当我们检查 AI 是否在撒谎时,我们会看它听起来有多“自信”。如果它表现得非常有信心,我们就假设它是正确的。
- 论文的转折点: 在手语翻译中,“自信”是一个陷 Van。一个模型可以 100% 确定正在下雨,即便视频显示的是晴天,因为它只是根据之前读到的天气预报在进行猜测。
作者展示了他们的可靠性评分在捕捉这些谎言方面,比单纯检查“自信度”要有效得多。它的工作原理是询问:“你是为了决定这个词而观察了视频,还是仅仅在进行猜测?”
结果总结
- 有效性: 新的“可靠性”评分成功预测了 AI 何时产生幻觉。
- 普适性: 它适用于不同的数据集和不同类型的 AI 模型。
- 解释了“为什么”: 它证明了较新的、无词汇标注的模型之所以更容易产生幻觉,是因为它们停止使用视觉信息,转而过度依赖其语言训练。
- 安全工具: 通过将这种视觉检查与标准的文本检查相结合,我们可以更清晰地了解 AI 何时在编造内容。
简而言之,这篇论文告诉我们,对于手语翻译而言,你不能仅仅信任 AI 的自信程度;你必须检查它是否真的在观看视频。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。