← 最新论文
🤖 machine learning

Learning Context-Conditioned Predicate Semantics via Prototype Feedback

本文介绍了 AlignG,这是一个新颖的场景图生成框架,它通过从关系候选中推断上下文条件表示并借助原型反馈对其进行重新校准,从而动态地调整谓词语义,进而有效解决一词多义问题并在基准数据集上实现了最先进的性能。

原作者: NamGyu Jung, Chang Choi

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: NamGyu Jung, Chang Choi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向朋友描述一张照片。你看到一个人站在一副滑雪板上。

  • 情境 A: 这个人正滑下雪坡,速度很快。你会说:“他们正在驾驭滑雪板。”
  • 情境 B: 这个人站在山顶静止不动,等待缆车。你会说:“他们正站在滑雪板上。”

对计算机而言,这两种情况看起来几乎一模一样:一个人 + 滑雪板 + 单词"on"(在……上)。这正是该论文要解决的核心问题。在人工智能领域,像"on"或"riding"(驾驭)这样的词通常被视为静态标签——就像一枚僵硬的印章,无论语境如何,其含义永不改变。这导致人工智能感到困惑,将“站立”与“驾驭”混淆,因为它无法看清情境的差异。

这篇论文的作者 Jung 和 Choi 提出了一种名为AlignG的新系统来解决这个问题。以下是其工作原理,辅以简单的类比:

1. 问题所在:“僵硬的字典”

将以往的人工智能模型想象成拥有一本字典,其中每个单词都只有一个固定的定义。

  • 如果字典规定"on"意味着“接触”,那么它会将这一定义应用于每一张图片。
  • 无论这个人是正在滑雪还是仅仅站立,人工智能看到的都是同样的“接触”,并做出同样的猜测。
  • 论文认为这过于僵化。现实生活是流动的;关系的含义会根据场景而变化。

2. 解决方案:“自适应翻译器”

AlignG 就像一位聪明的翻译,它不只是在字典里查单词,而是会问:“在这张特定的照片中,此刻正在发生什么?”

该系统使用一个两步的“反馈循环”来弄清楚这一点:

  • 第一步:“群聊”(收集语境)
    想象人工智能查看照片中所有的关系(例如,“狗在地毯上”、“男人拿着杯子”、“车在路上”)。它收集这些线索,并向其内部的“字典”(称为原型)询问:“嘿,基于这张特定照片中的所有线索,单词'on'此刻感觉更像是‘驾驭’还是‘站立’?”

    人工智能会针对这张特定图片,临时调整该单词的定义。这就像字典中"on"那一页在瞬间重写自身以适应场景。

  • 第二步:“现实核查”(反馈)
    一旦定义被调整,人工智能就会回过头,利用这种新的、具备语境感知能力的定义重新评估关系。

    • 调整前: “人 + 滑雪板 = 站立”(因为定义是静态的)。
    • 调整后: “人 + 滑雪板 + 运动线索 = 驾驭”(因为定义已更新)。

3. 保持稳定性:“锚点”

你可能会问:“如果人工智能不断改变定义,它会不会感到困惑或忘记单词的含义?”

论文解释说,AlignG 拥有一种安全机制。它在后台保留了一个全局锚点(即原始、正确的字典定义)。

  • 人工智能被允许针对特定图片临时偏移含义,但它必须始终与主锚点保持连接。
  • 这就像一只风筝。风筝(特定图片)可以飞得很高并随风(语境)移动,但它始终被系在地面上的重物(全局语义结构)上,以防它飞走变成胡言乱语。

4. 结果

作者在两个主要照片数据集(VG-150 和 GQA-200)上测试了该系统。

  • 结果: AlignG 在区分外观相似的情况方面取得了显著进步。
  • 证明: 他们表明,该系统成功解决了诸如“驾驭”与“站在……上”或“躺在……上”与“放置于……上”等成对概念的混淆。
  • 效率: 它在几乎没有拖慢计算机速度的情况下做到了这一点。这就像给计算器添加了一位智能助手,而没有让计算器变得笨重或缓慢。

总结

简而言之,AlignG 教导人工智能,描述关系的词(谓词)并非固定的印章。相反,它们是灵活的概念,可以根据照片中的视觉证据发生轻微偏移,同时始终扎根于其真实含义。这使得人工智能能够理解,“站在滑雪板上”和“驾驭滑雪板”是不同的故事,即使物体看起来是一样的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →