Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
本文揭示,视觉 - 语言模型在推断注视方向时显著逊于人类,因为它们错误地依赖头部朝向而非眼部外观,这种偏差归因于训练数据而非模型架构。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《视觉 - 语言模型将头部朝向误判为注视方向》的通俗解释,辅以生动的类比。
核心理念:“先顾头部”的猜谜游戏
想象你在玩一个游戏:你需要猜出照片中的人正在看桌上的哪个物体。桌上有三样东西:一只兔子、一个水壶和一些郁金香。
如果这个人正在看兔子,但头稍微转向了水壶,你会怎么做?
- 人类会仔细观察这个人的眼睛,看到瞳孔指向兔子,然后说:“他们在看兔子。”
- 当前的人工智能(视觉 - 语言模型) 往往忽略眼睛。相反,它会观察这个人脸部的朝向(即头部朝向),然后说:“他们在看水壶。”
该论文认为,这些 AI 模型是“懒惰”的猜测者。它们依赖一个捷径:如果头部朝向某个物体,眼睛一定也在那里看。 它们未能付出努力去真正解读眼睛。
研究人员如何测试这一点
研究人员建立了一个特殊的“注视实验室”来测试这一点。他们收集了1,360 张真实照片,照片中的人坐在桌前,面前摆放着不同的物体。他们设置了三种特定场景来“欺骗”AI:
- “一致”场景:人看着兔子,头部也朝向兔子。(这对所有人都很简单)。
- “自然”场景:人看着兔子,头部朝向他们感到舒适的自然方向(通常也是兔子)。
- “欺骗”场景(不一致):这是关键。这个人保持头部朝向水壶,但移动眼睛去看兔子。
结果:
- 人类几乎每次都答对了(准确率约 89%)。他们看了眼睛。
- AI 模型(如 GPT-4o、GPT-5.2、Qwen3)表现非常差,往往仅略好于随机猜测。当头部和眼睛的指向不一致时,AI 几乎总是猜测头部朝向的物体,而不是眼睛正在看的物体。
AI 为何失败?(侦探工作)
研究人员并没有只说"AI 很糟糕”。他们像侦探一样去探究为什么。他们排除了几种借口:
- 是因为照片太模糊吗? 不是。当他们把照片变得超高清时,AI 仍然失败。
- 是因为 AI 无法命名物体吗? 不是。当被要求时,AI 能正确识别“兔子”和“水壶”。
- 是因为 AI 太小了吗? 不是。更大、更强大的模型与较小的模型一样失败。
真正的罪魁祸首:训练数据
研究人员认为,问题出在 AI 从互联网学到的东西上。
- 类比:想象一个只见过人们看着他们正前方物体的孩子。在现实世界中,很少见到有人脸朝前却侧眼盯着别处。
- 因为互联网数据充满了“头部和眼睛一致”的例子,AI 学会了一条规则:“头部方向 = 注视方向”。它从未学会眼睛可以独立于头部移动。
“抛硬币”测试
为了证明 AI 不仅仅是困惑,研究人员进行了一项特定测试。他们问道:AI 到底在不在乎眼睛?
他们发现,AI 的行为就像抛硬币或有偏差的秤:
- 当头部和眼睛一致时,AI 很有信心。
- 当它们不一致时,AI 并不试图去弄清楚眼睛的指向。它只是默认跟随头部。
- 即使研究人员尝试通过添加“关注眼睛”之类的指令来“教导”AI 去看眼睛,AI 大多还是忽略了这些指令,继续根据头部进行猜测。
“概念验证”实验
为了证明这并非 AI 大脑(架构)中的永久性缺陷,而只是训练带来的坏习惯,研究人员进行了一项小实验:
他们选取了一个 AI 模型,并专门针对他们的“欺骗”照片(即头部和眼睛不一致的照片)对其进行重新训练。
- 重新训练前:该模型在欺骗场景下表现极差(准确率 15%)。
- 重新训练后:该模型表现大幅提升(准确率 34%)。它学会了不再仅仅依赖头部,而是真正去看眼睛。
教训:AI能够学会解读眼睛,但它需要特定的数据来教导它这样做。它通常学习的标准互联网数据中缺乏足够的这类“欺骗”示例。
总结
- 问题:如果一个人的头部转向了不同的方向,当前的 AI 模型很难判断他在看哪里。它们将脸部的朝向误认为是眼睛的朝向。
- 原因:它们是在头部和眼睛通常指向同一方向的数据上训练的,因此学会了一个懒惰的捷径。
- 解决方法:我们需要向 AI 提供更多数据,其中人们在头部保持静止的同时看向侧面或上方,从而迫使 AI 学会真正解读眼睛。
该论文得出结论:在我们解决这个数据问题之前,AI 将难以理解人类的非语言线索,而这对于机器人和计算机与人自然互动至关重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。