← 最新论文
🤖 AI

ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation

本文介绍了 ViPo-MLLM,这是一个将时空 RGB 特征与人体姿态特征与大语言模型相结合的新型框架,旨在实现 PHOENIX14T 和 CSL-Daily 数据集上最先进的无手语词(gloss-free)手语翻译,有效地达到了与基于手语词方法相媲美的水平。

原作者: Ahmed Abul Hasanaath, Bicheng Xu, Mir Rayat Imtiaz Hossain, Leonid Sigal, Hamzah Luqman

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmed Abul Hasanaath, Bicheng Xu, Mir Rayat Imtiaz Hossain, Leonid Sigal, Hamzah Luqman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试翻译一部默片,片中的演员完全通过手势、面部表情和肢体动作来交流。这就是手语翻译(Sign Language Translation, SLT)。目标是将这些视频转化为正常的口语句子(如英语或德语),且不需要人类先将每一个“词”(称为“词汇/gloss”)记录下来。

这篇论文介绍了一种全新的 AI 系统,名为 ViPo-MLLM。你可以把它想象成一个超级聪明的翻译官,它通过同时观察两样东西来学习“阅读”手语:视频(这个人看起来是什么样的)和骨架(他们的关节是如何运动的)。

以下是其工作原理的详细拆解,使用了简单的类比:

1. 问题所在:“模糊的画面” vs. “骨架”

以往的 AI 翻译器通常只能尝试用纯视频(就像看电影)或者纯骨架(就像看火柴人跳舞)来进行翻译。

  • 视频 (RGB): 这就像是在看一部高清电影。你能看到颜色、衣服和背景。它提供了“氛围”和上下文,但有时 AI 会被背景噪音干扰,或者看不清细微的手指动作。
  • 骨架 (Pose): 这就像是在视频上叠加了一个火柴人动画。它剥离了衣服和背景,纯粹专注于手、肘部和脸部的位置。它对运动非常精确,但缺乏场景的“韵味”。

作者意识到,仅仅依赖其中之一,就像是在拼图时缺少了一半的碎片。

2. 解决方案: “双层巴士”

ViPo-MLLM 框架就像一辆双层巴士,载着两类乘客(视频和骨架),并强迫它们进行交流。

  • 第一步:各自的司机(编码器/Encoders)
    系统有两个专门的司机。一个司机观察视频并提取“外观”信息;另一个司机观察骨架并提取“运动”信息。它们此时还不混合,只是各自收集特定的笔记。

  • 第二步:对话(跨模态注意力机制/Cross-Modal Attention)
    这是神奇之处。通常情况下,AI 只是简单地将这两份笔记拼接在一起(就像把两张纸并排贴在一起)。但 ViPo-MLLM 使用了一种称为**跨模态注意力(Cross-Modal Attention)**的机制。

    • 类比: 想象视频司机说:“我看到一只手在快速移动,”而骨架司机说:“我看到肘部在弯曲。”系统会强迫它们进行对话:“好吧,快速移动的手 加上 弯曲的肘部,意味着签名者正在表达‘奔跑’。”
    • 这使得 AI 能够理解身体动作在何时以及如何改变了视觉场景的含义。
  • 第三步:翻译官(大语言模型/LLM)
    一旦这两股信息流被融合为一个单一且丰富的理解,它们就会被交给大语言模型(LLM)。你可以把 LLM 想象成一位读过数百万本书的聪明作家。

    • 系统会给这位作家一个“提示词”(Prompt,即一组指令和示例),说:“这里有一段人做手语的视频。请写出一个与他们动作相匹配的英文句子。”
    • 随后,作家便会生成最终的口语句子。

3. 它是如何学习的(训练健身房)

这个 AI 并非靠瞎猜,它使用了一套特定的健身计划:

  • 对比学习 (Contrastive Learning): 想象向 AI 展示一段视频和一个句子,然后再展示另一个不同的句子。AI 会学习判断:“这两个是匹配的!”以及“这两个不匹配!”这有助于它理解视觉手势与单词之间的联系。
  • 语言建模 (Language Modeling): 它还会直接练习编写句子,尝试根据视频内容来预测句子中的下一个单词。

4. 结果:击败竞争对手

作者在两个主要数据集(一个德语,一个中文)上测试了该系统。

  • 结论: ViPo-MLLM 在“无词汇标注(gloss-free)”翻译方面取得了史上最佳成绩(State-of-the-Art)
  • 惊喜之处: 它的表现几乎可以媲美那些确实使用了昂贵的人工编写“词汇(gloss)”标注的系统。这证明了如果你拥有一个能正确结合视频和身体动作的优秀系统,你并不需要人类来为每一个手势做标签。

总结

简而言之,ViPo-MLLM 是一个不仅仅只看视频或骨架的翻译官。它像是一个侦探,将来自视频的线索(上下文、外观)与来自骨架的线索(精确运动)结合起来,从而弄清楚签名者到底在说什么,而无需依靠人类字典的辅助。它是目前在无需预设标签的情况下,处理此类任务最出色的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →