SMART: MLLM-guided Temporal Alignment for Unifying Sign Language Recognition and Spotting
该论文提出了 SMART,这是一个统一的框架,它利用多模态大语言模型(MLLM)生成的动作描述和多尺度时间适配器,通过高效的小批量视频-文本对齐和联合时间定位,来增强连续手语识别与检测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
对于数百万聋哑或听障人士而言,手语不仅仅是手势的集合,而是一种拥有自身语法、节奏和细微差别的完整、流动的语言。正如口语在句子中连贯流动而无停顿一样,手语在连续的流中往往会相互融合,使得计算机难以分辨一个手语在哪里结束,下一个手语在哪里开始。几十年来,研究人员一直试图教会机器理解这些视频,但他们面临着一个顽固的障碍:用于训练这些系统的可用数据通常只提供最终的句子(如转录文本),却没有告诉计算机视频中的哪个精确时刻对应于哪个特定的词汇。这种精细时序信息的缺失迫使计算机进行猜测,往往导致一种破碎、不均匀的理解——机器可能识别出了一个词,却无法得知它持续了多久或从哪里开始。由于缺乏这种细粒度的知识,构建一个真正流畅的手语翻译器仍然遥不可及。
韩国檀谷大学的一支研究团队现在提出了一种新方法来弥补这一差距,引入了一个他们称之为 SMART 的系统。他们的工作解决了识别正在进行的各种手语以及精准定位它们在视频中何时发生这两个挑战。该研究人员并没有依赖于仅根据句子长度来猜测词界限的老方法,而是构建了一个框架,利用一种被称为多模态大语言模型的强大人工智能。在系统开始学习之前,这种人工智能扮演着一名细心的观察者,观看手语视频并记录下每一时刻发生的动作细节和面部表情。这些描述充当了丰富的语义指南,教导计算机将视觉运动与特定的语言概念联系起来,就像老师在解释手势含义的同时指着它一样。
随后,研究人员设计了一个专门的引擎来处理这些视频,该引擎能够密切关注动作随时间的变化。虽然标准的视频分析工具通常孤立地观察帧,但这个新系统旨在理解跨越多个尺度的运动流,既能捕捉快速、剧烈的动作,也能捕捉缓慢、从容的手势。通过将这种时间感知能力与此前生成的详细文本描述相结合,系统能够以稳定且高效的方式,将视觉视频与语言含义对齐,即使在计算机每次仅处理少量视频的情况下也是如此。这使得模型能够比以往任何时候都更清晰地构建出手语动态的图景。
这项工作中最重要的创新在于系统如何同时处理识别和定位这两项任务。研究人员创建了一个统一的结构,其中识别单词的部分直接将其知识传递给定位边界的部分。在以往的尝试中,这两项任务通常被分开处理,或者时序信息过于稀疏而无法发挥作用。在这里,系统利用其在识别特定手语时的置信度来锐化该手记在时间上的边缘,有效地告诉计算机:“我确定这个词是‘停止’,所以让我们标出它确切的起始和结束时间。”这创造了一个反馈循环:识别单词的能力提升了寻找边界的能力,而边界的精确时序反过来又帮助系统更准确地识别单词。
该团队在包括德语、中文和两种不同韩语手语集合在内的四个不同手语数据集上测试了这一新框架。结果显示,该方法在识别手语序列和在视频中精准定位手语方面,均优于现有的所有最先进系统。在一个大型数据集中,该系统将识别手语的错误率降低到了不到 1%,这比以往的方法有了显著改进。此外,当被要求精准定位手语的起始和结束时间时,该系统达到了远超传统方法的准确度水平,证明了这两项任务确实是互补的。研究人员发现,通过使用语言描述作为引导,并让识别任务与定位任务相互支持,他们能够克服长期困扰该领域的弱监督限制。
这项工作表明,实现流畅手语理解的路径不仅在于更好的摄像头或更快的处理器,还在于教会机器理解人类动作的语义丰富性。通过生成运动的详细描述并利用它们来引导学习过程,SMART 框架证明了计算机可以学习以接近人类感知的细节程度来“看”手语。研究结果表明,将语言模型的广泛理解能力与视频分析的精确时序结合起来,会产生强大的协同效应,为构建最终能够打破聋哑及听障群体沟通障碍的工具提供了充满希望的新方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。