Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition
Zero-MELO 是一种新颖的测试时证据校准框架,它通过采用用于细粒度视觉证据获取的树搜索机制和一个用于减轻评分偏差的校准模块,增强了多模态大语言模型中的零样本微手势识别能力,从而在基准数据集上显著优于现有基线。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人类的动作是一种独特的语言,它不仅通过挥手或竖起大拇指等宏大姿态来表达,也通过身体那些转瞬即逝、几乎不可察觉的细微变化来传达。这些被称为微表情或微动作(micro-gestures):比如轻微抓挠下颚、手指短暂地交叠,或是嘴唇轻微的紧缩。几十年来,研究人员一直在研究这些微小的动作,因为它们往往能在一个人开口说话之前,就揭示出其内心真实的感受或想法。然而,教导计算机识别这些稍纵即逝的信号一直是一个棘手的挑战。这些动作过于迅速、过于细微,且因人而异,标准的视频分析工具无法可靠地捕捉到它们。
近年来,一种被称为多模态大语言模型的新一代人工智能应运而生。这些系统在理解通用图像和视频方面表现出色;它们可以描述一个场景、识别一只狗,或解释一个复杂的事件。然而,当研究人员尝试使用这些强大的模型来识别微动作这类极其细微且特定的动作时,结果却令人失望。模型经常会完全忽略这些微妙的动作,转而根据人的外貌或模型自身的预期进行猜测,而不是基于视频中实际发生的情况。这就像是模型虽然看到了全景,却未能注意到那个包含答案的关键细节。
一个研究团队致力于探究为什么这些先进的模型在处理如此特定的任务时会失败,并试图在不从头开始重新训练模型的情况下找到解决方法。他们发现,问题并不在于模型缺乏观察运动的能力,而在于它们没有看向正确的地方,并且被自身的内部预期所误导。模型往往过度依赖从文本中学到的语言模式,即根据问题本身来猜测答案,而不是根据视频内容。它们还经常关注错误的身体部位,从而错过了定义该手势或面部动作的具体细节。
为了解决这个问题,研究人员开发了一种名为 Zero-MELO 的新方法。该方法不再要求模型立即给出单一答案,而是设计了一个强制模型像一名细心的观察者一样工作的过程。首先,系统要求模型观察视频,并识别哪些身体部位可能具有相关性,例如手部、脸部或颈部。接着,系统引导模型对这些特定区域进行“放大”,通过创建一系列局部特写视图来收集更充分的证据。这类似于人类可能会眯起眼睛并凑近屏幕以看清微小细节,但计算机是在整个视频范围内有系统地进行这一过程。
一旦模型收集了这些详细的局部视图,系统就会执行第二步以纠正其自身的偏差。研究人员发现,模型往往有一种强烈的倾向,即无论视频内容如何,都会倾向于猜测某些常见的答案。为了抵消这种影响,系统会让模型想象视频在没有任何动作或视觉细节时的样子,然后再想象仅保留该人物静态外观时的样子。通过将这些“假设场景”与实际视频进行对比,系统可以剔除模型的错误猜测,转而专注于真实的视觉证据。最后,系统将来自不同放大视图的信息和修正后的评分结合起来,做出最终判断。
这一方法的成果非常显著。在包含数千个微动作示例的标准数据集上进行测试时,这种新方法大幅提升了模型的准确率。在一个数据集中,成功率从大约 16% 跳升至接近 27%;而在另一个数据集中,成功率则从 10% 提高了一倍以上,达到了 22% 以上。这些数字代表了实质性的飞跃,表明只要引导模型仔细观察并审慎思考,这些模型其实一直具备理解这些微妙动作的能力。
这项研究表明,当前人工智能在理解精细人体运动方面的局限性,并不一定是因为缺乏智能,而是缺乏正确的注意力聚焦工具。通过教会模型寻找特定证据并质疑自身的假设,研究人员证明了可以通过引导,使这些系统在需要敏锐洞察力的任务中变得更加可靠。这项工作不仅改进了单一的任务,也为如何帮助人工智能像人类观察身体细微语言那样,以同样的精准度和细节关注度去观察世界,提供了一种全新的思考方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。