← 最新论文
💻 computer science

LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations

本文提出了 LIMSSR,这是一个由大语言模型驱动的框架,通过将任务重构为条件序列推理问题,解决了训练阶段多模态观测信息不完整这一难题,从而在不依赖训练期间全模态数据可用这一不切实际假设的情况下,超越了最先进的基线方法。

原作者: Huangbiao Xu, Huanqi Wu, Xiao Ke, Yuxin Peng

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Huangbiao Xu, Huanqi Wu, Xiao Ke, Yuxin Peng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和富有创意的类比对 LIMSSR 论文的解释。

核心难题:“破损相机”困境

想象你是一名体育裁判,正在为体操表演打分。在理想世界中,你拥有三台摄像机:一台拍摄运动员的身体(视频),一台以慢动作捕捉其动作(光流),还有一台记录呼吸和音乐(音频)。你综合这三路信息来给出公正的评分。

但在现实世界中,事情往往会出错。也许录音设备坏了,或者慢动作相机出现了故障。现在,你只有一台摄像机可用。传统的计算机程序会感到困惑并陷入恐慌;它们试图通过观察视频来“猜测”缺失的音频,但由于它们仅在完美的三机位 footage 上受过训练,往往猜错。它们会假设:“如果我看到了跳跃,就一定会有落地的闷响”,但这并不总是成立的。

新方案:“智能侦探”(LIMSSR)

这篇论文的作者提出了一种名为 LIMSSR 的新系统。他们不再试图逐像素地“重建”缺失的相机画面(这就像试图完美地重绘一张缺失的照片),而是将这个问题视为一个侦探故事

他们使用了一个大语言模型(LLM)——你可以把它想象成一位读过数百万本书、深知世界运作规律的超级聪明侦探。这位侦探不需要看到缺失的相机画面就能理解发生了什么;他们只需利用“世界知识”和他们手中已有的线索,就能推导出其余部分。

以下是该系统的逐步工作原理:

1. “缺失线索”提示(提示引导的上下文感知模态补全)

想象你在填写填字游戏,但有些线索缺失了。与其让空白处空着,你告诉侦探:“我有视觉线索,但音频线索缺失了。根据我所看到的,音频线索可能是什么?”

系统将可用数据(如视频)和缺失数据(损坏的音频)封装在一个特殊的文本指令(即“提示”)中。它告诉大语言模型:“这是我们要有的,这是我们要缺失的。请运用你的大脑,从语义层面而非仅仅是像素层面,去构想缺失部分的样子。”

2. “融合令牌”(大语言模型驱动的多维表示融合)

一旦侦探“构想”出了缺失的部分,系统就需要将真实的视频、真实的音频以及构想出的音频结合起来,得出一个统一的分数。

这就像一位厨师,他拥有真实的食材(视频)和缺失食材的食谱(构想出的音频)。厨师不会只是把它们扔进锅里,而是利用特殊的“插槽”(称为融合令牌)将它们完美混合。这些插槽确保最终的菜肴(分数)能捕捉到所有不同的风味:难度、完成度和艺术性。

3. “双重核查”(掩码感知的双路聚合)

有时,即使是聪明的侦探也会“产生幻觉”(编造不存在的事情)。为了防止这种情况,系统使用了一种双重核查机制

  • 路径 1(梦想家): 大语言模型利用其想象力来猜测缺失的信息。
  • 路径 2(统计学家): 系统观察其实际拥有的数据中的真实模式,以查看通常会发生什么。

随后,系统像一个交通信号灯一样,权衡这两条路径。如果缺失的数据量巨大(例如完全没有音频),它会稍微更信任“梦想家”,但会让“统计学家”随时待命以纠正任何疯狂的猜测。如果数据大部分都在,它会更信任“统计学家”。这确保了最终分数既具有创造性(聪明)又脚踏实地(准确)。

为何这很重要

大多数以前的系统就像那些仅使用完美教科书(所有相机都正常工作的数据)备考的学生。当他们在试卷缺页的情况下参加真实考试时,就会不及格。

LIMSSR 则不同。它是在页面缺失的情况下进行训练的。它学会成为一名侦探,即使证据不完整也能破案。

  • 无需“上帝视角”: 它在训练期间不需要看到数据的“完美”版本。它从一开始就学会处理缺失的部分。
  • 更高的分数: 在三个不同的运动数据集(花样滑冰、跳水和艺术体操)上的测试表明,即使在训练和测试期间数据都存在缺失,该系统的得分也高于所有之前的最佳方法。

总结

简而言之,LIMSSR 是一个智能系统,它利用一位“超级侦探”(大语言模型),通过逻辑和上下文来填补缺失的视频或音频数据的空白,而不是试图完美重建缺失的图像。随后,它会对自己的工作进行双重核查以避免错误,从而即使在数据混乱或不完整的情况下,也能为体育和动作提供高度准确的评分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →