← 最新论文
🤖 AI

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

OmniFocus 是一种针对全模态大语言模型的无需训练、查询引导的 Token 压缩方法,它通过独立评估音频和视频 Token 的重要性来实现模态对称压缩,从而在降低推理成本的同时保持跨模态对齐,并在准确率与效率的权衡方面优于现有基准方法。

原作者: Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你有一个超级聪明的机器人助手(一个全模态大语言模型),它能同时观看视频并聆听音频。这个机器人非常出色,但它有一个问题:当你给它看一段带有声音的长视频时,它会试图读完转录文本中的每一个字,并观察视频中的每一帧。这就像是为了回答“天空在某一场景中是什么颜色”这样一个简单的问题,却试图去阅读整部百科全书。这使得机器人运行缓慢、成本高昂,并且会被过量的信息所淹没。

这篇论文介绍了一种名为 OmniFocus 的新方法,旨在让这个机器人变得更快、更聪明,且无需重新训练。以下是它的工作原理,我们使用简单的类比来解释:

问题所在:“不平衡”的向导

此前,研究人员曾尝试通过让机器人忽略视频或音频中的“无聊”部分来提高速度。然而,他们通常只使用一种感官来决定哪些部分应该被忽略。

  • 缺陷: 想象你正在看一档烹饪节目。如果你仅通过聆听厨师的声音来决定视频的哪些部分重要,你可能会错过关键的视觉步骤(例如“锅里的水正在沸腾”),因为厨师还没提到这一点。反之,如果你只看视频,你可能会错过细微的声音(例如煎锅的滋滋声),而这个声音能告诉你食物快烧焦了。
  • 结果: 机器人会变得擅长回答音频问题,但在处理视觉问题时表现糟糕,或者反之亦然。它会对它所使用的引导感官产生“偏见”。

解决方案:OmniFocus(“查询侦探”)

OmniFocus 通过像一名在决定保留什么之前先听取你的具体问题(即“查询/Query”)的侦探一样来解决这个问题。

  1. 先听问题:
    与其靠猜测什么重要,OmniFocus 会先看你的问题。如果你问:“演讲者关于预算说了什么?”侦探就知道要关注音频。如果你问:“那辆车是什么颜色的?”它就知道要关注视频。

  2. 两个独立的团队(模态平衡):
    该方法将视频和音频视为两个独立的团队。它询问视频团队:“这段视频的哪些部分与问题相匹配?”并询问音频团队:“这段音频的哪些部分与问题相匹配?”

    • 类比: 想象你在为旅行收拾行李。你不是直接把“衣服”抽屉里的所有东西(视频)或“鞋子”抽屉里的所有东西(音频)都扔进去;而是先看你的行程单(问题)。你会带上远足所需的特定鞋子和防雨所需的特定夹克。你不是把整个抽屉都装进去,而是只带上旅行所需的物品。
  3. “双重评分”选择机制:
    一旦侦探确定了哪些时间段是重要的,它就会利用两条规则来挑选要保留的具体“Token”(数据片段):

    • 规则 A(握手): 保留视频和音频相互吻合或匹配的部分(例如:关门声与关门的视觉画面相符)。
    • 规则 B(出众): 保留那些在其自身类别中非常独特或响亮的部分(例如:音频中一个非常独特的声响,或者视频中一个明亮的闪光),即使另一个感官没有对应的信号。

结果:更快、更聪明

研究人员在 Qwen2.5-Omni 系列模型(即这些“机器人”)上测试了该方法。

  • 效率: 通过丢弃那些与问题不匹配的“无聊”部分,机器人的运行速度提升了 1.38 倍,并且减少了内存占用。
  • 准确性: 尽管我们丢弃了 75% 的数据(仅保留了 25%),但机器人的回答表现甚至比之前的方法更好。它没有丢失其“常识”,因为它保留了来自视频和音频中最重要的线索。

总结

OmniFocus 就像是一个坐在机器人面前的智能过滤器。它不是盲目地根据单一感官来删除数据,而是先听取你的问题,分别检查视频和音频,并只保留来自两者的最相关“线索”。这使得机器人运行得更快、成本更低,并且由于不再被无关的噪音干扰,其准确性也出奇地高。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →