← 最新论文
💬 NLP

ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning

ResAdapt 提出了一种输入侧自适应分辨率框架,通过轻量级分配器结合成本感知策略优化(CAPO)动态调整每帧的视觉预算,在保持多模态大模型骨干网络不变的前提下,显著提升了长视频上下文下的推理效率与精度。

原作者: Huanxuan Liao, Zhongtao Jiang, Yupu Hao, Yuqiao Tan, Shizhu He, Jun Zhao, Kun Xu, Kang Liu

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Huanxuan Liao, Zhongtao Jiang, Yupu Hao, Yuqiao Tan, Shizhu He, Jun Zhao, Kun Xu, Kang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ResAdapt 的新方法,旨在解决多模态大模型(MLLM)在处理长视频时“既想看清楚细节,又想看得久一点”的矛盾。

为了让你更容易理解,我们可以把整个过程想象成一位侦探在调查一桩复杂的案件

1. 核心矛盾:侦探的“精力”有限

想象你是一位侦探(也就是AI 模型),面前有一部长达几小时的监控录像(长视频)。你的任务是找出凶手或回答一个具体问题。

  • 传统做法的困境
    • 全看一遍:如果你把每一帧画面都看得清清楚楚(高分辨率),你的大脑(计算资源)会瞬间过载,根本看不完这么长的视频,或者看得很慢。
    • 快速浏览:如果你为了看完整个视频,把每一帧都缩得很小(低分辨率),虽然看完了,但关键的细节(比如凶器上的指纹、嫌疑人衣服上的小字)就模糊不清了,导致你答错了问题。
    • 现有的“聪明”办法
      • 事后压缩:有些方法先让 AI 把视频全看完,然后再把“不重要的信息”删掉。但这就像侦探看完录像后,把关键证据的复印件撕掉了,后悔也来不及了。
      • 反复追问:有些方法让 AI 先猜一下,如果不确定,再让 AI 去“放大”某一段看。但这就像侦探在审讯室里反复问同一个问题,效率很低,而且如果一开始猜错了方向,可能永远找不到真相。

2. ResAdapt 的解决方案:聪明的“资源分配官”

ResAdapt 的核心思想是:在侦探开始看录像之前,先派一个“资源分配官”(Allocator)来规划每一帧画面该花多少精力。

这个“分配官”就像一个精明的导演,他手里有一笔有限的“像素预算”(也就是计算资源)。他的工作不是均匀地把钱分给每一帧,而是根据问题画面内容动态调整:

  • 场景一:无聊的等待
    • 如果视频里是几分钟的静态背景,或者两个人在闲聊,分配官会想:“这部分不重要,把画面缩得很小(低分辨率)就行,省下的精力留给后面。”
  • 场景二:关键时刻
    • 如果视频里突然出现了文字、快速移动的动作,或者嫌疑人露出了真容,分配官会立刻大喊:“这里很重要!把画面放大,看得清清楚楚(高分辨率)!”
  • 场景三:相似的画面
    • 如果连续几帧画面几乎一模一样(比如一个人站着不动),分配官会想:“没必要每帧都放大,选一帧放大,其他的稍微模糊点就行。”

3. 它是如何学习的?(CAPO 与“开环”策略)

这个“分配官”不是靠死记硬背的规则,而是通过强化学习(就像训练一只聪明的狗)自己学会的。

  • 试错与奖励:系统会尝试不同的分配方案。如果分配官把精力花在了关键帧上,并且模型答对了问题,他就得到奖励;如果他把精力花在了无关紧要的地方,或者因为太省劲导致答错了,他就会受到惩罚。
  • 独特的“不对称”奖励:论文提出了一种叫 CAPO 的算法。它的逻辑是:“如果你省了钱(低预算)还答对了,给你大奖励;如果你花了大钱(高预算)却答错了,给你大惩罚。”这迫使分配官学会“把钱花在刀刃上”。
  • 开环策略(Open-loop):这意味着分配官在视频开始播放前就做好了所有决定。一旦决定,AI 就按这个计划执行,中间不会停下来重新思考。这就像电影拍摄时,导演在开拍前就定好了哪些镜头用特写,哪些用远景,而不是拍着拍着再改。

4. 效果如何?

实验结果表明,ResAdapt 非常有效:

  • 更长的视频:在同样的计算资源下,它能处理16 倍于普通方法的视频帧数。就像侦探原本只能看 1 小时的录像,现在能看 16 小时,而且关键细节一个没漏。
  • 更高的准确率:特别是在需要复杂推理的任务中(比如回答“为什么男孩最后拿起了毛巾?”),ResAdapt 比那些简单粗暴地删除画面的方法准确率高出很多。
  • 兼容性好:它不需要修改 AI 模型的核心结构,就像给现有的汽车装了一个智能导航系统,不需要换发动机就能跑得更快、更省油。

总结

ResAdapt 就像是给 AI 装上了一双会“聚焦”的眼睛。它不再傻乎乎地平均分配精力,而是学会了**“哪里重要看哪里,哪里不重要糊弄一下”**。

这就好比你在看一场精彩的球赛直播:

  • 普通方法:要么把整个球场都看得很清(累死),要么把全场都缩成小点(看不清进球细节)。
  • ResAdapt:平时看全景(低分辨率),一旦有人带球突破或射门,瞬间把镜头拉近到特写(高分辨率)。

这种方法让 AI 在处理超长视频时,既省了算力,又没丢下关键信息,是迈向“长视频智能理解”的一大步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →