VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models
本文介绍了 VideoHarness-RSI,这是一个递归自我改进框架,旨在围绕冻结的视觉语言模型优化用于长视频理解的可执行上下文构建程序,证明了仅通过改进 harness 即可获得显著的性能提升,并能有效地跨基准测试进行迁移。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:VideoHarness-RSI
问题陈述
即使底层模型非常强大,长视频理解对于视觉语言模型(VLMs)而言仍然是一个重大挑战。核心瓶颈并不一定是模型的推理能力,而是上下文构建(context construction):即如何从包含数千帧无关帧的视频中,选择并组织出一组有限的视觉观测结果。
现有方法通过压缩、检索、记忆或智能体证据获取来解决这一问题。然而,这些系统通常会同时修改多个组件(例如,同时改变模型、检索机制和推理工作流)。这使得人们难以隔离出一个特定的问题:在保持 VLM 及其接口完全固定的情况下,仅通过改进用于构建上下文的可执行程序,可以获得多少性能增益?
方法论:VideoHarness-RSI
本文介绍了 VideoHarness-RSI(递归式吊架自我改进,Recursive Harness Self-Improvement),这是一个受控框架,用于围绕冻结的 VLM 递归地搜索最优的可执行上下文构建器(吊架,harnesses)。
核心框架
该系统将“吊架”视为一个程序 ,它将视频-问题对 映射为一个受限的多模态上下文 ,随后将该上下文输入给冻结的 VLM 以生成答案 。
优化目标是在固定的上下文约束 下,最大化在可执行程序空间 上的开发准确率。
吊架分解
作者将任何吊架在分析上分解为三个功能阶段,尽管这些阶段并非作为独立的优化目标,而是作为程序变异的路径:
- 写入(Write, ): 构建视频的可寻址表示(例如:流、标题列表或嵌入索引)。
- 读取(Read, ): 基于问题 检索证据。
- 打包(Pack, ): 对受限上下文进行排序并格式化,以供 VLM 使用。
递归搜索协议
搜索通过一个提出、执行和评估吊架变异的外部循环运行:
- 提议者(Proposer): 一个基于 LLM 的提议者(Claude Opus 4.6)根据当前最佳程序的边界()和包含历史代码、评分及执行轨迹的存档()来生成候选吊架代码。
- 评估(Evaluation): 候选程序经过“冒烟测试”,并在开发集()上进行端到端评估。
- 选择(Selection): 更新规则非常严格。只有当候选程序 的开发准确率 严格超过当前边界的准确率时,它才会被提升至新边界 。
- 约束(Constraints): 在整个搜索过程中,VLM(Qwen3-VL-8B-Instruct)、其解码配置以及评估指标均保持固定。搜索不会触及模型参数。
实验设置
- 数据集: LVBench(经过过滤后剩余 1,232 个问答对)。使用 350 个问题进行搜索/开发;保留 882 个问题用于留出集(held-out)评估。
- 基线(Baselines): 与预设的均匀采样、受文献启发的专家手工设计吊架(如 AKS、WorldMM 式、Homer 式)以及均匀采样下的专用 VLM 进行对比。
- 成本指标: 输入侧上下文成本被衡量为每个问题中视觉标记(tokens)与辅助文本标记的总和,不包括离线索引成本。
关键结果
1. 搜索带来的性能增益
递归搜索在弱基线和强基线之上都一致地提升了性能:
- 相对于均匀采样: 从随机均匀采样基线(准确率 36.3%)开始,搜索发现了 EMBEDNAVIGATE-HYBRID,它在留出集上达到了 45.4%。
- 相对于强手工基线: 从强手工基线(AKS, 46.5%)开始,搜索发现了 TIMESTAMPED-AKS,它将留出集准确率提升至 50.3%。
- 跨基准测试迁移: 在 LVBench 上选定的吊架在无需进一步搜索或适配的情况下,直接应用于 Video-MME 和 MLVU。它们在两个基准测试上均优于均匀采样(例如,在 Video-MME 上为 61.5% vs 59.9%),表明发现的策略具有可迁移性。
2. 改进机制
对发现的吊架进行的分析揭示了不同的策略:
- 导航 vs. 检索: 搜索发现,将时间导航(利用标题将采样聚焦在相关时间区域)与视觉相似性检索(使用 CLIP 嵌入)相结合,比单一使用其中之一效果更好。
- 证据可见性: 混合吊架不仅通过暴露更多的标注证据区间(增加“可见”帧)来提高准确率,还通过改善性能解决了证据丢失的问题,这表明上下文的组织和密度至关重要。
- 问题类型敏感性: 导航策略对时间性和推理类问题特别有效,而视觉检索则有助于实体和关键信息类问题。
3. 成本-准确率权衡
搜索揭示了准确率与输入 token 成本之间的帕累托前沿(Pareto frontier)。
- EMBEDNAVIGATE-HYBRID 实现了高准确率,但由于额外的导航过程,产生了显著的文本开销。
- TIMESTAMPED-AKS 以较小的输入占用实现了最高的准确率,证明了搜索可以找到手工基线可能错过的更高效配置。
意义与主张
本文将 VideoHarness-RSI 定位为研究自动化吊架设计的受控基线。其主要贡献和主张如下:
- 变量隔离: 它确立了可执行上下文构建是一个独立的优化层。通过优化“吊架”(管理模型所见内容的程序),可以在不重新训练模型或改变其接口的情况下获得显著收益。
- 可复现性: 作者提供了一个可审计的存档,包含候选代码、父代关系、执行轨迹和评分,为未来的吊架发现研究提供了一个可复现的基线。
- 可迁移性: 结果表明,在一个基准测试上发现的吊架可以迁移到其他基准测试而无需重新搜索,这表明搜索发现的是通用的上下文构建策略,而非针对特定数据集特征的过拟合。
- 局限性: 作者谦逊地指出,搜索边界在早期改进后经常会出现平台期,且“严格”的点估计选择在统计上并不保证泛化能力,尽管留出集的实验结果支持了该方法。他们还澄清,其成本指标反映的是输入 token 量,而非端到端延迟或货币成本,因为离线索引成本各不相同。
总之,本文认为,对于长视频理解,围绕冻结 VLM 的“系统”是一个关键且可优化的组件,可以通过递归自动化程序搜索进行改进。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。