Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models
本文提出了一种无需训练的推理方法——视觉冗余控制解码(VRCD),该方法用于基于扩散的多模态大语言模型,通过优先选择视觉互补位置以减少冗余,从而克服独立基于置信度的词元选择的局限性,并显著提升在多模态基准测试中的准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和创意类比对该论文的解读。
全局概览:一群艺术家共同绘制一幅画
想象你有一支艺术家团队,试图根据一段描述来绘制一幅场景图。在旧的方法(称为“自回归”)中,他们会一次只画一笔,必须等上一笔干了之后才开始画下一笔。这非常缓慢。
本文描述的新方法(称为基于扩散的多模态大语言模型,或dMLLMs)则像是一支并行工作的艺术家团队。他们不是画一笔,而是审视整个画布,同时猜测画面中许多不同部分应该呈现的样子,然后决定哪些猜测足够好,可以“锁定”为最终画面。
问题所在:所有人都在盯着同一个地方
论文指出了这类团队目前在选择要“锁定”哪些猜测时存在的一个具体问题。
通常,团队领导者会查看每位艺术家的猜测,然后说:“好的,艺术家 A 对这棵树有 90% 的把握,艺术家 B 对那棵树也有 90% 的把握。让我们把这两个都锁定吧!”
缺陷在于: 论文指出,艺术家 A 和艺术家 B 可能都在参考图中盯着同一棵树。他们都很自信,但提供的是冗余信息。他们都在盯着同一个视觉细节。
因为他们锁定了两个关于同一棵树的猜测,团队现在就把视觉注意力“耗尽”在了这一个点上。在下一轮绘画中,他们剩下的视觉信息就不足以帮助他们弄清楚画面的其他部分(比如天空或草地)。
作者将这种现象称为**“视觉冗余”**。这就像有一个委员会,所有人都在对同一件事投票,导致没有人去投票决定其他重要议题。
解决方案:“视觉冗余控制器”(VRCD)
为了解决这个问题,作者为团队领导者制定了一条新规则,称为VRCD(视觉冗余控制解码)。
VRCD 不再仅仅询问“谁最自信?”,而是问:“谁既自信,又在观察画面的不同部分?”
以下是 VRCD 的工作步骤:
- 候选名单: 首先,它收集那些对猜测最自信的顶尖艺术家(和以前一样)。
- “视线”检查: 它查看每位艺术家在参考图中盯着哪里。它使用一种特殊工具(称为“令牌到图像注意力”)来判断艺术家 A 和艺术家 B 是否盯着同一片叶子或同一朵云。
- 惩罚机制: 如果两位艺术家盯着同一个地方,VRCD 会给他们一个“冗余惩罚”。它会说:“你们都对,但你们在重复彼此。”
- 选择: 随后,VRCD 挑选出那些既自信、又观察了图像中最多样化、最互补部分的艺术家群体。
结果:更佳的团队动态
通过迫使团队挑选观察图像不同部分的艺术家,论文发现:
- 减少混淆: 团队不会浪费时间重新检查同一个物体。
- 更好的语境: 因为他们锁定了一组多样化的细节(一棵树、一朵云和一辆车),剩余的艺术家在下一轮猜测画面其余部分时,拥有了更丰富的“语境”作为辅助。
- 速度: 团队不会明显变慢。这是一个非常轻量级的检查,就像快速扫视一眼,而不是全面重新评估。
证据
作者在涉及图像和文本的多个高难度谜题(基准测试)上测试了该方法,例如:
- M3CoT: 包含多步骤的复杂推理问题。
- MMBench: 通用的视觉与语言理解。
他们发现,与标准方法相比,使用 VRCD 使模型的准确率显著提高(在某些复杂任务上甚至提高了近 19%)。模型犯的错误更少,因为它们不再对相同的视觉线索“重复利用”。
总结类比
想象你和一群朋友正在拼拼图。
- 旧方法: 你问大家:“哪块拼图适合这里?”然后你抓起任何人说适合的前三块拼图,即使它们全是天空部分的碎片。结果你手里有了三块天空碎片,却没有一块地面碎片。
- VRCD 方法: 你问:“哪块适合这里?”然后你抓取那些适合的碎片,但你会确保不抓取三块天空碎片。你抓取一块天空碎片、一块地面碎片和一块树木碎片。现在,当你尝试填补拼图其余部分时,你对整幅画面的全貌有了更好的概念。
这篇论文只是教会 AI 如何成为一个更好的拼图组装者,方法是确保它在每一步都挑选一组多样化的视觉线索。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。