← 最新论文
🤖 AI

ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding

该论文提出了 ST-Veto,这是一种无需训练的方法,它通过在与顺序无关的生成过程中利用二阶泰勒预测和视觉接地来否决不稳定或弱接地的标记,从而增强扩散多模态大语言模型,进而显著提高推理准确性,且无需额外的训练或成本。

原作者: Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机不仅仅是读取文字或观察图片,而是能真正理解它们如何组合在一起以解决谜题的世界。这就是“视觉语言模型”(Vision Language Models)这一令人兴奋的前沿领域,它像是一个超级聪明的侦探,将所见之物与所知之物结合在一起。长期以来,这些侦探的工作方式就像一个人从头到尾逐字逐句地写故事。这种被称为“自回归”(autoregressive)生成的方法非常擅长循序渐进地思考,但它有一个巨大的缺陷:如果侦探在早期犯了错,他们很难在不重写整个故事的情况下进行修正。他们只会把更多的错误堆叠在第一个错误之上。

最近,科学家们发现了一种让这些 AI 侦探工作的新方式,叫做“扩散”(diffusion)。与其从头开始写故事,不如想象 AI 从一个充满空白空间(或“掩码”)的页面开始,然后通过反复细化自己的猜测来逐渐填满它们。这就像是在看一张模糊的照片,照片逐渐变得清晰。这种新方法更快,并且允许 AI 一次性观察全局,并在过程中修正错误。但问题在于:虽然这种新方法在速度上表现出色,但它有时会对“先填入什么”感到困惑。它可能会选择一个听起来不错但实际上与图片不符的词,或者可能会陷入一个每秒钟都在改变主意的猜测中。大问题在于:我们如何帮助这种新型 AI 清晰思考并坚持事实,同时又不降低它的速度或教它新的技巧?

于是,研究人员提出了一个名为 ST-Veto 的聪明策略,旨在帮助这些“扩散”AI 模型更好地思考。把 AI 的过程想象成一群朋友在决定晚餐点什么。在旧的方法中,他们会选出一道菜,确定下来,然后转向下一道。在新的扩散方式中,他们同时大声说出各种想法,然后逐渐就最好的选项达成一致。问题在于,有时候一个朋友大喊“披萨!”,仅仅是因为听起来很有趣,但一秒钟后又改口说“沙拉”,或者他可能只是很喜欢“披萨”这个词,但菜单上的图片明明是一个汉堡。

ST-Veto 就像一位观察着整个群体的明智裁判。它使用两个特殊的工具来决定哪些想法是安全的可以保留,哪些应该被丢弃。首先,它检查稳定性(stability)。它会问:“这个想法是刚刚冒出来的,还是已经保持一致了?”如果一个词一直在变卦(比如一个朋友一会儿说“披萨”,一会儿说“塔可”,一会儿又说回“披萨”),裁判就会使用一种叫做“泰勒预测”(Taylor prediction)的数学技巧来识别这种不稳定性,并说:“不,这太摇摆不定了,让我们尝试另一个选项。”其次,它检查视觉对齐(visual grounding)。它会观察图片并询问:“这个词真的符合我们看到的吗?”如果 AI 想说“叉子”,但图片里明明显示的是“刀”,裁判就会利用“注意力机制”(attention)发现 AI 并没有真正看向那把刀,从而否决掉“叉子”这个词。

论文表明,通过使用这种“否决并替换”(Veto-and-Swap)的方法,AI 可以将那些摇摆不定或不匹配的猜测替换为更安全、更准确的选项,且无需任何额外的训练或降低速度。当研究人员在涉及图像和文本的复杂推理谜题上测试时,ST-Veto 帮助 AI 的正确率比之前提高了高达 9%。这就像是给 AI 戴上了一副眼镜,帮助它分辨哪些想法是稳固的,哪些仅仅是白日梦,从而让它在解决科学问题或描述复杂场景时都能给出更聪明的答案。最棒的是,这是一个即插即用的免费升级,它无需改变模型的构建方式,就能让这些强大的新 AI 模型变得更加可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →