LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
该论文介绍了 LaViT,这是一个通过对齐潜在视觉思维(latent visual thoughts)和注意力轨迹(attention trajectories)而非静态嵌入来弥合多模态蒸馏中感知差距的框架,从而使紧凑型模型能够实现足以媲美大型专有系统的卓越视觉推理性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何破解谜题。在人工智能的世界里,有一种特殊的机器人叫做多模态大语言模型(MLLM)。把它们想象成超级聪明的侦探,它们可以同时阅读线索(文本)并观察犯罪现场的照片(图像)。长期以来,这些机器人非常擅长描述它们所看到的事物,但当涉及到“推理”——即弄清楚某事为什么会发生或解决棘手的谜题时——它们往往会陷入困境。它们会看着图片,然后停止观察,仅仅根据它们从书中读到的知识来猜测答案。这就像一个侦探看到了一个泥泞的脚印,却忽略了它,而是根据直觉猜测凶手是谁。
最近,科学家们发现了一个被称为“潜意识推理”(latent reasoning)的新技巧。这些机器人不再需要用文字写出思考的每一个步骤(就像写长篇日记一样),而是开始将它们的思想压缩成大脑内部看不见的、连续的“低语”。这更加快速且高效。但问题在于,当科学家尝试让较小、更便宜的机器人向更大、更聪明的机器人学习(这个过程被称为“蒸馏”)时,发生了一些奇怪的事情。这些小机器人学会了说出正确的词汇,但它们并没有真正看向图片的正确部分。它们只是在模仿老师的声音,而没有理解视觉线索。这篇名为 LaViT 的论文正是为了修复这种“言之有物,却视而不见”的断裂连接。
“看而不见”的巨大缺陷
开发 LaViT 的研究人员注意到了一种他们称之为**感知差距(Perception Gap)**的奇怪现象。想象一下,你有一位大师级厨师(“老师”模型)和一名年轻学徒(“学生”模型)。学徒看着厨师烹饪一道复杂的菜肴。如果你只是要求学徒写下食谱,他们可能会把文字写得完美无缺:“加入两杯面粉,搅拌三分钟。”但如果你要求他们实际动手操作,他们可能会把面粉倒在地上,因为他们从未真正观察过厨师的手部动作;他们只是背下了文字。
在 AI 世界中,研究人员发现,当他们训练小型模型去模仿大型模型的答案时,小型模型变得非常擅长“文本模仿”。它们可以产生正确的答案,比如“点 A 更近”,但它们的内部“眼睛”(视觉注意力)却在看向图像中完全无关的部分。它们依赖于语言技巧——基于常用短语进行猜测——而不是真正观察视觉证据。这就像一个学生通过背诵答案解析来通过考试,却根本没有理解课程内容。
解决方案:LaViT(潜意识视觉思维)
为了解决这个问题,团队创建了 LaViT,这是一个全新的训练框架,它强制要求学生机器人先进行“视觉思考”然后再开口说话。LaViT 不仅仅是复制最终答案,它会让学生首先生成一系列不可见的“思维标记”(thought tokens)。把这些标记想象成一种心理草图或一段无声的内心独白,机器人在心里对自己说:“好吧,在决定哪个点更近之前,我需要观察这里的阴影和那里的角度。”
LaViT 的魔力在于两个主要技巧:
- 对齐“内眼”: 该系统不仅检查学生的最终答案是否与老师匹配,它还会检查学生的“注视点”。它强制要求学生重建老师的视觉注意力图——即老师在图像上移动视线的特定路径。如果老师通过观察阴影来判断深度,那么学生也必须看向阴影,即使学生此时还没有说出一个字。
- “感官门控”课程: 这是最有趣的部分。想象你在教别人骑自行车。如果你让他们立刻看到路面,他们可能只会顺着惯性滑行而永远学不会平衡。如果你完全蒙住他们的眼睛,他们会摔倒。LaViT 使用了一种“课程感官门控”(Curriculum Sensory Gating)机制。在训练开始时,它会部分遮挡学生直接观察图像的视野。它迫使学生完全依赖那些不可见的“思维标记”来解决问题。随着学生变得越来越好,“眼罩”会被慢慢揭开,允许他们重新看到图像,但此时他们已经学会了如何在内部处理视觉线索。这防止了机器人通过基于文本的猜测来走“捷径”。
他们的发现
结果令人惊讶地强大。研究人员测试了他们这个新的 30 亿参数模型(相对较小且紧凑),将其与更大的模型甚至一些最先进的商业模型进行了对比。
- “小巨人”: 他们这个经过 LaViT 训练的 3B 微型模型,表现优于更大的 7B 模型,甚至在几项复杂的视觉推理任务上击败了著名的 GPT-4o。例如,在一项名为“相对深度”(判断哪个物体更近)的任务中,LaViT 得分为 78.23%,而 GPT-4o 得分为 64.52%。
- 修复幻觉: 研究表明,如果没有这种方法,模型在观察不够仔细时经常会产生“幻觉”(编造事实)。LaViT 显著减少了这种情况,将细粒度感知测试的表现提升了高达 +16.94%。
- 稳定性: 研究人员还发现,LaViT 不仅仅是在模仿老师,它实际上变得更加稳定。虽然庞大的老师模型有时会有“摇摆”的注视(对于相似的图像会看向略微不同的位置),但 LaViT 学生学会了以激光般的精准度进行聚焦,忽略背景噪音,并锁定关键细节。
为什么这很重要
这篇论文表明,让 AI 变得更聪明的秘诀不仅仅是让模型变得更大或喂给它们更多的数据。关键在于教它们如何观察。通过迫使 AI 将其内部的“视觉思维”与其最终的语言对齐,LaViT 创建了一个真正理解所见之物的模型,而不是仅仅猜测它应该说什么。这是“背诵地图的机器人”与“真正学会导航地形的机器人”之间的区别。作者提出,这种方法可能是构建强大 AI 的更高效途径,证明了一个经过良好训练的小型大脑往往能胜过一个庞大但分心的脑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。