InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs
该论文提出了一种名为 InfoTok 的信息论正则化方法,通过基于信息瓶颈原理的互信息约束,在统一多模态大模型中实现了共享视觉 Token 化机制在压缩效率与任务相关性之间的最优平衡,从而在不增加额外训练数据的情况下同时提升了图像理解与生成性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文提出了一种名为 InfoTok 的新方法,旨在解决当前“全能型”人工智能(既能看图说话,又能看图画画)模型中的一个核心痛点。
为了让你轻松理解,我们可以把整个故事想象成**“一个忙碌的翻译官”和“一个有限的行李箱”**。
1. 背景:全能翻译官的困境
想象你有一个超级聪明的翻译官(这就是现在的多模态大模型,MLLM)。他的工作有两个:
- 看图说话(理解):给你看一张复杂的风景照,他需要告诉你“这是山,那是水,云很白”。这需要他抓住核心意义(语义)。
- 看图画画(生成):给你看一张风景照,他需要画出一张一模一样的新图。这需要他记住每一个细节(比如树叶的纹理、光影的微小变化)。
问题出在哪里?
现在的翻译官只有一个**“行李箱”**(这就是论文说的“共享 Token 空间”)。无论他是去“理解”还是去“画画”,他都必须把图片塞进这个行李箱里,然后带着箱子去工作。
- 如果箱子装满了细节(比如树叶的纹理),他画画时很完美,但去“理解”时,因为箱子太满,他没时间思考“这是山还是树”这种大道理,导致理解能力变差。
- 如果箱子只装大意(比如“这是一座山”),他理解能力很强,但去“画画”时,因为缺了细节,画出来的山像纸片一样,没有质感。
以前的做法是:要么给翻译官配两个箱子(一个装细节,一个装大意),但这太笨重且浪费资源;要么硬塞一个箱子,结果就是“顾此失彼”。
2. 核心观点:容量受限的视角
这篇论文的作者提出了一个非常聪明的视角:这个行李箱的容量是有限的,而且翻译官的脑子(算力)也是有限的。
作者认为,在这个有限的空间里,并不是所有信息都同等重要。
- 高熵的噪音(比如树叶上随机的灰尘、光线偶尔的闪烁):这些信息很难利用,而且占地方,应该扔掉。
- 可复用的结构(比如山的形状、人的轮廓、物体的位置关系):这些信息既对“理解”有用,也对“画画”有用,是真正的宝藏。
InfoTok 的核心思想就是: 在把图片塞进行李箱之前,先做一个**“信息筛选”**。我们要把那些没用的噪音过滤掉,只把最精华、最通用的“结构宝藏”装进去。
3. 解决方案:InfoTok(信息正则化)
作者给这个筛选过程起名叫 InfoTok。它就像给翻译官戴上了一副**“智能眼镜”,这副眼镜基于一个叫做“信息瓶颈”(Information Bottleneck)**的理论。
这副眼镜有三个功能,就像三个过滤器:
压缩过滤器(Compactness):
- 比喻:就像整理行李时,把那些“虽然好看但没用”的装饰品(高熵噪音)扔出去。
- 作用:强迫模型只保留最核心的信息,不让行李箱被垃圾信息塞满。
任务过滤器(Sufficiency):
- 比喻:确保扔东西的时候,别把“护照”和“地图”扔了。
- 作用:保证留下的信息足够让翻译官完成“看图说话”和“看图画画”两个任务。
对齐过滤器(Alignment):
- 比喻:确保行李箱里的东西,翻译官能跟“文字语言”顺畅地交流。
- 作用:让视觉信息和语言信息更合拍,避免“鸡同鸭讲”。
4. 怎么做到的?(技术上的“魔法”)
理论上,要计算“哪些信息有用”非常难,就像要计算“这堆沙子到底有多少粒”一样,几乎算不过来。
作者用了两个聪明的数学工具(VIB 和 HSIC)来近似这个计算。你可以把它们想象成**“智能估重器”**:
- 它们不需要知道每一粒沙子的具体位置,而是通过统计规律,告诉模型:“嘿,这部分信息太乱了,扔掉;那部分信息很关键,留下。”
- 这样,模型在训练时就能自动学会:“少记点杂乱的细节,多记点通用的结构。”
5. 结果如何?
作者把这个方法应用到了三个现有的顶级模型(Harmon, OpenUni, Show-o2)上。
- 没有增加任何新数据:就像没有给翻译官买新书包,也没有给他看更多的书,只是教了他**“怎么整理行李”**。
- 效果惊人:
- 看图说话更聪明了(因为抓住了重点)。
- 看图画画更逼真了(因为保留了关键的结构和细节,去掉了干扰)。
- 图 3 的对比显示:用 InfoTok 后,模型能更准确地听懂指令(比如“把红球放在蓝球左边”),画出来的图也更符合逻辑。
总结
这篇论文就像是在告诉 AI 开发者:
“别再拼命给模型塞更多数据或造更大的模型了。与其让模型‘什么都记’,不如教它**‘学会遗忘’**——忘掉那些无用的噪音,只记住那些对理解和创作都至关重要的核心结构。”
InfoTok 就是这套**“学会遗忘”**的整理术,它让 AI 在有限的资源下,变得更聪明、更全能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。