Scalable Visual Pretraining for Language Intelligence
本文通过证明在保留了图表和布局等丰富信息的原始视觉文档上进行无监督视觉预训练,能够持续优于仅文本的方法并为增强语言智能提供一条可扩展的路径,从而挑战了基础模型预训练中仅限文本的范式。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个超级聪明的机器人如何理解这个世界。长期以来,标准的配方是给它喂食大量的书籍、文章和网页,但有一个限制:在机器人阅读之前,人类(或计算机)会把所有的图片、弯弯曲曲的数学符号、图表和花哨的页面布局全部剥离掉,将一切转化为纯粹的、枯燥的文本。这就像是在试图通过只给一个人一份写在餐巾纸上的食材清单来教他如何烤蛋糕,同时却扔掉了做好的蛋糕照片、搅拌碗的示意图,以及显示烤箱温度变化的彩色图表。
一篇来自2026年的新论文指出,这种“仅限文本”的方法遗失了拼图中的巨大一块。研究人员(由来自上海和浙江的团队领导)认为,通过丢弃文档中的视觉部分,我们实际上丢弃了机器人变得真正聪明所需的关键线索。他们将这种新方法称为视觉预训练(Visual Pretraining, VP),这就像是教机器人去阅读教科书的实际页面,包括其中的图表和方程式,而不是仅仅阅读文字描述。
重大发现:眼见为实(且有助于学习)
该团队在一些最智能的AI模型(如Qwen和Llama)上测试了这个想法。他们采用了完全相同的科学文献堆——想想物理论文、数学教科书和技术报告——并将它们分为两组。
- A组(旧方法): 他们将页面转换为纯文本,剥离了所有视觉元素。
- B组(新方法 - VP): 他们直接将页面的原始图像输入模型,让模型能够“看到”其中的图形、表格和布局,而无需预先将其转化为文字。
结果显示,接受原始图像训练的机器人(B组)始终比接受纯文本训练的机器人(A组)更聪明。事实上,在复杂的科学和数学基准测试中,视觉学习者的得分更高。例如,在名为AIME的高难度数学测试中,视觉模型的得分提升幅度显著高于文本模型。论文表明,将包含复杂图表的页面转换为字符串的过程是一种“有损”过程,这种过程实际上删除了解决难题所需的关键信息。
效率黑科技:以少胜多
这里最酷的部分是:视觉方法不仅更好,而且更加高效。基于文本的模型需要吞噬大约 800亿 个文本Token才能从这些文档中学习。然而,视觉模型仅需大约 200亿 个视觉Token就能获得相同(甚至更好)的结果。这意味着它只使用了 25% 的数据预算!
你可以这样理解:如果文本模型试图通过列出每一条街道名称和建筑地址来描述一座城市,那会耗费很长时间。相比之下,视觉模型只需看一眼地图,就能瞬间掌握全局。研究人员发现,一个页面中的“视觉内容”(如复杂的图表和公式)越多,视觉模型的优势就越大。在充满图表和公式的页面上,视觉模型的优势呈爆炸式增长;而在纯文本页面上,两者的表现则相差无几。
没有作弊码,只有纯粹的视觉
你可能会想,“他们是不是通过向机器人展示图片和答案来作弊的?”并没有。他们没有使用任何特殊的“图像转文本”标签或作弊表。机器人只是被要求观察图像的下一个区块,并预测它看起来会是什么样子,这与它在句子中预测下一个单词的方式类似。
令人惊讶的是,这种“仅仅通过观察”的训练让机器人的各项能力都得到了提升,而不仅仅是视觉能力。它在理解文本方面变得更强,甚至在稍后的测试中,在将图片与文字联系起来的能力上也表现得更好。研究人员通过检查机器人的“大脑”如何将图片与文字对齐来衡量这一点,并发现视觉训练使这两个概念结合得更加紧密,仿佛机器人终于理解了“猫的照片”和“猫”这个词其实是同一回事。
这意味着什么(以及不意味着什么)
作者们谨慎地表示,这并不是一个可以取代阅读文本的万能药。对于那些已经清晰写下的事实,文本仍然非常有效。但对于科学文献而言——其中布局、方程式的形状以及图表的位置都承载着至关重要的意义——视觉方法暗示了一条新的、可扩展的路径。
他们承认目前尚未解决所有问题。例如,他们不确定这种方法是否同样适用于自然界的随机照片或视频,因为他们的测试主要集中在高密度的科学PDF文档上。但对于学习复杂文档这一特定情况,论文表明,让AI以其原本的样子——视觉化的、凌乱的、充满图表的形态——去观察世界,可能是解锁其真正智能的关键。这是一种从“阅读地图的描述”到“实际观察地图”的转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。