← 最新论文
🤖 machine learning

Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?

本文研究了视觉模型自回归下一像素预测的缩放规律,揭示了分类任务与生成任务的最优策略存在分歧,并预测计算驱动的扩展将在五年内实现逐像素图像建模。

原作者: Xinchen Yan, Chen Liang, Lijun Yu, Adams Wei Yu, Yifeng Lu, Quoc V. Le

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinchen Yan, Chen Liang, Lijun Yu, Adams Wei Yu, Yifeng Lu, Quoc V. Le

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人去“看”世界。主要有两种方法:

  1. “智能摘要”法:你向机器人展示一张图片,但首先将其压缩为几个关键词或符号(例如将一张猫的照片转化为“猫”这个词)。这就是当今大多数人工智能的工作方式。
  2. “原始像素”法:你向机器人展示图片原本的样子,逐点、逐色地呈现,让它根据前面的点来猜测下一个点。这就像试图通过逐个记忆书中每一个字母来学习一门语言,却从未见过完整的单词。

这篇论文提出了一个简单却困难的问题:我们距离让“原始像素”法真正发挥作用还有多远?

作者决定通过训练人工智能模型来预测图像中的下一个像素,以此进行测试,他们从小的、低分辨率的图像开始(32x32 像素,看起来像微小的、块状的缩略图)。他们想看看这种简单、“笨拙”的方法最终能否扩展得与“智能摘要”方法一样强大。

以下是他们发现的四个重大结论,并辅以日常类比进行解释:

1. “像素与单词”的差距

发现:为了有效学习,原始像素所需的数据量是单词的10 到 20 倍
类比:想象教一个孩子阅读。

  • 单词(语言):如果你向孩子展示“猫”这个词,他们立刻就能理解那是一种会喵喵叫的毛茸茸动物。这是一个信息密集的数据包。
  • 像素(图像):如果你向孩子展示一个红色的单点,他们完全不知道那是什么。是鼻子?是停车标志?还是草莓?它仅仅是一个点。
    因为单个点承载的意义微乎其微,人工智能必须观察数百万个更多的点才能找出规律。论文发现,为了达到同等水平的智能,人工智能需要“阅读”的像素数据量,远多于它阅读文本所需的量。

2. 不同的目标需要不同的“配方”

发现:扩展人工智能的“最佳”方式完全取决于你希望它做什么。
类比:想象训练一名运动员。

  • 如果你想让他们成为短跑运动员(图像分类):你需要力量训练(更大的肌肉/模型)和跑步练习(数据)的平衡。
  • 如果你想让他们成为马拉松运动员(图像生成):你需要几乎完全专注于跑步练习(更多的数据)。
    论文发现,如果你希望人工智能识别图片中的内容,你只需让人工智能的“大脑”变得更大。但如果你希望人工智能创造补全图片(例如填充照片的下半部分),你需要给它提供规模大得多的示例库(数据),而不仅仅是让大脑变大。对于一项任务而言“最佳”的配方,对另一项任务来说实际上可能是糟糕的配方。

3. 分辨率陷阱:更大的图片需要更大的大脑

发现:随着图像分辨率的提高(更清晰、更详细),人工智能所需的规模增长速度,远快于它所看到的数据量的增长速度。
类比:想象试图学习一张城市地图。

  • 低分辨率(32x32):这就像看一张小城镇的地图。你可以通过多走多逛(更多数据)来掌握全貌。
  • 高分辨率(64x64 及以上):这就像看一张拥有摩天大楼和狭窄小巷的庞大都市地图。如果你的大脑太小,无法容纳所有复杂的细节,仅仅多走多逛是无济于事的。
    论文发现,随着图像变得更清晰,任务的“复杂度”呈爆炸式增长。为了应对这种情况,你不能只是给人工智能喂更多的图片;你必须构建一个大得多的人工智能大脑,以处理这些错综复杂的细节。

4. 瓶颈在于算力,而非资料

发现:我们并不是在等待更多的图片来让这种方法生效;我们在等待更快的计算机。
类比:想象你拥有一个图书馆,里面收藏了有史以来写下的每一本书(互联网上的视觉数据)。你有一个学生可以阅读所有这些书。问题不在于图书馆是空的;问题在于这个学生一年只能读一页。
作者预测,由于计算机能力的增长如此迅速(大约每年翻一番),我们将在未来五年内能够有效地训练这些“原始像素”模型。数据已经存在;我们只需要处理这些数据的计算能力。

结论

该论文得出结论:训练人工智能直接从原始像素中学习并非死胡同。它是可行的,遵循可预测的规律,并且最终可以达到高水平的性能。然而,由于像素是“笨拙”的数据点,目前这种方法非常昂贵且缓慢。

为了让这种方法在未来发挥作用,我们不需要发明新的图像压缩方式;我们只需要继续构建更大的计算机,并向它们输入海量的数据,具体方案需根据我们是希望人工智能去识别事物还是创造事物而量身定制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →