← 最新论文
💻 computer science

VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations

本文介绍了 VibeToken,这是一种与分辨率无关的一维图像分词器及其对应的自回归生成器(VibeToken-Gen),它能够实现高效、动态分辨率的图像合成,与现有的扩散模型和固定分辨率自回归模型相比,其计算成本显著降低且性能更优。

原作者: Maitreya Patel, Jingtao Li, Weiming Zhuang, Yezhou Yang, Lingjuan Lv

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Maitreya Patel, Jingtao Li, Weiming Zhuang, Yezhou Yang, Lingjuan Lv

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将一张城市天际线的高清照片发送给朋友。

旧方法(传统 AI 模型):
大多数当前的 AI 图像生成器运作起来就像一个非常字面化、僵化的翻译器。如果你想发送一张小明信片(256x256 像素),翻译器会将图像分解为 256 个微小的拼图块。如果你想发送一块巨大的广告牌(1024x1024 像素),同一个翻译器会将其分解为4,096个拼图块。

问题出在哪里?AI 必须逐个读取并写入每一个拼图块。

  • 小照片: 256 步。快速且便宜。
  • 大照片: 4,096 步。缓慢、昂贵,且计算机变得疲惫(它消耗多得多的能量)。
  • 结果: 要制作大照片,你通常需要一个单独的、重型“超分辨率”机器仅仅用来拉伸小照片,这增加了更多的成本和复杂性。

新方法(VibeToken):
这篇论文的作者是 Maitreya Patel 及其在索尼 AI(SonyAI)和亚利桑那州立大学的团队,他们发明了一种名为VibeToken的新翻译器。

将 VibeToken 想象成一个智能摘要器,而不是一个逐块翻译器。

1. 神奇的“氛围”摘要

无论你向 AI 输入的是微小的缩略图还是巨大的 4K 广告牌,VibeToken 都不在乎像素数量。相反,它会观察图像并说:“我只需要用64 个词(或 token)就能描述整张图片。”

  • 类比: 想象描述整部电影。旧方法是阅读每一帧。VibeToken 则像是写出一份完美的 64 字剧情摘要,捕捉电影的精髓。无论电影是 10 分钟还是 3 小时长,摘要的长度保持不变。

2. “动态”解码器

一旦 AI 拥有了这 64 个“氛围词”,它就需要将它们还原成图像。

  • 旧 AI: 如果你想要更大的图片,AI 必须猜测更多的词,这需要更多时间。
  • VibeToken: 它拥有一个特殊的解码器,可以将这相同的 64 个词拉伸以适配任何形状或尺寸。你可以要求正方形、宽矩形或高海报,它会将“氛围”完美拉伸以适配,而无需重新学习任何内容。

3. 为什么这很重要(“效率”主张)

该论文声称,这在两个主要方面改变了游戏规则:

  • 恒定的能量成本: 使用旧方法,生成一张 1024x1024 的图像大约需要11 万亿次计算机计算(FLOPs)。使用 VibeToken,它所需的工作量与生成微小图像相同:仅需1790 亿次计算。这意味着效率提高了63 倍
    • 类比: 这就像步行去商店(旧方法)与使用传送装置(VibeToken)之间的区别。距离(分辨率)无关紧要;能量成本是相同的。
  • 速度: 因为它如此高效,VibeToken 可以在0.46 秒内生成一张高质量的 1024x1024 图像。顶级竞争对手(扩散模型)完成相同任务需要1.08 秒,而且质量实际上略差。

4. 他们是如何做到的(秘密武器)

团队意识到问题不在于图像生成器本身,而在于“分词器”(将图像分解为块的部分)。他们通过以下方式修复了它:

  • 动态定位: 他们教导 AI 理解图像的形状,而不管尺寸如何,而不是说“像素 1 在这里,像素 2 在那里”。
  • 可变长度: 他们训练 AI 适应从 32 到 256 个“描述词”的范围,让用户选择他们想要的细节程度。
  • 原生超分辨率: 因为 AI 如此深刻地理解“氛围”,它可以自然地将低分辨率图像转换为高分辨率图像,而无需单独的“超分辨率”工具。

结论

这篇论文介绍了VibeToken-Gen,这是一个允许 AI 使用相同数量的计算能力生成任何尺寸或形状图像的系统(从微小图标到巨大海报)。

他们在 ImageNet 数据集(一个庞大的照片集合)上进行了测试,发现:

  1. 它生成高质量的图像(优于一些当前的顶级模型)。
  2. 它运行起来极其快速且便宜。
  3. 它不需要为每个新分辨率重新训练;它直接就能工作。

简而言之,他们构建了一个“分辨率无关”的引擎,使得高质量图像生成变得像发送短信一样简单高效,无论图片有多大。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →