Efficient Training with Foresight: Multi-Token Auxiliary Supervision for Autoregressive Image Generation
该论文提出了多标记自回归(MTAR),这是一个统一的训练框架,通过结合多标记预测、标记级对比正则化和语义丢弃,增强了自回归图像生成能力,并实现了比 LlamaGen 等现有方法更优越的图像质量和显著提升的训练效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
计算机在从无到有地创建图像方面已经变得非常出色,但它们学习这种能力的方式往往感觉就像一个试图逐字背诵教科书的学生,却从未见过整页的内容。在人工智能领域,一种被称为自回归生成(autoregressive generation)的流行方法是通过基于之前的图像碎片来预测下一个碎片,就像通过猜测下一个词来完成一个句子一样。这种方法在创造高质量图片方面展现了巨大的潜力,但它也存在一个根本性的低效问题。计算机被迫逐一查看图像中的每一个微小补丁,以学习它们是如何组合在一起的。这个过程既缓慢又具有近视性,这意味着计算机过于狭隘地关注紧接着的下一步,从而忽略了全局,导致出现重复的纹理或模糊的细节。此外,计算机在处理图像中携带极少重要信息的区域(例如一片空白的天空)时,所消耗的能量与处理复杂面部细节时的能量一样多。
来自佛山大学和香港大学的研究团队提出了一种训练这些图像生成系统的新方法,该方法在不改变计算机最终如何创建图像的前提下解决了这些问题。他们将这种方法称为 MTAR,这是一个通过三种特定策略改进学习过程的统一框架。首先,他们改变了计算机学习“向前看”的方式。他们不再仅仅要求模型预测紧接着的下一个补丁,而是增加了一个第二项任务,即要求模型还必须预测更远处的补项,具体来说是当前网格位置正下方的补丁。这迫使计算机理解图像的二维结构,就像是在观察一个社区而不仅仅是一条街道,这有助于它更好地捕捉局部模式和未来的上下文。其次,他们引入了一种技术,以确保计算机对不同图像部分的内部理解保持清晰且具有区分度。通过比较同一图像特征的不同版本,他们鼓励模型保持对不同纹理和形状的表示是分离的,从而防止图像变得浑浊或重复。最后,他们解决了精力浪费的问题,即在训练期间教导计算机忽略不重要的部分。通过使用一个独立的工具来识别图像中哪些补丁包含最有意义的信息,他们允许计算机跳过那些不太重要的区域(如空白背景),同时仍专注于关键细节。
当在 ImageNet 基准测试(一个用于衡量该领域进展的标准图像集合)上进行测试时,这种新方法的表现令人瞩目。当研究人员将他们的系统与之前领先的方法 LlamaGen 进行比较时,他们发现新框架产生高质量图像的速度更快,且质量更好。具体而言,该新方法实现的 FID 分数(用于衡量生成图像真实程度的指标)比之前的最佳水平低了近一个点,表明质量有了明显的提升。更重要的是,训练过程显著加快了。研究人员发现,他们的系统仅需三分之一的训练时间就能达到旧方法相同的性能水平,在某些情况下,甚至快了近四倍。即使研究人员将训练限制在通常步骤的一小部分,新系统仍然能够产生与基准线相当甚至更好的图像。这表明,改进并非源于单纯地增加工作量,而是通过提供更好的学习信号并消除不必要的计算,实现了更智能的工作方式。
至关重要的是,所有这些改进仅发生在计算机学习的过程中。一旦训练完成,系统的运行方式与之前完全一致,即逐个预测一个标记(token),没有任何额外的步骤或延迟。研究人员证明,通过在学习阶段添加这些辅助任务并跳过低价值信息,他们可以创建一个既更强大又更高效的模型。这项研究表明,提升图像生成的关键不在于构建更大的模型,而在于优化模型观察世界的方式,确保它关注正确的事物,并理解它们之间的空间关系。通过平衡高质量输出的需求与时间和计算能力的实际约束,这项工作为利用人工智能创建逼真图像提供了更清晰的前行路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。