← 最新论文
💻 computer science

One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers

本文提出了弹性潜在接口 Transformer(ELIT),一种兼容扩散 Transformer 的轻量级机制,通过引入可学习长度的潜在令牌序列和跨注意力层,实现了计算量与图像分辨率的解耦,从而在推理阶段可根据延迟约束动态调整计算资源,显著提升了生成质量与效率。

原作者: Moayed Haji-Ali, Willi Menapace, Ivan Skorokhodov, Dogyun Park, Anil Kag, Michael Vasilkovsky, Sergey Tulyakov, Vicente Ordonez, Aliaksandr Siarohin

发布于 2026-03-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Moayed Haji-Ali, Willi Menapace, Ivan Skorokhodov, Dogyun Park, Anil Kag, Michael Vasilkovsky, Sergey Tulyakov, Vicente Ordonez, Aliaksandr Siarohin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 ELIT(弹性潜在接口 Transformer)的新技术,它旨在解决当前 AI 绘画和视频生成模型(特别是基于 Diffusion Transformer 的模型)面临的一个核心痛点:“要么算得快但画质差,要么画质好但算得慢,而且很难在中间找到平衡点。”

为了让你更容易理解,我们可以把生成一张高质量图片的过程想象成**“装修一栋房子”**。

1. 传统方法的痛点:笨重的“平均主义”装修队

想象一下,传统的 AI 模型(DiT)就像是一个死板的装修队

  • 固定预算:无论你要装修的是一个小单间(低分辨率)还是一个大别墅(高分辨率),装修队都规定必须派同样数量的工人,按照固定的节奏,把房子的每一块砖都仔细打磨一遍。
  • 浪费资源:实际上,房子的某些部分(比如墙壁的角落、天花板)可能很简单,随便刷刷就行;但有些部分(比如精美的雕花、复杂的家具)需要大师级工匠花大量时间精雕细琢。
  • 结果:传统模型把大量算力(工人和时间)浪费在简单的角落上,导致处理复杂细节时资源不足,或者为了画质好,不得不把整个房子的装修时间拉得很长,非常低效。

2. ELIT 的核心创新:聪明的“弹性指挥部”

ELIT 给这个装修队加了一个**“弹性指挥部”(Latent Interface)和两个“智能调度员”**(Read 和 Write 层)。

核心机制:

  1. 建立指挥部(Latent Interface)
    在正式动工前,先建立一个临时的“指挥部”。这个指挥部的大小是可以弹性伸缩的。

    • 简单模式:如果预算少,指挥部就小一点,只派几个核心骨干。
    • 高配模式:如果预算足,指挥部就大一点,派更多专家。
  2. 智能调度员 Read(读)
    这个调度员负责从房子的各个角落(图像的空间 Token)收集信息,但它很聪明

    • 它不会平均分配精力。它会发现:“哦,这个雕花很难搞,需要多派点人;那个墙角很简单,随便看看就行。”
    • 它把最重要的信息(难点)优先汇报给“指挥部”里的核心骨干去处理。
  3. 智能调度员 Write(写)
    指挥部里的骨干们处理完信息后,Write 调度员再把结果广播回房子的各个角落,把细节补充上去。

  4. 动态调整(弹性预算)
    这是最厉害的地方。在生成图片的过程中,用户可以像调节音量旋钮一样,随时决定指挥部里留多少人

    • 想快? 把指挥部里“不重要”的骨干(通常是处理细节的尾部 Token)直接裁掉,只保留处理大结构的骨干。
    • 想好? 把所有人都叫回来,精雕细琢。
    • 关键点:这种裁减是在**推理阶段(生成时)**实时发生的,不需要重新训练模型。

3. 生活中的类比:点餐与上菜

  • 传统模型:就像去一家大排档,不管你是一个人吃还是十个人吃,厨师都按“满汉全席”的标准,把每道菜都切得一样细,摆盘一样精致。结果就是:人少时浪费,人多时上菜慢。
  • ELIT 模型:就像一家智能餐厅
    • 你点菜时,系统会分析你的需求。
    • 如果是“快餐模式”,它只保留主菜的核心部分,快速上菜,味道依然不错(结构完整)。
    • 如果是“宴请模式”,它会把配菜、摆盘、酱汁都做得非常精细。
    • 最神奇的是:这是一家**“一店多能”**的餐厅,不需要为了快餐和宴请分别开两家店(不需要训练两个模型),只需要在厨房(模型内部)灵活调配人手即可。

4. 这项技术带来了什么好处?

  1. 省钱省力(计算效率)
    论文显示,通过减少不必要的“指挥部”人员,可以在保持画质几乎不变的情况下,将计算量(FLOPs)减少 30% 到 60%。这意味着生成图片的速度更快,或者在同样的硬件上能生成更高分辨率的图片。

  2. 画质更好(质量提升)
    因为把算力集中在了“难搞”的地方(比如人脸、复杂纹理),而不是浪费在空白背景上,所以即使算得少,画出来的图反而比传统模型更清晰、细节更丰富。

  3. 灵活多变(多预算支持)
    同一个模型,既能做“秒出图”的快餐,也能做“精雕细琢”的大作。用户可以根据手机电量、网络速度或时间紧迫程度,随时调整生成质量。

  4. 自带“辅助驾驶”(自动引导)
    它还能利用这种弹性,自动调用一个“简化版”的自己来辅助生成,进一步提升了生成质量,就像开车时既有主驾驶又有副驾驶的辅助,但成本却很低。

总结

ELIT 就像给 AI 画家装上了一个“智能大脑”和“灵活双手”。

以前的 AI 画家是“死脑筋”,不管画什么,都花同样的力气,导致要么累死(慢),要么画不好(糊)。
现在的 ELIT 让 AI 学会了**“好钢用在刀刃上”**:哪里难画就多花力气,哪里简单就快速带过。而且,它还能根据你给的时间(预算),灵活调整自己的工作量,既快又好。

这项技术让未来的 AI 生成内容更加高效、灵活且普及,让普通用户也能在手机上快速生成高质量的视频和图片。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →