← 最新论文
💻 computer science

Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

本文引入了一种针对扩散 Transformer 的因果可解释性框架,该框架揭示了结构模板标记(structural template tokens)作为一种隐式语义寄存器,通过一种间接的回读机制来维持物体身份,从而能够设计出一种无需训练的剪枝策略,在显著降低计算成本的同时实现极小的性能损失。

原作者: Maohua Li, Qirui Li, Yanke Zhou, Yiduo Li, Zhaosheng Chi, Chao Xu, Cuifeng Shen, Yixuan Xu, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Maohua Li, Qirui Li, Yanke Zhou, Yiduo Li, Zhaosheng Chi, Chao Xu, Cuifeng Shen, Yixuan Xu, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:文本模板 Token 是扩散 Transformer 中的隐式语义寄存器

问题陈述

现代文本生成图像技术已从 U-Net 架构转向扩散 Transformer (DiT),其中文本与图像 Token 通过联合注意力机制进行交互。与此同时,文本调节(conditioning)也从孤立的编码器(如 CLIP、T5)演变为大型语言模型(LLM),这些模型将用户提示词序列化为包含系统、用户、助手和分隔符 Token 的聊天模板。

虽然用户提示词的语义内容是明确的,但这些结构化模板 Token(即格式残留物,如分隔符)的作用仍未得到充分理解。在联合注意力 DiT 中,所有调节 Token 都会作为键(keys)与图像流进行竞争。目前尚不清楚这些结构化 Token 是保持为惰性的格式残留,还是作为透明的调节手段,亦或是获得了更深层的计算角色。此外,理解 DiT 的机械组织结构仍存在更广泛的空白:具体而言,哪些层负责提交语义内容,哪些注意力头因果性地影响生成,以及文本-图像注意力如何在去噪轨迹中介导调节过程。

研究方法

作者引入了一个因果可解释性框架,旨在追踪在去噪过程中,调节信息是在何处被读取、路由和存储的。该框架结合了四种特定技术:

  1. Token 级注意力分解:通过分析图像到文本(I2T)的注意力质量,量化图像查询向特定文本 Token 跨度(语义 vs. 结构)投射了多少注意力。
  2. 跨度级调节干预:执行跨提示词交换并对结构化 Token 进行平均化处理,以测试它们是否携带特定于提示词的语义。
  3. 跨轨迹注意力头移植:在两个不同的生成轨迹(例如“苹果”与“香蕉”)之间逐步交换注意力投影(q,k,vq, k, v),以识别哪些注意力头决定了物体身份。
  4. 层级因果掩码:在特定层掩盖注意力流(例如:寄存器 \to 语义 或 寄存器 \to 图像),以确定信息流的方向。

本研究主要使用 Qwen-Image 系列(一种双流 MMDiT),并在多个基准测试(GenEval、DPG-Bench、Qwen-Image-Bench)及多种语言(英语和中文)上进行了评估。

核心发现

1. 结构化 Token 作为主导的注意力汇聚点(Attention Sinks)

分析显示,结构化模板 Token(例如分隔符如 <|im_start|> 等)...

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →