← 最新论文
💻 computer science

Twins: Learn to Predict Unified Representations with Focal Loss

该论文提出了“Twins”,一种通过拼接 ViT 和 VAE 特征构建的统一连续标记空间,并通过引入改进的焦点回归目标来解决扩散模型中由此产生的优化失衡问题,从而显著提升了图像生成质量和多模态理解性能。

原作者: Kaixiong Gong, Xin Cai, Bin Lin, Hao Wang, Yunlong Lin, Mingzhe Zheng, Bohao Li, Jian-Wei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Xiangyu Yue

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaixiong Gong, Xin Cai, Bin Lin, Hao Wang, Yunlong Lin, Mingzhe Zheng, Bohao Li, Jian-Wei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Xiangyu Yue

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图制造一个既能像人类一样“看”世界,又能像艺术家一样“画”画的机器人。在人工智能的世界里,这两项任务通常需要完全不同的工具包。要“看”并理解一张图像(比如知道一张照片显示的是一只“金毛寻回犬”),AI 使用的是一种高层级的、充满智慧的地图,它捕捉宏观概念,但会忽略像毛发纹理这样的微小细节。而要“画”或生成一张新图像,AI 则需要另一种工具,它能保留每一个像素和精细的细节,但往往会丢失宏观层面的意义。长期以来,科学家们一直试图让这两种不同的工具协同工作,但往往不得不面临一种选择:要么是一个理解力强但画出的图像模糊的机器人,要么是一个画得精美但并不清楚自己在画什么的机器人。这篇论文针对这一棘手的平衡难题提出了疑问:我们能否为机器人创造一种单一的“语言”,让它能同时完美地完成这两项任务?

这项研究背后的研究人员被称为“Twins”,他们决定不再在这两种工具之间做选择,而是将它们粘合在一起。他们提取了“智慧型”地图(来自名为 SigLIP 的系统)和“细节导向型”地图(来自 VAE 系统),并将它们并排缝合在一起,形成一条长长的信息带。这就像是给你的机器人一副眼镜,左侧镜片看宏观图景,右侧镜片看精细细节,且两者都在同一个视野中。然而,当他们尝试教 AI 模型使用这种新的组合视图时,遇到了一个障碍。这个模型很“懒”;它偏爱容易的大局部分,而完全忽略了困难的细节部分,导致生成的图像模糊不清且缺乏纹理。

为了解决这个问题,团队发现了模型之所以“懒惰”的原因。他们发现,“容易”的部分数据是平滑且简单的,而“困难”的部分则充满了复杂且多噪的细节。AI 自然而然地更倾向于平滑的内容,就像一名学生可能会跳过难题而先做简单的拼写题一样。为了解决这个问题,他们发明了一种特殊的训练规则,称为“焦点损失”(Focal Loss)。想象一位老师,他不是平等地给每个问题评分,而是通过为答对最难的问题提供额外的加分来给予奖励。这迫使 AI 去关注图像中那些困难且复杂的细节部分。

结果令人印象深刻。通过使用这种新的“焦点损失”规则,AI 不再忽视细节。在一项标准的图像质量测试中,与旧的训练方法相比,新方法将得分提高了高达 10.57 分,且无需任何额外的引导技巧。它生成的图像清晰锐利,同时机器人依然能像以前一样很好地理解它正在绘制的内容。这篇论文表明,这种方法成功打破了过去必须在两种技能中牺牲其一的“不可能三角”,证明了只要有正确的训练技巧,单一的 AI 模型确实可以同时精通“观察”与“创造”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →