← 最新论文
🤖 machine learning

USE: A Unified Self-Ensembling Framework for Test-Time Prompt Tuning

本文提出了 USE,一个统一的自集成框架,通过自适应地强调原始测试图像以生成可靠的伪标签,从而改进了测试时提示微调(Test-Time Prompt Tuning),在确保优化阶段与推理阶段之间保持一致性的同时,还可作为一种轻量级的无需优化的适配方法。

原作者: Siru Jiang, Jian Liang, Ran He, Tieniu Tan

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Siru Jiang, Jian Liang, Ran He, Tieniu Tan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、博学多才的图书管理员(AI 模型),他读过数百万本书,也看过数百万张图片。这位管理员非常擅长识别照片中的物体,比如“猫”、“狗”或“飞机”。然而,当照片看起来与他在学校学到的东西有些不同时——比如光线很奇怪、照片很模糊,或者是一张素描而不是真实的图片——这位管理员有时会感到困惑。这被称为“分布偏移”(distribution shift)。

这篇论文介绍了一种新方法,旨在帮助这位图书管理员在看到这些棘手的照片时,能够立即找到正确答案,而无需回到学校重新学习。

以下是他们解决方案的故事,分为几个简单的部分:

1. 旧方法:“群众投票”

此前,一种流行的名为 TPT(测试时提示微调,Test-Time Prompt Tuning)的方法是这样工作的:

  • 图书管理员拿起原始照片,并制作出 63 个略有不同的副本(有的模糊,有的明亮,有的旋转了)。这些被称为“增强版本”(augmentations)。
  • 他们要求图书管理员对所有 64 个版本(原始版本 + 63 个副本)进行猜测。
  • 他们丢弃那些看起来非常不确定的猜测(高熵/高混乱度)。
  • 他们取所有自信猜测的平均值,并利用这个结果来“教导”图书管理员一个新的提示(文本提示),以帮助他们更好地进行猜测。
  • 缺陷: 当进行最终决策时,旧方法忽略了所有的副本,只重新观察原始照片。这就像是一个人通过朋友的学习过程努力备考,但在参加期末考试时却是在没有任何帮助的情况下独自应战。

2. 新想法:“统一自集成”(USE)

作者们意识到旧方法是不一致的。他们提出了一个名为 USE(统一自集成,Unified Self-Ensembling)的新框架,通过让“学习阶段”和“考试阶段”保持一致来解决这个问题。

核心秘诀:“自集成”(SE)

他们想法的核心是一种称为 自集成(Self-Ensembling, SE) 的策略。可以把它想象成一种“聪明的队长”方法:

  • 团队: 你拥有原始照片(弱增强版本)和编辑后的副本(强增强版本)。
  • 问题: 有时原始照片最清晰;有时编辑后的副本(如高对比度版本)更清晰。
  • 解决方案: SE 策略不再只是平等地平均分配权重,也不仅仅是忽略原始图像,而是扮演了一个“聪明的队长”的角色。它会观察图书管理员对原始照片与副本的理解程度差异。
    • 如果图书管理员对原始照片感到非常困惑,但对副本很清晰,那么队长就会更信任副本。
    • 如果图书管理员对原始照片很清晰,但对副本感到困惑,那么队长就会更信任原始照片。
  • 结果: 他们创建了一个“伪标签”(最佳猜测答案),它是原始照片与副本的加权混合体,根据谁在当前时刻表现得更好来进行动态调整。

3. USE 是如何运作的(两个阶段)

USE 的精妙之处在于,它在两个步骤中都使用了相同的“聪明的队长”逻辑:

  1. 学习阶段(优化): 图书管理员使用“聪明的队长”来生成一个可靠的最佳猜测答案。然后,他们利用这个猜测来更新他们的内部提示(prompts),从而从图像中学习。
  2. 考试阶段(推理): 当需要给出最终答案时,图书管理员并不仅仅是看原始照片。他们再次使用相同的“聪明的队长”逻辑,将原始照片与编辑后的副本进行混合。

为什么这很重要? 这确保了图书管理员在学习和测试时使用的是完全相同的规则。这种一致性使得最终答案更加可靠。

4. “跳过”技巧(节省能量)

作者还添加了一个聪明的捷径。如果图书管理员观察原始照片和编辑后的副本,发现它们完全一致,系统就会说:“太棒了!我们不需要进行额外的学习或复杂的数学计算。”它会跳过繁重的计算工作,直接给出答案。

  • 类比: 如果你问一群专家一个问题,而他们立即异口同声地说“是的”,你就不需要为了讨论这个问题而召开长时间的会议。你只需要写下“是”然后继续下一步。
  • 益处: 这显著减少了处理图像所需的时间,同时保持了高准确度,使其在现实场景中更具实用性。

5. 他们发现了什么?

作者在许多不同类型的图像数据集上测试了该方法(从标准照片到素描、艺术风格,以及像特定犬种或花卉品种这类细粒度的细节)。

  • 更高的准确率: 他们的这种方法(USE)及其策略(SE)始终优于以往的方法。
  • 通用性: “聪明的队长”(SE)非常强大,它可以被插入到其他现有方法中,即使不经过完整的训练过程,也能让这些方法表现得更好。
  • 高效性: 通过使用“跳过”技巧,他们显著降低了处理图像的时间,使其在实际应用中变得可行。

总结

简而言之,这篇论文的观点是:“不要只在学习时借助群众的力量,然后在考试时独自应战。要利用群众的力量来辅助学习,也要利用群众的力量来应对考试。而且,如果群众能立即达成共识,就不要浪费时间去过度思考。”

这种方法帮助 AI 模型更好地处理棘手的现实世界照片,而无需从头开始重新训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →