← 最新论文
🤖 machine learning

Prompt Estimation from Prototypes for Federated Prompt Tuning of Vision Transformers

本文提出了 PEP-FedPT,这是一个统一的联邦学习框架,专为视觉 Transformer 设计,通过引入一种类上下文混合提示(CCMP)来实现泛化与个性化,该提示利用全局原型和客户端先验自适应地组合特定类别的提示,而无需存储依赖于客户端的可训练参数。

原作者: M Yashwanth, Sharannya Ghosh, Aditay Tripathi, Anirban Chakraborty

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: M Yashwanth, Sharannya Ghosh, Aditay Tripathi, Anirban Chakraborty

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一座庞大且超级智能的图书馆(一个预训练的视觉 Transformer),它略知万物,但在任何单一特定领域都算不上专家。你想训练这座图书馆成为某个特定领域的专家,比如识别稀有鸟类或在 X 光片中发现疾病,但你无法将所有书籍搬迁到一处。相反,你拥有散布在世界各地的数百个小型本地分馆(客户端),每个分馆都持有不同且独特的藏书。

这就是联邦学习所面临的挑战:在不将本地分馆的私有数据移出的情况下,训练一个智能的全局模型。

问题:“一刀切”与“过于个性化”的两难困境

该论文指出了在训练这座图书馆时存在的一种令人沮丧的拉锯战:

  1. 全局方法(过于僵化): 如果你给每个分馆完全相同的指令集(“全局提示”),图书馆对普通分馆运作良好,但对那些拥有怪异或独特数据的分馆则表现糟糕。这就像给一个只拥有海鲜的分馆一本通用的《烹饪指南》;这些指令无法适配他们特定的食材。
  2. 个性化方法(过于狭隘): 如果你让每个分馆编写自己的定制指令,它们会成为各自特定本地数据的专家,却忘记了如何与网络的其他部分交流。它们变得如此专业化,以至于无法帮助其他人;而且如果有新分馆加入,它们也完全不知该如何应对。

解决方案:PEP-FedPT(“智能调酒师”)

作者提出了一种名为PEP-FedPT的新方法。不妨将其想象为一位“智能调酒师”,它为每个分馆定制饮品,却无需在每个分馆存储一本秘密食谱。

以下是其工作原理,使用一个简单的类比:

1. 共享原料(全局提示)

中央服务器(图书馆总部)发送出一组共享提示。这些就像大家公认的通用基础原料(盐、胡椒、水)。它们帮助图书馆理解基础知识。

2. 特色风味(类别特定提示)

服务器还维护着一组类别特定提示。想象这些是独特的风味浓缩液:一种用于“鸟类”,一种用于“汽车”,一种用于“树木”。这些是全球共享的,因此每个人都能访问相同的风味瓶。

3. 神奇混合(CCMP)

这是该论文的重大创新。系统不是仅仅向分馆提供单一风味或通用混合液,而是为分馆看到的每一张图像创建一个类别情境化混合提示(CCMP)

系统如何决定混合比例?

  • “嗅觉”测试(原型): 系统查看图像并询问:“这看起来更像鸟类还是汽车?”它利用“全局地图”(类别原型)来估算可能性。
  • “本地菜单”(类别先验): 它还会检查分馆的本地菜单。如果一个分馆主要看到鸟类,系统就知道应更侧重“鸟类”风味。

系统根据这两个因素,以精确的比例将“鸟类”和“汽车”风味混合在一起。就像调酒师说:“这张图像 80% 像鸟类,20% 像汽车,所以我将为这杯特定的饮品混合 80% 的鸟类风味和 20% 的汽车风味。”

为何这是颠覆性的变革

  • 无需秘密食谱: 分馆无需存储自己独特且厚重的指令手册。它们只需使用共享的全局风味并即时混合。这节省了巨大的内存和通信空间。
  • 兼得鱼与熊掌: 生成的“饮品”既具有足够的个性化以处理分馆的怪异数据(泛化能力),又与全局网络保持连接(个性化能力)。
  • 隐私友好: 分馆仅回传它们所学内容的微小摘要(原型),而非实际图像。这就像发送所用风味的描述,而非实际的食物。

结果

该论文在几个“困难”数据集(如 CIFAR-100 和 TinyImageNet)上测试了该方法,这些数据杂乱无章且分布不均。

  • 获胜者: PEP-FedPT 始终优于所有其他方法。
  • 证明: 它不仅获得了更高的平均分数;它还帮助表现最差的分馆显著改善。它成功地同时成为了优秀的本地专家和有益的全局邻居。

简而言之,该论文提出了一种方法,通过在许多不同且杂乱的数据源上训练巨型 AI 模型,让模型利用共享的工具集和少量的本地上下文,即时“混合搭配”其自身的指令。它实现了在通才与专家之间取得完美平衡。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →