← 最新论文
🤖 AI

ProToken: Token-Level Attribution for Federated Large Language Models

原作者: Waris Gill, Ahmad Humayun, Ali Anwar, Muhammad Ali Gulzar

发布于 2026-01-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Waris Gill, Ahmad Humayun, Ali Anwar, Muhammad Ali Gulzar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一群来自不同医院的医生正试图共同构建一个超级智能的医疗人工智能。他们希望利用各自患者的数据来训练这个 AI,以帮助诊断疾病,但由于隐私法规,他们不能分享实际的患者记录。这被称为联邦学习(Federated Learning)。他们向一个中央“大脑”(全局模型)发送更新,而不是发送原始数据。

想象一下,这个全新的 AI 开始对某个特定问题给出了奇怪且错误的答案。也许它突然拒绝提供帮助,或者给出了危险的建议。医生们需要知道:是哪家医院的数据导致了这个错误? 是医院 A、B 还是 C 的数据?

在过去,这几乎是不可能查明的,因为 AI 是由许多融合部分组成的“黑盒”。

这篇论文介绍了一个名为 ProToken 的新工具,它解决了这个谜团。

以下是 Pro-Token 的工作原理,我们使用简单的类比来解释:

1. 问题所在:混合的汤

把最终的 AI 模型想象成一锅由 50 位不同厨师(客户端)加入食材混合而成的巨型汤。如果汤的味道变坏了,你很难判断是哪位厨师加入了腐烂的蔬菜,因为所有的味道都已经混合在一起了。在 AI 的世界里,当模型逐个词(token-by-token)生成句子时,很难追踪是哪位“厨师”贡献了特定的词。

2. 解决方案:ProToken(风味侦探)

ProToken 就像一个侦探,能够品尝这锅汤并说:“这一勺盐来自 3 号厨师。”它通过在 AI 说话的过程中进行**逐词(token-by-token)**分析来实现这一点。

它利用两个主要的“超能力”,在不破坏隐私规则的情况下完成这项任务:

  • 超能力 #1:“后期阶段”的洞察力(策略性层选择)
    想象一支建筑队正在建造一座摩天大楼。早期的工人负责打地基(语法和基础词汇),但顶层的工人决定了建筑的最终外观和功能(具体的含义和实际的答案)。
    ProToken 意识到,要找出对最终答案负责,你并不需要检查从地面开始的每一块砖。你只需要检查顶部的几层(AI 的后期层)。这节省了大量的计算时间和算力,使整个过程在实际应用中变得足够快。

  • 超能力 #2:“相关性过滤器”(梯度加权)
    想象一个拥挤的房间,每个人都在大喊大叫。如果你试图平等地听取每个人的声音,你只会听到噪音。但如果你只听那些正在讨论你所关心的特定话题的人,你就能听到真相。
    ProToken 使用一种数学过滤器来忽略“噪音”(虽然活跃但与当前词汇无关的神经元),并专注于“信号”(真正决定下一个词该说什么的神经元)。这确保了它不会仅仅因为某家医院拥有大量的医疗数据就去指责它,而只有当这些数据确实影响了那个特定的错误答案时才会这样做。

3. 他们是如何测试的(“魔术戏法”测试)

为了证明 ProToken 有效,研究人员必须创造一个他们预先知道答案的情况。他们玩了一个小把戏:

  • 他们秘密地教了两个特定的“坏”医院一个秘密代码(触发词,如“!!badmagic!!”)。
  • 他们告诉这些医院:“如果你看到这个代码,就说出这个特定的拒绝语句。”
  • 当他们用带有该代码的问题询问全局 AI 时,AI 说了那句拒绝语。
  • 测试内容: 他们运行 ProToken,看看它是否能正确识别出该拒绝行为是由那两家“坏”医院引起的。

4. 结果

结果令人印象深刻:

  • 准确率: 在不同的 AI 模型和主题(医疗、数学、编程、金融)下,ProToken 正确识别了负责的“厨师”(客户端)的概率达到了 98.62%
  • 可扩展性: 即使他们将“厨师”的数量从 6 个增加到 55 个,ProToken 仍然表现良好,正确识别出症结所在率超过 92%。
  • 速度: 通过只检查 AI 的“顶部楼层”,它并不会运行很长时间。

总结

ProToken 是一个新工具,它让使用协作式 AI 的组织能够明确知道什么 内容负责。它通过观察 AI 大脑中最重要的部分并过滤掉噪音来实现这一点,同时确保所有人的隐私数据安全。这有助于修复漏洞、捕捉恶意行为,并确保每个人都能因其优秀的贡献而获得认可。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →