← 最新论文
🤖 AI

Auditing Data Membership in Reinforcement Learning With Verifiable Rewards

本文提出了行为分歧审计(DIBA),这是一种白盒框架,通过分析强化学习可验证奖励(RLVR)前后模型检查点之间行为与奖励侧的分布偏移,有效检测未授权数据泄露,其性能显著优于现有的成员推断基线方法。

原作者: Yule Liu, Heyi Zhang, Jinyi Zheng, Zhen Sun, Zifan Peng, Jiaheng Wei, Tianshuo Cong, Yilong Yang, Xinlei He

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yule Liu, Heyi Zhang, Jinyi Zheng, Zhen Sun, Zifan Peng, Jiaheng Wei, Tianshuo Cong, Yilong Yang, Xinlei He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《使用可验证奖励审计强化学习中的数据成员资格》的解释。

大局观:“秘密食谱”问题

想象一位著名厨师(大型语言模型)通过品尝成千上万道食谱来学习烹饪。最近,一种名为RLVR(使用可验证奖励的强化学习)的新烹饪方法变得流行起来。厨师不再仅仅死记硬背某张具体的食谱卡片,而是尝试多次烹饪同一道菜。如果菜的味道好(通过了严格的味觉测试),厨师就会获得奖励并记住这次尝试;如果味道不好,他们就再试一次。

问题在于,这些“味觉测试”经常使用秘密且高价值的食谱(如专有的数学问题或私有代码),而这些是厨师的所有者不希望公众知晓的。

核心问题:如果你看到了厨师的最终菜单,你能判断他们是否秘密地用你的特定秘密食谱进行过练习吗?

旧方法 vs. 新方法

旧方法(“固定目标”攻击):
过去,审计员试图通过检查模型是否记住了特定句子来抓住厨师。这就像问:“你是否记住了这一页上的确切文字?”如果厨师能完美地背诵这一页,他们就被抓住了。

  • 为何在此失效:在 RLVR 中,厨师并不是在死记硬背特定的句子。他们是在现场生成新的解决方案。没有单一的“正确答案”可供比对,因此旧方法行不通。

新方法(DIBA——“行为指纹”):
作者提出了一种名为DIBA(行为差异审计)的新方法。他们不再寻找被死记硬背的句子,而是寻找厨师烹饪风格的变化

他们将厨师当前的菜单与厨师的“之前”照片(即开始 RLVR 训练前的模型)进行对比。他们寻找两个具体的线索:

  1. 奖励线索(他们变强了吗?):
    • 类比:厨师是否突然在以前很挣扎的某种特定类型的谜题上变得非常擅长?
    • 如果厨师以前不擅长“几何谜题”,但在训练后能完美解决它们,这就强烈暗示他们针对这些谜题进行过练习。
  2. 风格线索(他们的个性改变了吗?):
    • 类比:即使厨师解出了谜题,他们在解题时的说话方式改变了吗?也许在解决那个特定谜题时,他们开始使用更短的句子或不同的语调。
    • 这就是“行为漂移”。即使答案是正确的,他们得出答案的路径看起来也可能与训练前不同。

DIBA 如何运作(侦探的工具包)

审计员就像拥有两种工具的侦探:

  1. 记分牌:他们检查模型在特定问题上的成功率在训练后是否有所提高。
  2. 录音机:他们倾听模型的“思考过程”(它选择的每个单词的概率),看看它是否与“之前”版本听起来不同。

通过结合这两者,DIBA 生成一个“指纹”,表明:“该模型肯定针对此特定提示词进行过练习。”

论文发现了什么

研究人员在数学问题(即“秘密食谱”)上测试了这种方法,发现了一些有趣的规律:

  • 它在“学习”类提示词上效果最好:DIBA 非常擅长捕捉模型真正学到了新东西的提示词。如果模型在训练前已经是该问题的专家,DIBA 就无法判断它是否针对该问题进行过练习(因为行为没有发生变化)。
  • 它是一种“白盒”工具:要使用此方法,审计员需要查看模型的内部“logits”(模型用于决定下一个单词的原始数值)。这就像需要查看厨师的私人笔记本,而不仅仅是最终的菜肴。
  • 在“简单”提示词上更难:如果提示词简单到模型原本就已经完美掌握,模型在训练期间行为变化不大。没有变化,就没有指纹可寻。
  • 它适用于不同规模:无论厨师是小学徒(3B 模型)还是大师级厨师(7B 模型),只要他们使用相同的训练食谱,该方法都有效。
  • 它也适用于图像:他们在视觉 - 语言模型(能看图并解决数学问题的模型)上进行了测试。它仍然有效,但由于“视觉噪声”使得指纹略微模糊,检测难度稍大。

你能隐藏行踪吗?

论文还提出了一个问题:“厨师能隐藏这些痕迹吗?”

  • 更努力地训练:让模型“更仔细地”训练(使用正则化)并没有真正隐藏行踪。行为变化仍然可见。
  • 重写答案:如果厨师在生成最终答案后,用不同的措辞重写答案(改写),确实会增加检测难度。这就像厨师用不同的笔迹写下食谱。然而,这只能隐藏文本;如果有人仍然能看到厨师内部的“想法”(logits),秘密就依然暴露。

结论

这篇论文表明,即使 AI 模型没有死记硬背答案,它们仍然会在其训练数据上留下行为疤痕。如果你有一个秘密提示词(如私有的数学问题),而 AI 模型在该问题上的表现显著提高,或者其思考方式发生了改变,那么一位聪明的审计员很可能能够证明该模型是用你的秘密数据进行训练的。

DIBA 是发现这些疤痕的新工具,它通过比较模型的“之前”和“之后”行为来工作,而不仅仅是检查被死记硬背的文本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →