Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models
本文提出了 HFRU,这是一种作用于视觉编码器的强化遗忘框架,其基于 GRPO 的优化与抽象奖励机制,旨在实现视觉语言模型中对敏感知识的深度语义遗忘,同时有效防止物体幻觉。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个视觉 - 语言模型(VLM)如同一位超级聪明、精通多语的图书管理员,他读遍了互联网上的每一本书,也看过了每一张图片。这位管理员乐于助人,但有时他会记住一些不该记住的东西——比如某位名人的脸、一张私人照片,或一张受版权保护的图片。
当我们要求这位管理员“忘记”这些特定内容时,现有方法往往像一位笨拙的编辑:他们只是在管理员的笔记本(即文本输出)上划掉名字,却将那个人或物体的真实心理图像完整地保留在管理员的大脑中。如果你问一个棘手的问题,比如“这张照片里有这个人吗?”,即使管理员承诺不说出名字,他可能仍然能认出对方。更糟糕的是,当被迫遗忘时,管理员可能会开始编造内容:明明照片里是一只狗,他却自信地描述成一只猫,只是为了填补沉默。
本文提出了一种名为HFRU(无幻觉强化遗忘)的新方法来解决这一问题。以下是其工作原理,辅以简单的类比说明:
1. 问题:“表面性失忆”
大多数现有方法试图仅通过编辑管理员的言语(即语言解码器)来使其遗忘。
- 类比:想象你告诉一名学生:“不要说‘苹果’这个词。”学生不再说“苹果”,但他脑海中仍保留着苹果的完整心理图像。如果你给他看一张图片并问:“这是什么水果?”他可能仍然知道这是苹果,或者因恐慌而胡乱猜成“香蕉”,只为避免说出“苹果”。这种现象被称为幻觉——编造不存在的事实。
2. 解决方案:重连“眼睛”
HFRU 采取不同的方法。它不只是编辑言语,而是直接作用于管理员大脑中负责看见和识别图像的部分(即视觉编码器)。
- 类比:HFRU 不只是告诉学生不要说“苹果”,而是温和地模糊学生脑海中的苹果图像。它重塑大脑处理该特定视觉模式的方式,使其不再看起来像苹果。
3. 两步流程
HFRU 采用两阶段训练过程来安全地实现这一目标:
第一阶段:“混淆”阶段(冷启动)
系统向管理员展示需要遗忘的物体图片(例如某只特定的狗),但要求他们将它们描述为其他东西(例如:“这是一只兔子”)。- 目标:打破图像与其原始名称之间的强关联。这就像教导管理员:当他们看到这只特定的狗时,应将其联想为“兔子”而非“狗”。在真正开始工作之前,先削弱相关记忆。
第二阶段:“智能奖励”阶段(强化学习)
系统使用一种类似游戏的评分机制(称为 GRPO)来训练管理员。- 惩罚:如果管理员提及被禁止的名称(例如“狗”),他们将扣分。
- 抽象奖励(核心创新):这是本文的重大创新。如果管理员被迫遗忘“狗”,他们可能会倾向于猜测“猫”(即产生幻觉)。HFRU 会在管理员使用安全、通用的词汇(如“动物”)时给予额外奖励。
- 类比:想象一位老师对学生说:“不要说‘狗’。”如果学生说“猫”,他们会得到差评(幻觉);但如果他们说“动物”,则会获得金星。这教会学生保持模糊和安全,而不是编造错误的特定答案。
4. 结果
本文在两类任务上测试了该方法:识别物体(如狗和大象)以及识别人脸(如特定名人)。
- 遗忘效果:HFRU 成功使管理员在**98–99%**的情况下忘记了特定目标。
- 保留能力:它几乎完美地保留了管理员识别其他事物(如猫或其他人)的能力。
- 无幻觉:至关重要的是,与其他会让管理员胡乱猜测的方法不同,HFRU 几乎从不编造虚假物体。管理员要么回答“我不知道”,要么使用像“动物”这样安全的通用词汇。
总结
可以将 HFRU 视为一种专门针对记忆的“手术”。它不只是给管理员戴上口套以阻止其说出某些词语,而是谨慎地重连其视觉识别中心。它教导管理员用安全、通用的概念替代特定且敏感的记忆,确保他们在尝试遗忘时不会无意中编造内容。最终得到的模型能够真正遗忘所需内容,而不会丧失理智或编造谎言。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。