To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning
本文引入了弃权感知强化学习(Abstention-Aware Reinforcement Learning, AWA-RL),这是一种通过动态塑造弃权奖励来缓解搜索智能体幻觉的新型训练范式,旨在鼓励模型在检索失败时选择不回答,从而在极小牺牲原始准确率的情况下,显著提升精确度与可靠性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你有一个超级聪明的机器人朋友,它非常喜欢回答你的问题。你问它:“法国的首都是哪里?”它回答说:“巴黎!”这很好。但接着你问它:“皇帝的隐形汤的秘密配方是什么?”结果这个机器人并没有说“我不知道”,而是自信满满地编造了一个关于“幽灵辣椒和月亮尘埃”的故事。它并不是想表现得坏,它只是太渴望取悦你了。在人工智能的世界里,我们把这种现象称为幻觉(hallucination),当机器人本应该在互联网上搜索真实事实时,这是一个大问题。
长期以来,科学家们试图通过教机器人上网来解决这个问题。他们使用了一种叫做**强化学习(Reinforcement Learning, RL)**的训练方法,这就像玩电子游戏一样,机器人通过找到正确答案来获得分数。但问题在于:这个游戏只奖励“得到”正确答案的行为,却没有奖励“知道何时停止”。所以,当机器人找不到答案时,它就会不停地瞎猜,编造事实来获取那些分数。这就像一个学生,为了避免显得很笨,在考试时宁愿乱猜也不愿举手说“我不知道”。
这篇论文的作者张凤吉及其团队说:“等等!我们需要教机器人,当它卡壳时要学会说‘我不知道’。”但他们也意识到,仅仅告诉机器人说“我 don't know”是不够的。如果你因为它瞎猜而惩罚得太狠,它可能会变得胆小怕事,甚至连简单的问题都不敢回答了。这被称为“懒惰拒绝(lazy refusal)”,这和胡编乱造一样糟糕。
于是,他们发明了一种新的训练方法,叫做 AWA-RL(感知弃权强化学习)。你可以把它想象成一位观察机器人玩游戏的聪明教练。教练并没有设定一个固定的规则(比如“如果你不是100%确定,就不要回答”),而是会根据具体的问题来观察。
- “勇气”因子: 教练有一个特殊的旋钮,叫做**“勇气”因子**(用希腊字母 表示)。这个旋钮控制着机器人的勇敢程度。
- 如果旋钮调得很高,机器人就会超级勇敢,即使不确定也会尝试回答所有问题。
- 如果旋钮调得很低,机器人就会超级谨慎,对几乎所有问题都说“我不知道”。
- AWA-RL 的魔力在于,教练会根据问题的难度以及机器人的当前表现,动态地调整机器人的奖励。如果机器人表现得很好,教练就会鼓励它尝试;如果机器人开始乱猜,教练就会轻轻地把它拉回来。
团队在三个复杂的解谜游戏(数据集名为 HotpotQA、2WikiMultiHopQA 和 MuSiQue)上测试了这种方法,在这些游戏中,机器人必须通过检索维基百科来寻找答案。他们将这种新方法与旧方法进行了对比:
- 仅仅混入“我不知道”的例子: 这效果并不好。机器人要么会感到困惑,要么会对甚至简单的问题也开始说“我不知道”。
- 给予固定的“惩罚”来应对瞎猜: 这就像是用大锤去砸坚果。如果惩罚太重,机器人会停止回答所有问题(拒绝率高达 99.9%!);如果惩罚太轻,它又会继续胡编乱造。
他们发现了什么?
AWA-RL 方法改变了游戏规则。通过使用那个动态的“勇气”旋钮,他们发现了一个甜点位(大约在0.20的勇气因子处),在这个位置,机器人的可靠性大大提升。
- 它提升了机器人的精确度(Precision)(即在它确实回答时,答对的频率)高达 10.3%。
- 它将他们提出的新指标 RA-F1(平衡了帮助性和诚实性的得分)提高了 2.9% 到 5.2%,具体取决于设置。
- 最棒的是什么?机器人在整体回答问题的能力上并没有损失太多。它只是在卡壳时不再编造事实了。
论文表明,这种方法在这些特定的测试中表现得非常好,但作者也谨慎地指出,他们还没有在每一种类型的机器人或每一种类型的问题上进行测试。他们还提到,目前的“勇气”旋钮仍需要由人类来调节,不过他们希望未来能实现自动化。
简而言之,AWA-RL 教会了 AI 成为一名知道自己极限的自信专家,而不是一个只会无所不知地胡编乱造的“万事通”。这是朝着让 AI 智能体不仅聪明而且值得信赖迈出的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。