Mitigating Cognitive Bias in RLHF by Altering Rationality
本文提出了一种方法,通过在奖励学习过程中动态调整理性参数,并利用大语言模型作为裁判来识别并降低有偏人类比较的权重,从而减轻人类反馈强化学习(RLHF)中的认知偏差,进而在不完美的数据集上训练出更鲁棒的模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何做出明智的决策。标准做法被称为RLHF(基于人类反馈的强化学习)。你向机器人展示针对同一问题的两个不同答案,请人类判断哪个更好,机器人则学习模仿这一选择。
然而,根据这篇论文的观点,人类并非完美的教师。有时,我们会因为大脑内置的捷径——即认知偏差——而犯错。
可以将认知偏差想象成一副扭曲的眼镜。戴上它时,你或许能看清世界,但有时也会看到现实中不存在的东西,或者忽略重要细节。一个著名的例子是“琳达问题”:如果你告诉某人琳达是一位主修哲学的女性主义者,他们可能会非理性地认为她更可能是“女性主义银行职员”,而不仅仅是“银行职员”,尽管从数学上讲,后一种情况必然概率更高。如果人类在教导机器人时戴着这副“扭曲的眼镜”,机器人也会学会戴上它们。
旧方法 vs. 新方法
旧方法(固定眼镜):
在传统训练中,机器人假设人类教师对每一个问题都同样可靠。它对每一条“我更喜欢这个答案”的投票赋予相同的权重,就像一位老师无论学生是在认真听讲还是走神,都给所有学生打相同的分数。研究人员将这种假设称为固定的“理性参数”(我们称之为Beta)。这相当于假设人类教师始终处于 100% 清醒和专注的状态。
新方法(动态眼镜):
作者蒂芙尼·霍特(Tiffany Horter)及其团队提出了一种更聪明的方法。他们建议机器人应该自问:“这位人类教师此刻是否可能带有偏见?”
他们构建了一个系统,充当抽查监督员的角色。在机器人从人类的选择中学习之前,另一个 AI(作为“法官的大型语言模型”)会审视问题和人类的选择,判断其中是否潜藏认知偏差。
- 如果监督员认为:“啊,这看起来像是一个典型的偏差陷阱”,它就会告诉机器人调低该人类反馈的音量。它会降低该特定情境下的"Beta"值,使该条教训的重要性下降。
- 如果监督员认为:“这看起来是一个稳健、理性的选择”,它就会调高音量,让机器人从中深入学习。
类比:嘈杂的课堂
想象一个课堂,老师正在教学生(即 AI)数学。
- 问题所在: 有时老师会疲惫、分心,或者落入陷阱题的圈套。如果学生照搬老师的错误,他们就会考试不及格。
- 旧方法: 学生照搬老师在黑板上写下的所有内容,假设老师永远正确。
- 新方法: 学生们身边坐着一位智能助手。当老师写下答案时,助手会低声说:“嘿,我觉得老师这里因为陷阱题而犯了错。”于是,学生们忽略那个特定答案,转而专注于老师表现敏锐的那些部分。
实验结果如何?
研究人员在两组旨在考验人类逻辑的棘手问题(如“琳达问题”和医疗诊断场景)上测试了这种方法。
- 它阻止了机器人复制错误: 即使机器人是在人类大多出错(带有偏差)的数据上进行训练,新方法也能帮助机器人找出正确答案。它学会了忽略“扭曲的眼镜”,从而发现真相。
- 它没有搞乱机器人: 机器人没有变得困惑,也没有忘记如何执行其他任务。它在保持通用任务智能的同时,仅仅在识别和忽略偏差方面变得更强。
- 即使使用“有缺陷”的监督员也能奏效: 该系统并不需要一位能识别每一个偏差的完美监督员。即使监督员只有 80% 的正确率,机器人学到的效果仍然优于完全没有监督员的情况。
核心结论
这篇论文认为,我们不应将人类反馈视为完美、不可更改的信号。相反,我们应该将其视为一种随上下文变化的噪声信号。通过根据人类反馈可能带有偏见的程度,动态调整其权重,我们可以构建出更理性、更少继承人类缺陷的 AI。
简而言之:不要只听人类说什么,还要听他们怎么说,并据此调整你的学习方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。