DRIFT: Learning from Abundant User Dissatisfaction in Real-World Preference Learning
本文介绍了 DRIFT,一种利用丰富的现实世界用户不满信号来动态采样正向样本的新型偏好学习框架,在保持解的多样性并避免梯度退化的同时,实现了相对于基座模型和强基准模型的显著性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人厨师如何烹饪。
旧方法:等待五星好评
传统上,要教一个机器人厨师,你需要请一组人类美食评论家去品尝每一道菜,并给出“赞”或“踩”的反馈。但问题在于,大多数人都太忙了,没时间停下来写评论。只有极少数人(1-3%)会费心去点一下“赞”。而那些点赞的人呢?他们通常只有在食物极其“美味”或极其“难吃”时才会写评论。他们很少会告诉你:“这碗汤还可以,但需要再多加点盐。”
因此,机器人厨师只能从极少数极端案例中学习,从而错失了理解人们真实需求的细微差别。
新方法:倾听抱怨声(DRIFT)
这篇论文介绍了一种名为 DRIFT 的新方法。与其等待稀有的“点赞”,DRIFT 专注于丰富的“抱怨声”。
你可以这样理解:当顾客抱怨“这个披萨太咸了”或者“能不能把饼底做得更脆一点?”时,他们是在为你提供一座金矿。他们在告诉你究竟哪里“行不通”。在现实世界中,人们抱怨(不满)的频率远高于称赞(满意)。
DRIFT 的运作逻辑是一个简单的循环:
- 捕捉投诉: 它寻找一段真实的对话,其中用户对机器人的回答感到不满(即“负面”示例)。
- 再次尝试: 它要求机器人针对同一个问题再次尝试回答,但这一次,它要尝试根据目前所学的内容做得更好(即“正面”示例)。
- 学习差异: 它教导机器人:“嘿,你刚才的回答让用户生气了。你的这个新回答更好。记住这种差异。”
为什么这是一个游戏规则的改变者
该论文声称,由于以下三个主要原因,这种方法优于其他方法:
- 资源丰富: 你不需要等待人类去点击按钮。你可以利用用户在聊天中自然发生的、数以百万计的“不,不对”、“再试一次”等反馈。
- 不会陷入僵局: 其他方法有时会让机器人陷入一种循环,即机器人因为害怕犯错而开始反复给出同样枯燥的答案。DRIFT 则让机器人保持探索精神。因为它不断地将一个“糟糕的”真实世界答案与一个“新鲜的”新尝试进行对比,所以机器人能不断寻找新的、更有创意的方法来解决问题,而不是仅仅死记硬背一个安全的答案。
- 确实有效: 研究人员在真实世界的数据上测试了这一点。他们发现,使用 DRIFT 训练的模型变得更加聪明。例如,一个经过 DRIFT 训练的 140 亿参数模型,在处理复杂任务时的表现优于像 GPT-4o-mini 这样的商业模型。
核心结论
DRIFT 就像一位教练,他忽略了那些稀少的“做得好!”,转而专注于频繁出现的“那行不通”。通过从人们在现实生活中实际犯下的错误中学习,并不断尝试做得更好,AI 学习得更快、更具创造力,并且变得更有帮助,而无需昂贵的人类老师来为每一个答案打分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。