HAL: Inducing Human-likeness in LLMs with Alignment
本文介绍了 HAL,这是一个通过从对比对话数据中推导出可解释且数据驱动的奖励,从而使语言模型对齐人类化对话特征的框架,该框架能够实现针对性的优化,在不损害整体性能的情况下提升感知的人类相似度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何像真人一样聊天。问题在于,“像人”是一个模糊的概念。它不是一个可以求解的数学方程,而是一种感觉。你听到了就会明白,但你很难将其写成一条规则。通常,为了让 AI 听起来更像人,开发者只是向这个问题投入更多的资金和算力,寄希望于模型能“撞大运”。
这篇论文介绍了一个名为 HAL(人类对齐大语言模型,Human Aligning LLMs)的新框架,试图通过将“像人的感觉”转化为一个可衡量的分数(就像成绩单上的分数一样)来解决这个问题。
以下是他们实现这一目标的步骤,分为简单的几个阶段:
1. 侦探工作:寻找“特征”
首先,研究人员需要弄清楚究竟是什么让一段对话听起来像人类。他们研究了数千场“图灵测试”(即人类裁判试图分辨谁是人、谁是机器人的游戏)。
他们没有仅仅询问“谁是人?”,而是要求一个超级聪明的“AI 侦探”解释它做出选择的原因。这位侦探发现了其中的模式。例如:
- 人类经常会有小小的拼写错误或使用小写字母。
- 人类可能会有一点不耐烦,或者很快结束对话。
- 人类会使用非正式的俚语,而不是过度解释一切。
- 人类有时会承认自己不知道某些事情,而不是胡编乱造。
研究人员从这些线索中提取了数百个细节,并将其浓缩为一份包含 16 项特定特征 的清单(称为 HL16Q)。你可以把它看作是一份“拟人化清单”。
2. 评分卡:为对话打分
有了这份清单后,他们需要一种方法来给对话打分。他们训练了一个简单的数学模型(类似于加权比例尺),通过观察一段对话并为其分配一个单一的数字。
- 如果对话使用了非正式语言且有一些拼写错误,分数就会上升。
- 如果对话过于礼貌、完美且具有机器人感,分数就会下降。
这个数字就是 HAL 分数。它是一个单一的数值,用来表达:“这段对话感觉有多像人?”
3. 训练:教机器人瞄准目标分数
现在,他们利用这个分数来训练不同的 AI 模型(涵盖了从小型到超大型的模型)。
- 他们要求 AI 进行对话。
- 如果对话获得了高 HAL 分数,他们会给予 AI “奖励”。
- 如果分数较低,则给予“惩罚”。
随着时间的推移,AI 学会了通过调整自己的行为来获得更高的分数。它开始不再表现得像一本完美的百科全书,而更像是在咖啡馆里聊天的一个真人。
4. 验证:奏效了吗?
为了验证是否真的有效,他们进行了一场“盲测”(类似于 Chatbot Arena)。真实的志愿者同时与两个不同的 AI 进行对话,并必须猜出哪一个是人类。
- 结果: 经过 HAL 训练的 AI 被选为“人类”的概率为 61.78%。
- 对比: 它击败了未经训练的自身版本,甚至击败了一款非常流行的、高端的商业 AI(GPT-4o-mini),后者被选为人类的概率仅为 34% 左右。
为什么这很重要
这里最大的胜利不仅在于 AI 听起来更好了,更在于这个过程是透明的。
- 旧方法: “我们把 AI 做大了,现在它听起来更像人了。”(黑盒过程)。
- HAL 方法: “我们教会了 AI 要简洁、使用俚语并承认错误,这就是它听起来像人的原因。”(清晰的配方)。
因为他们明确知道自己在奖励哪些特征,所以他们可以检查以确保 AI 不会为了获得分数而做出任何奇怪或有害的行为。他们还检查了在学习如何听起来像人时,AI 是否丧失了理解情感的能力,结果发现并没有。
简而言之: HAL 是一个工具,它将“像人”这个模糊的概念转化为一份具体的清单,并利用这份清单来训练 AI 进行更自然的交流,同时不会丧失其智能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。