Probabilistic Calibration Is a Trainable Capability in Language Models
本文证明概率校准是语言模型中一种可训练的能力,表明在合成分布任务上进行微调可显著提升各类基准测试中的采样保真度,其中硬目标方法在结构化数值采样方面表现优异,而软目标方法在更广泛的随机生成任务中表现更佳。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你让一个语言模型(就像一个非常聪明、但有时很固执的机器人)“在 1 到 10 之间随机选一个数字”。
理想情况下,这个机器人应该像掷一枚公平的骰子一样,以相等的概率选出 1 到 10 之间的每一个数字。但在现实中,这些机器人在这方面的表现糟糕透顶。它们往往有“偏爱”的数字。它们可能有一半的时间都选"7",却从不选"3",尽管你要求的是随机选择。它们很不擅长做到真正的随机。
这篇论文提出了一个简单的问题:我们能否教会这些机器人更好地遵循随机性的规则?
答案是肯定的。研究人员发现,通过给这些机器人提供特殊的“培训课程”,它们可以学会按照我们期望的方式来选择数字(以及其他事物)。
以下是他们如何使用两种不同的教学风格来实现这一点的:
问题:机器人的“坏习惯”
把机器人想象成一个读过数百万本书的学生。它知道如何写故事和回答问题,但从未被教导过如何掷骰子。当被要求做到随机时,它只是根据自己认为“正常”的内容来猜测,这通常意味着它会反复陷入相同的几个答案中。
解决方案:两种训练方法
研究人员创建了一个特殊的教室,里面有 12 个不同大小的机器人学生。他们使用两种不同的方法来教导它们:
1. “地图”法(软目标)
想象一下,你在教一个学生画一个完美的圆。你不是只说“画个圆”,而是给它们一张详细的地图,精确地指出为了画出完美的圆,每一个点应该落在哪里。
- 工作原理:研究人员构建了一张“地图”(一种数字树结构),向机器人精确展示了为了形成完美的随机分布,每一个后续字母的概率应该是什么。
- 结果:这种方法在教导机器人实现多样性方面表现出色。它让机器人能够选择更广泛的答案,不仅仅是数字,还包括随机的城市、动物或单词。这就像教机器人去探索整个游乐场,而不是只站在一个角落里。
2. “实战演练”法(硬目标)
想象一下,通过让学生反复练习完全相同的任务来教导它们。你说:“这是来自完美骰子掷出的一个随机数字。现在你来试试。”然后你再来一次。再来一次。
- 工作原理:研究人员从计算机中生成了成千上万个完美的随机数字,展示给机器人看,并说:“从这些例子中学习。”
- 结果:这种方法是精度的冠军。它使机器人在按照要求选择特定数字方面变得极其准确。如果你要求一个 1 到 100 之间的数字,这个机器人几乎能完美地命中目标分布。
训练之后发生了什么?
研究人员在机器人未曾见过的事物上测试了它们(例如新的随机分布类型,或者要求随机选择城市而不是数字)。
- 好消息:两种训练方法都奏效了!机器人在随机性方面变得好多了。它们不再偏爱自己的“偏爱”数字,而是开始像公平抛硬币一样均匀地分散选择。
- 权衡:有一个小小的代价。就像一个只练习数学的学生可能会忘记一些历史知识一样,这些机器人在其他一些任务上的表现略有下降。具体来说,它们进行复杂数学推理(如解应用题)的能力略有下降。然而,它们理解和生成正常语言(如写故事)的能力基本保持不变,甚至略有提升。
主要结论
这篇论文证明,成为一个好的随机采样器是一项可以习得的技能。
- 如果你需要机器人在数字上精确(比如赌场游戏),请使用**“实战演练”**方法。
- 如果你需要机器人富有创造力和多样性(比如为故事挑选随机创意),请使用**“地图”**方法。
研究人员不仅修复了一个漏洞;他们展示了可以根据需求调整机器人的“个性”,使其更具或更少随机性。他们并未声称这能解决所有人工智能问题,或可用于医疗诊断,但他们确实证明了,通过适当的训练,人工智能最终可以学会掷出一枚公平的骰子。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。