From token probabilities to calibrated confidence: An empirical study of mathematical question answering
这项实证研究调查了校准大型语言模型在数学问答中置信度的方法,发现虽然单次通过的标记概率提供的信号有限,但通过聚合这些概率并采用诸如自我验证或蒙特卡洛丢弃(Monte Carlo Dropout)等多轮通过策略,随后结合事后校准技术,可以显著改善估计置信度与实际准确度之间的对齐。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在和一位超级聪明的机器人朋友玩一场高风险的问答游戏。你提出了一个棘手的题目,机器人嗡嗡作响地给出了答案。但问题在于,这个机器人为了表现得尽善尽美,即使完全错误时也会听起来百分之百确定。在人工智能的世界里,这被称为“过度自信”。科学家们正试图教会这些机器人说出“我挺确定”或“我不太确定”,这样我们才知道何时可以信任它们。这就是“置信度估计”(confidence estimation)的挑战:弄清楚机器人的答案有多大可能正确。为了做到这一点,研究人员会观察机器人的内部“低语”——被称为“Token概率”的微小数字,这些数字显示了机器人在句子中选择下一个词的可能性。大问题是:我们能否将这些嘈杂的低语转化为一个可靠的“真相计量器”,从而准确告诉我们该在多大程度上信任机器人?
一组研究人员决定测试这个想法,特别是在数学问题方面。他们把人工智能看作是一个正在参加考试的学生,并问道:“如果我们仔细聆听学生的思考过程,能否在他们写完答案之前就判断出他们是否答对了?”他们比较了两种主要的聆听方式。第一种是“单次通过”式聆听,即他们只一次性分析数学题和机器人给出的最终答案。第二种是“多次通过”式聆听,即他们要求机器人检查自己的工作,或者让同一个问题在脑海中以略微不同的方式运行多次,看看是否会得到相同的结果。
以下是他们的发现。首先,他们发现如果你只听答案的最后几个字(最终数字),机器人听起来会极其自信,即便它是错的。这就像一个学生在考试结束时写下“42”,但其实是靠瞎猜得到的。然而,如果你倾听整个推理链条——即机器人为了得出答案所做的每一步数学运算——你就能察觉到正确答案与错误答案之间细微且一致的差异。通过对整个思考过程中的这些微小信号进行平均,他们发现了一种无需要求机器人做额外工作就能获得更好“真相计量器”的方法。
研究人员还尝试了一些高级技巧来获取更好的信号。其中一个技巧是问机器人:“你确定这是对的吗?”(一种称为“自我验证”的方法)。他们发现,要求机器人从头开始重新阅读自己的答案虽然很准确,但非常缓慢且昂贵,就像让一个学生为了检查一行字而不得不重写整篇论文一样。但他们发现了一个聪明的捷径:与其重写全部内容,不如直接在原答案的末尾加上“这是对的吗?”这个问题。这种“原位”(in-situ)方法同样准确,却节省了88%的计算量,这无疑是一个巨大的效率胜利。
另一个技巧涉及“随机过程通过”(stochastic passes),即他们要求机器人通过加入一点随机性(比如掷骰子)来多次解决同一个问题,看看它是否会改变主意。这种被称为 MC Dropout 的方法在捕捉不确定性方面表现出色,但它需要机器人重复进行大量工作,这在计算上是非常沉重的。研究人员发现,虽然这种方法有效,但与更简单的“聆听整个故事”的方法相比,其投入的额外成本往往并不划算。
最后,他们测试了一个“校准”(calibration)步骤,这就像是在教机器人调整它的信心旋钮。他们使用了两种经典的数学工具(Platt scaling 和 isotonic regression)来微调机器人的置信度分数,使其更符合现实情况。他们发现,这些工具效果惊人,尤其是在拥有少量练习题(仅需50个示例)进行学习的情况下。然而,他们也注意到,在简单数学题上学到的校准并不总能很好地应用于难题,而且在一种类型的机器人上学到的校准也无法很好地迁移到另一种类型的机器人上。
简而言之,这篇论文表明,我们不需要让机器人付出两倍的努力来了解它是否正确。通过仅仅更加关注它推理的整个路径,而不是仅仅关注最终答案,并利用一种巧妙且低成本的方式让它自我检查,我们就可以构建出更加值得信赖的置信度计量器。这些发现表明,通过适当的调优,我们可以让人工智能系统在了解自己所知与所不知时变得更加诚实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。