Efficient Sequential Evaluation of Large Language Models
本文提出了一个通过构建基于测试超鞅(test supermartingales)的置信序列,并设计自适应查询规则以最小化评估成本,从而实现对大语言模型进行高效顺序评估的框架,同时揭示了由于预测失配和分布尖峰问题,简单的均匀采样有时会优于更复杂的自适应策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位法官,正试图弄清楚一个全新的、超级聪明的机器人回答问题的水平究竟有多高。你有一个包含数千个问题的庞大题库,但检查每一个问题既费时又极其昂贵。因此,你决定只问几个问题,以此来大致了解机器人的整体得分。难点在于,你知道何时该停止。如果你停得太早,你的猜测可能会天差地别;如果你等得太久,就会浪费时间。在统计学的世界里,有一种特殊的工具叫做“置信序列”(confidence sequence),它就像一个不断缩小的安全网。与那种只有在你承诺在特定时间停止时才有效的普通网不同,这个安全网无论你决定何时停止观察,始终都是有效的。它保证了机器人的真实得分始终处于这个网内,即使你根据目前所见的情况改变了停止的时机。
现在,假设你有一个水晶球(或者在这种情况下,是一本历史书)展示了之前的机器人是如何回答这些相同问题的。你可以利用这些历史记录来预测这个新机器人会觉得哪些问题容易或困难。现在的关键问题是:你如何利用这个水晶球来挑选出下一个要问的最佳问题,从而让你的安全网缩小得尽可能快?这就是 Chia-Yu Hsu 和 Shubhanshu Shekhar 在论文《大语言模型的高效顺序评估》(Efficient Sequential Evaluation of Large Language Models)中所探讨的谜题。他们试图找出测试一个新大语言模型(LLM)最有效率的方法,即通过询问更少的问题,同时在数学上确保结果的准确性。
作者们设定了一个游戏,试图尽可能快地缩小那个安全网(置信序列)。他们探索了两种构建这个网的主要策略。第一种类似于“反向信息投影”(Reverse Information Projection, RIPr),这是一种高级说法,意指他们寻找仍然符合数据的“最坏情况”,并衡量新机器人与该最坏情况之间的差距。第二种策略是“通过投注进行测试”(testing-by-betting),他们想象在机器人表现好还是坏之间进行一场赌注,如果他们的预测正确,他们就会赢得钱(或“财富”),这有助于缩小安全网。
为了让过程更快,他们提出了一种“面向增长”的规则。这就像一个侦探,他不是随机提问,而是总是挑选下一个最有可能提供重大线索、从而缩小嫌疑人身份范围的问题。他们会计算哪一个问题能在紧接着的下一步中让安全网缩小得最多。然而,他们遇到了一个障碍:他们的水晶球(来自历史数据的预测)并不完美。如果预测错了,侦探可能会追逐错误的线索,导致安全网停止缩小的速度变慢。他们发现有两个因素会拖慢进度:一是预测偏差过大(失配),二是侦探只询问那些彼此非常相似的问题(尖锐性),从而忽略了题库中的其他部分。
为了解决这个问题,作者尝试将他们的“聪明侦探”策略与另外两种方法相结合:一种侧重于修正水晶球的预测,另一种则是完全随机地提问(均匀采样)。他们通过不同的机器人行为类型和题库进行了模拟实验,以观察这种混合方式哪种效果最好。有趣的是,他们的实验表明,并不存在一种在任何情况下都获胜的“神奇”策略。有时,最复杂的自适应侦探策略表现得非常好;但在其他时候,最简单的策略——仅仅随机挑选问题——其表现同样出色,甚至更好,尤其是在预测不稳的情况下。他们得出结论:虽然聪明的自适应规则功能强大,但谦逊的随机方法是一个出人意料的强力竞争者,不应被忽视。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。