Consilience for Verifier-Free Test-Time Scaling
本文引入了“consilience”,这是一种新颖的无需验证器的测试时扩展框架,它通过基于特定的时间不对称性(其特征为初始置信度低以进行探索,以及最终置信度高以实现收敛)来选择推理轨迹,从而克服了现有基于置信度方法的局限性,进而显著提升了在复杂数学和编程任务上的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人如何解决一个非常难的谜题。在人工智能的世界里,这些机器人被称为大语言模型(LLM)。它们就像数字大脑,可以编写代码、解决数学问题并回答棘手的问题。通常,当我们想要让它们更好地解决特定问题时,我们会让它们尝试许多不同的路径,然后使用一个“裁判”来检查哪个答案是正确的。把这个裁判想象成检查代码的编译器,或者拿着标准答案的老师。但如果你处于一种没有裁判的情况呢?如果你正在写一个故事、创造一种新型软件,或者解决一个目前还没有人知道答案的问题,情况会是怎样?这就是“无验证器”(Verifier-Free)扩展技术发挥作用的地方。其挑战在于,如何在没有外部评判者的情况下,帮助机器人找到最佳路径。长期以来,科学家们认为最好的方法是选择机器人看起来最“自信”的那个答案。这个想法很简单:如果机器人确定自己是对的,那它很可能就是对的。但本文指出,在处理极其困难的问题时,过早表现出过度自信实际上是一个陷阱。
来自 AWS AI Labs 的研究人员决定调查为什么这种“自信技巧”在面对难题时会失效。他们发现了一个迷人的缺陷:当机器人面对困难问题时,那些最终做对的机器人往往在一开始显得并不确定,会探索不同的可能性,直到最后才变得自信。相比之下,那些做错的机器人往往在一开始就表现得极其自信,立即锁定在一个(虽然是错误的)单一想法上。作者将这种现象称为“一致性”(Consilience)。这是一个高级词汇,意为“共同跳跃”。在科学领域,它描述这样一种情况:由于许多不同的证据链都指向同一个答案,因此结论是可靠的。论文认为,对于机器人要真正“知道”答案,它不应该仅仅快速收敛到一条路径上,而应该先探索许多路径(表现出低置信度),然后让所有路径在最后达成一致(表现出高置信度)。
为了测试这一点,团队创建了一种新的评分系统,称为“一致性得分”(Consilience Score)。这种新方法不再仅仅看整个答案的平均置信度,而是观察置信度的“故事”。它奖励那些以一点犹豫(探索)开始,并以强有力的确定结论结束的答案。他们在一些最难的挑战上进行了测试,包括研究生水平的数学问题和自由形式的代码生成。结果令人震惊。在简单问题上,旧的“选择最自信”的方法表现良好。但在难题上,旧方法经常选错答案,因为它们是“自信地错误”。然而,新的“一致性”方法成功地过滤掉了这些过度自信的错误。例如,在名为 LiveCodeBench 的困难编程基准测试中,使用这种新方法使名为 GPT-OSS-120B 的模型成功率从 65.7% 提升到了 69.7%。这表明,通过教导机器人去重视探索的“过程”而非仅仅是结论的“速度”,即使在没有老师来批改作业的情况下,我们也能让它在解决最重要的难题时变得更加聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。