EAGer: Entropy-Aware GEneRation for Adaptive Inference-Time Scaling
EAGer 是一种无需训练且感知熵的推理时扩展方法,它仅在不确定性高的令牌处分支推理路径以动态分配计算资源,从而在复杂推理基准测试中将令牌使用量降低高达 64%,同时显著提升 Pass@k 性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位老师,正在给一个由人工智能学生组成的班级布置数学考试。目标是获得正确答案。
传统上,为了确保人工智能给出正确答案,你会这样指示它:“不要只给我一个答案。无论问题多么简单或困难,都要为每一个问题写出32 种不同的解法。”然后,你查看所有 32 个答案,并挑选出最好的那一个。
这被称为全并行采样。它确实有效,但极其浪费。
- 问题所在:如果问题很简单(比如"2+2=?”),人工智能很可能会写出完全相同的 32 个答案。你为只需一个答案的问题浪费了 31 份脑力。
- 成本:这会消耗大量的电力和计算机时间,尤其是当人工智能在非常困难的问题上卡住,需要尝试许多不同路径来寻找解决方案时。
引入 EAGER:一位聪明、自适应的老师
这篇论文介绍了EAGER(熵感知生成)。你可以把 EAGER 想象成一位聪明的老师,它在人工智能思考时观察其“信心计”。
以下是 EAGER 的工作原理,使用一个简单的类比:
1. 信心计(熵)
想象人工智能正在穿过一个迷宫。
- 低熵(高信心):人工智能正走在一条笔直、光线充足的走廊上。它确切知道该往哪个方向走。它正在说:“我确定这就是路径。”
- 高熵(低信心):人工智能遇到了一个有雾的岔路口。它不确定该往哪边走。它正在说:“嗯,我可能走左边,或者也许走右边?我不确定。”
2. 策略:仅在受阻时分支
EAGER 不会盲目地写出 32 个答案,而是告诉人工智能:
- 当人工智能有信心时(低熵):“继续直走。不要浪费时间尝试新路径。只需完成这个句子。”
- 当人工智能困惑时(高熵):“停下!这是一个棘手的地点。让我们展开分支。在这里创建几个新的答案版本,以探索不同的可能性。”
这就像侦探破案。如果线索显而易见,他们就不需要调查每一条小巷。但当他们遇到令人困惑的线索时,他们会突然分头行动,派遣多名侦探沿着不同的街道去查看发现了什么。
3. “预算”技巧
论文中提到了一种计算机算力的“预算”。
- 旧方法:将全部预算花在每一个问题上,即使是简单的问题。
- EAGER 方法:由于 EAGER 跳过了简单问题上不必要的计算,它节省了巨大的预算份额。
- 重新分配:EAGER 将节省下来的能量分配给困难的问题。如果一个问题真的很难,EAGER 会利用这些“节省”下来的能量,让人工智能尝试比平时更多的路径,特别是在它最可能卡住的地方。
他们发现了什么?
研究人员在各种人工智能模型上对困难的数学、科学和编程问题测试了这种方法。以下是用通俗语言总结的结果:
- 更快、更便宜:与旧方法相比,EAGER 生成答案所使用的单词(token)数量减少了高达 64%。这意味着它节省了巨大的计算机算力。
- 更聪明:尽管使用的算力更少,但它实际上获得了更多正确的答案。
- 在人工智能可以检查自己工作的设置中(例如带有答案的数学测试),它将成功率提高了37%。
- 即使没有答案(仅靠猜测),它仍将成功率提高了12%。
- 无处不在:它在小型和大型人工智能模型上,以及在数学、科学和编程任务中,都表现良好。
核心结论
EAGER 是一种“无需训练”的方法,意味着你不需要重新教导人工智能如何思考。你只需给它一套新规则,规定何时尝试多条路径。
类比总结:
如果旧方法像是派遣 32 个完全相同的克隆体去解决每一个谜题,那么 EAGER 就像是派遣一名聪明的探险家,只有当路径变得模糊和令人困惑时,他才会分裂成多个克隆体。这节省了简单部分的能量,并将所有额外的能量集中在困难部分,从而以更少的浪费获得更好的结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。