TMAS: Scaling Test-Time Compute via Multi-Agent Synergy
本文介绍了TMAS,这是一个多智能体协同框架,它通过利用分层记忆实现结构化跨轨迹协作,并采用混合奖励强化学习方案以在推理任务中有效平衡探索与利用,从而增强大语言模型的测试时计算扩展能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试解决一个极其棘手的谜题,比如一道复杂的数学题或一个刁钻的逻辑谜语。你有一位非常聪明的助手(人工智能)可以试着去解决它。
旧方法:独狼 vs. 人群
以前,如果人工智能陷入困境,研究人员只会告诉它“更努力地思考”或“再试一次”。
- 独狼:人工智能只会自言自语,写下一条长长的思维链。有时它会陷入死循环,一遍又一遍地重复同样的错误。
- 人群:其他方法会让人工智能同时生成许多不同的答案,选择最普遍的一个,或者让一个版本检查另一个版本。但这些版本往往在各自为政。如果一个版本发现了一个绝妙的技巧,其他版本并不知道;如果一个版本走进了死胡同,其他版本也不知道要避开那条路。它们就像房间里的一群人,都在大声喊出不同的想法,但没有人真正在倾听彼此,也没有人共享一本笔记。
新方法:TMAS(拥有共享大脑的团队)
这篇论文介绍了TMAS(测试时多智能体协同)。不要把它看作一个单一的人工智能,而要把它看作一个专业团队,他们共同协作,并拥有一个共享记忆系统。
以下是 TMAS 的工作原理,使用一个简单的类比:
1. 专家团队
TMAS 不是让一个人工智能包揽所有工作,而是将工作分配给五个特定的“智能体”(团队成员):
- 求解者:尝试提出答案。
- 检查者:审查求解者的工作以发现错误。
- 总结者:将检查者的笔记转化为清晰的“经验教训”。
- 经验保管员:这至关重要。它审视这些教训,并将它们写入一本**“底层笔记”**。这本笔记包含具体、明确的事实,例如:“嘿,我们曾尝试将这块瓷砖垂直放置,结果失败了。别再那样做了,”或者“我们已证明这个特定数字是 3,所以稍后我们可以利用这个事实。”
- 策略向导:这个智能体写入一本**“高层地图”**。这张地图不列出具体事实,而是列出方法。它会说:“我们已经尝试过用代数解决这个问题。我们也尝试过用几何方法。别再浪费时间重复这些了;尝试一些全新的东西。”
2. 迭代过程(循环)
团队按轮次工作:
- 探索:求解者生成针对该问题的几种不同尝试。
- 验证:检查者对这些尝试进行评分。
- 学习:经验保管员和策略向导根据发生的情况更新他们的笔记和地图。
- 优化:下一轮的求解者阅读这些笔记和地图。它们利用“底层笔记”来避免过去的具体错误,并利用“高层地图”确保它们不仅仅是在重复旧策略。
3. “混合奖励”(教练的激励)
为了教会人工智能如何有效地利用这个团队,研究人员创建了一个特殊的训练系统(强化学习)。想象一位教练给团队三种类型的奖励:
- 奖励 1(做对):如果你解开了谜题,你得一分。(基本技能)。
- 奖励 2(使用笔记):如果你解开了谜题,且* specifically 是因为你使用了“底层笔记”中的一个事实,你将获得*额外奖励。这教会人工智能真正去阅读并信任共享记忆,而不是无视它。
- 奖励 3(要有创意):如果你使用了一种“高层地图”上未列出的新策略解开了谜题,你将获得额外奖励。这防止团队变得懒惰,只是重复同样的旧把戏。如果你只是复制粘贴旧策略,你会受到惩罚。
结果
该论文在非常困难的数学基准测试(如国际数学奥林匹克竞赛)上测试了这种方法。
- 发现:随着团队拥有更多思考时间(更多“迭代”),TMAS 会变得越来越聪明。其他方法往往会撞上一堵墙,停止进步,甚至因为被自己的历史搞糊涂而开始犯更多错误。
- 类比:这就像是一个只反复阅读教科书(变得疲惫且困惑)的学生,与一个拥有导师、学习小组和共享抽认卡系统的学生之间的区别。拥有该系统的学生学习得更快,避免重复错误,并在陷入困境时尝试新的角度。
总结:
TMAS 将单一的人工智能转变为一个拥有共享记忆的协调团队。它迫使人工智能记住具体事实(经验库)并追踪哪些大思路已经失败(指南库)。通过训练人工智能重视利用这些记忆并尝试新路径,它能够通过有效地扩展其“思考时间”来解决比以往更困难的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。