LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning
LEMON 是一种新颖的基于大语言模型的编排器,它利用反事实强化学习,通过整合角色、职责、能力和依赖关系来生成可执行的多智能体规范,并在多样化的推理与编码基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一个 AI 助手团队,每个助手都具备不同的技能和“脑力”水平。有些助手速度快但能力简单(就像初级实习生),而另一些则速度慢但才华横溢(就像资深教授)。真正的挑战不仅仅在于拥有这些助手,更在于如何组织它们以解决特定问题。
如果你问一个简单的问题,就不需要整个委员会。如果你问一个复杂的数学问题,就需要一条特定的专家链条。如果你问一个编程问题,则需要完全不同的团队结构。
本文介绍了LEMON,一个充当动态团队经理的智能系统。LEMON 不像传统方法那样为每项任务使用固定的团队,而是学会为每一项任务从零开始构建完美的团队结构。
以下是其工作原理,分解为几个简单概念:
1. 问题:“一刀切”的陷阱
大多数现有系统使用固定的团队。想象一支建筑队,无论建造狗屋还是摩天大楼,都始终使用同一张蓝图。
- 问题所在:有时这张蓝图对于简单任务来说过于复杂(浪费时间和金钱);有时对于困难任务来说又过于薄弱(导致任务失败)。
- 旧方法:研究人员曾试图通过逐个调整部分来解决这个问题——也许只是改变谁与谁沟通,或者只是改变谁负责工作。但本文认为,仅调整团队的一个部分无法解决问题;你必须将整个团队、角色和工作流程作为一个整体包来共同设计。
2. 解决方案:LEMON(总建筑师)
LEMON 是一个充当建筑师的 AI。当你给它一个任务(例如“解决这个数学问题”或“编写这段代码”)时,它不会直接给出答案。相反,它会撰写一份蓝图(称为“可执行编排规范”)。
这份蓝图告诉系统:
- 雇佣谁:使用哪些具体的 AI 代理。
- 它们的工作是什么:对其职责进行自定义描述(例如,“检查单位”,而不仅仅是“求解器”)。
- 它们需要多聪明:为每个代理分配一个“能力等级”(小、中或大脑力)。
- 流程:谁需要与谁沟通,以及沟通的顺序。
这就像指挥家为管弦乐队谱写特定的乐谱。对于一首简单的歌曲,可能只需要一支长笛和一面鼓;对于一部复杂的交响乐,则需要完整的弦乐组。LEMON 为你正在演奏的这首曲子专门谱写乐谱。
3. 秘诀:“如果……会怎样”训练
LEMON 如何学会撰写这些完美的蓝图?它使用一种巧妙的训练方法,称为反事实强化学习。
想象你是一位正在批改学生作文的老师。
- 旧方法(稀疏反馈):你读完整篇作文,给出一个"B"的成绩,并说:“做得不错,但再试一次。”学生不知道哪句话写得不好,或者哪一段写得很好。他们只知道整篇文章得了 B。
- LEMON 的方法(局部反馈):LEMON 审视它刚刚写下的蓝图。然后,它提出一个“如果……会怎样”的问题:
- “如果我把这个特定的代理从‘大’改为‘小’,结果会变差吗?”
- “如果我移除这两个代理之间的这个连接,流程会中断吗?”
它瞬间运行这些“如果……会怎样”的场景。
- 如果改变某个特定部分导致结果变差,LEMON 就会明白:“啊,那个特定部分至关重要!”
- 如果改变某部分没有任何影响,LEMON 就会明白:“那部分是不必要的;下次我可以节省资源。”
这使得 LEMON 能够确切地学习到蓝图中哪些决策是重要的,而不是仅仅根据最终成绩进行猜测。
4. 结果:更智能、更经济
本文在六种不同类型的挑战上测试了 LEMON,包括高难度数学问题、逻辑谜题和编程任务。
- 性能更优:与使用固定团队或单一 AI 代理的其他方法相比,LEMON 正确解决了更多问题。
- 效率更高:因为 LEMON 确切知道每一步需要多少“脑力”,所以它不会在简单任务上浪费资金去使用超级计算机。它使用大小合适的工具来完成工作。
- 类比:如果其他方法就像为了一个三明治而订购盛大的宴会,那么 LEMON 就像是一位厨师,根据客人数量烹饪出恰到好处的饭菜。
总结
LEMON 是一个系统,它学会为每一个新问题设计自己的团队结构。它不使用僵化的、预先制作的团队,而是构建定制的工作流程,为每个步骤分配适当水平的智能,并通过“如果……会怎样”的实验进行学习,以确保计划的每个部分都是必要且有效的。其结果是一个在解决问题方面更聪明、运行成本更低的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。