Evolving in the Agent Jungle via History-Informed Opponent Awareness
本文介绍了 OASE,这是一个通过利用历史对手快照来锚定成对比较,从而增强大语言模型(LLM)智能体在动态多智能体环境中适应能力的框架,该框架通过仅选择性地采用具有证明收益的技能修订,来避免过时的更新。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机不再仅仅遵循僵化指令,而是学会像人类一样思考、交谈和做决定的世界。这就是**大语言模型(LLMs)**的领域,它们是当今许多聊天机器人和助手背后超级聪明的 AI 大脑。通常,我们通过向它们喂入海量数据来教导这些 AI,但有一个更酷的新想法:让它们通过“实践”和“与自己对话”来进行学习。与其修改它们的内部代码,不如让它们根据过去发生的事情来重写自己的“规则手册”或“技能库”。这就像一名学生在经历了一次糟糕的考试后,通过重写学习笔记来争取下次表现得更好。
但棘手的地方在于:当你把这些聪明的学生放在一个同样在同时重写笔记的聪明学生组成的教室里时,会发生什么?这就是**多智能体系统(Multi-Agent Systems)**的世界。在游戏、市场或拍卖中,你的成功不仅取决于你自己的技能,更完全取决于其他所有人正在做什么。如果你的对手改变了策略,“游戏规则”就会瞬间发生偏移。这使得学习变得异常困难,因为你瞄准的目标一直在移动。科学家们一直试图研究如何教导这些 AI 智能体进行适应,而不至于被不断演化的对手所带来的混乱搞得晕头转向。
于是,由研究员张兆峰及其团队提出的新方法——OASE(对手感知选择性进化,Opponent-Aware Selective Evolution)登场了。想象一片丛林,每种动物都在试图进化出更好的狩猎策略。在旧有的做法中(例如“Reflexion”方法),一种动物会尝试一个新动作,观察它是否奏效,如果看起来还行,它就会立即永久采纳这个动作。但在一个每个人都在变化的丛林里,一个今天看起来很棒的动作,明天可能会变得很糟糕,因为猎物已经学会了躲避。
OASE 就像一位非常谨慎且精通历史的教练。它不会仅仅因为一个新策略奏效了就盲目接受,而是会说:“等等。让我们用昨天面对的同样的对手,以及昨天拥有的同样的随机运气,来测试这个新想法。”它进行了一场并排进行的比赛:旧策略对阵新策略,但使用完全相同的条件。只有当新策略以显著的优势击败旧策略时,教练才会说:“好吧,让我们切换。”
研究人员在两个棘手的场景中测试了这一点:一个是第一价格拍卖(你秘密竞标一件物品,出价最高者获胜,但支付你所出的价格),另一个是私人成本库诺竞争(公司根据其秘密成本决定产量)。在这些模拟中,OASE 智能体比使用旧有“盲目更新”方法的智能体更能找到一个稳定且获胜的平衡点。
神奇之处在于:OASE 智能体不仅赢了,而且赢得很“聪明”。当其他智能体在不断改变主意时——在拍卖游戏中每代接受约 4.00 个新策略时——OASE 非常挑剔,每代仅接受约 0.78 次变更。通过拒绝采纳软弱或令人困惑的想法,OASE 保持了其策略的稳定性。在拍卖游戏中,OASE 最终比另一种方法(0.133)更接近完美的数学平衡(均衡距离为 0.057)。在生产竞争中,OASE 也比理想目标更接近(0.065 对比 0.077)。
论文指出,通过使用这些“历史快照”来创建一个公平、受控的测试,OASE 避免了追逐移动目标的陷阱。它证明了在竞争激烈的 AI 智能体丛林中,进化的最佳方式不是时刻改变一切,而是在你拥有确凿、无可辩驳的证据证明新方法确实更好时才进行改变。这就像是一个疯狂尝试每一种新见到的坚果的惊慌失措的松鼠,与一只只有在数据表明猎物确实移动后才会改变狩猎地点的高明猫头鹰之间的区别。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。