← 最新论文
💻 computer science

Second MOASEI Competition at AAMAS'2026: A Technical Report

本技术报告详细介绍了 2026 年 MOASEI 竞赛,该竞赛引入了动态野火轨道并扩展了评估指标,但由于参与度有限,最终仅产生了一个采用 DLC 方法的网约车参赛方案,并以此击败了基准策略夺冠。

原作者: Ceferino Patino, Tyler J. Billings, Alireza Saleh Abadi, Daniel Redder, Adam Eck, Prashant Doshi, Leen-Kiat Soh

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Ceferino Patino, Tyler J. Billings, Alireza Saleh Abadi, Daniel Redder, Adam Eck, Prashant Doshi, Leen-Kiat Soh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一场规则不断变化、玩家仍在其中竞技的巨型高风险电子游戏锦标赛。这本质上就是 MOASEI 竞赛 的核心。

这场比赛于 2026 年 5 月在塞浦路斯举行,是人工智能(AI)研究人员的第二届年度竞赛。其目标不仅是看谁能构建出最聪明的 AI,而是看谁能构建出一种在周围环境变得混乱、不可预测且充满惊喜时,依然能保持聪明的 AI。

以下是使用一些日常类比对发生情况进行的详细说明:

背景:一个停不下来的世界

在大多数电脑游戏中,地图是固ط定的,敌人遵循既定脚本。但在这次竞赛中,“世界”是一个开放智能体系统(Open Agent System)。把它想象成一条繁忙的城市街道:

  • 智能体(Agents) 就像汽车或快递员。
  • 任务(Tasks) 就像凭空出现的乘客或包裹。
  • 转折点: 有时司机的车会坏掉(智能体变化),有时会有新乘客跳上街头(任务变化),有时司机的油箱会变空或者他们的地图在中途更新(能力变化)。

竞赛通过这个混乱城市的三个不同“层面”来测试 AI 团队:

  1. 灭火(Wildfire Fighting): 就像一支消防队,其中一些队员可能会耗尽水资源,或者因为太累而无法到达新的火场。
  2. 网络安全(Cybersecurity): 就像一支数字守卫队,试图在黑客不断改变战术时保护网络。
  3. 网约车(Ride-Sharing): 就像一支出租车队,试图接送那些在随机时间和地点出现的乘客。

2026 年的新规则

组织者希望让今年的游戏比去年更难、更公平。他们引入了两项重大变化:

  • “奖励关卡”(框架开放性/Frame Openness): 在灭火赛道中,他们增加了一项新规则,即消防员的设备可以在工作过程中发生变化。想象一下,一名消防员突然发现他们的水管水压减半了,或者他们的梯子比之前变短了。AI 必须立即做出调整。
  • 更好的评分卡: 他们不再仅仅关注最终的“总分”,而是开始统计具体指标,例如:完成了多少工作?人们等待了多久?我们创造了多少价值? 这就像是从说“我们赢了比赛”到说“我们服务了 50 名客户,平均等待时间为 2 分钟”的区别。

结果:一个寂静的年份与一位明星选手

尽管备受期待,2026 年的竞赛却显得有些冷清。

  • 观众: 共有八支队伍报名参赛。
  • 终点线: 只有一支队伍真正完成了比赛并提交了他们的方案。
  • 获胜者: 该队伍名为 DLC,他们只参加了网约车层面。因为他们是唯一完成比赛的队伍,所以他们自动赢得了该赛道的冠军。

获胜者(DLC)是如何表现的

DLC 团队没有使用“试错法”。相反,他们构建了一个行为类似于超级组织化调度员的 AI。

  • 策略: 想象一个不断重新绘制地图的出租车调度员。每当有新乘客出现时,调度员不仅仅是说“好的,出发”。他们会停下来,观察所有的车辆、所有的新乘客以及交通状况,然后重新规划所有人的路线,以确保接送尽可能多的人。
  • 表现:
    • 成功: 他们的 AI 在将乘客送到目的地方面表现出色。他们完成的行程数量几乎与“贪婪型”基准(一种只顾抓取最近乘客而不考虑长远规划的 AI)持平。
    • 速度: 他们比“先进先出(FIFO)”基准(即只接送排在第一位的人)接人速度更快。
    • 权衡: 这里有一个代价。虽然 DLC 接到了更多的人,但行程本身的时间也变长了。这就像一名公交司机,为了接 10 个人会在途中多次停靠,而不是直接开往目的地。他们让更多的人到达了某个地方,但旅程变长了。

我们学到了什么

论文以几个关键结论结束:

  1. 规划行之有效: DLC 团队证明了,一个不断重新思考计划的 AI 在处理任务不断出现的场景时非常出色。
  2. 平衡的艺术: “完成任务”与“快速完成”之间存在张力。获胜者完成了更多任务,但耗时更长。未来的竞赛需要决定哪一个更重要。
  3. 需要更多玩家: 2026 年最大的教训是,这项竞赛需要更多的队伍。由于只有一份参赛方案,我们无法真正比较不同的 AI 风格(例如“学习型”对比“规划型”)。组织者计划让规则更清晰,并提供更好的起始工具,以便更多队伍能在下次加入。

简而言之,2026 年的竞赛表明,一个愿意不断重新规划一天的 AI 可以很好地应对混乱的网约车世界,即使行程可能会因此变长。这是对一种特定方法的成功测试,也为未来更激烈、规模更大的竞赛奠定了基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →