← 最新论文
🤖 AI

PLATO: Pointer Learner for Agent and Task Openness

本文介绍了 PLATO,一种新颖的多智能体强化学习框架,该框架结合了基于指针网络的执行器(actor)与基于图神经网络的评论家(critic),旨在无需依赖人工边界或重新训练的情况下,有效处理动态环境中的智能体开放性与任务开放性。

原作者: Alireza Saleh Abadi, Leen-Kiat Soh, Daniel Alan Redder, Adam Eck, Prashant Doshi

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Alireza Saleh Abadi, Leen-Kiat Soh, Daniel Alan Redder, Adam Eck, Prashant Doshi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个游戏规则在你还在进行比赛时就会发生变化的场景。在人工智能领域,特别是被称为多智能体强化学习(Multi-Agent Reinforcement Learning)的一个领域中,计算机通过尝试各种做法并根据优秀的举动获取奖励来学习如何协作。通常情况下,这些计算机团队是在一个静态的世界中接受训练的:拥有相同的玩家数量、相同的目标以及永远不变的规则。但在现实世界中,情况是混乱且多变的。新的任务会意外出现,团队成员可能会在比赛中途离开或加入,而“竞技场”本身也可能发生偏移。这种混乱、变化的环境被称为开放式智能体系统(Open Agent System)。科学家面临的巨大挑战在于,如何教会 AI 团队即使在团队规模和任务列表发生不可预测的变化时,仍能保持高效协作。如果一个 AI 被训练去扑灭五场火灾,但突然出现了第六场,或者其中一个消防机器人耗尽了燃料离开,它能否在无需从头开始重新训练的情况下实现即时适应?

本文介绍了一种名为 PLATO(用于智能体与任务开放性的指针学习器,Pointer Learner for Agent and Task Openness)的新型 AI 系统,旨在解决这一问题。可以将 PLATO 想象成一位超级灵活的队长,它不依赖于固定的清单。它不是死记硬背“任务 1、任务 2、任务 3”这样的列表,而是使用了一种被称为**指针网络(pointer network)**的巧妙技巧。想象一下你身处一个挤满了人的房间,你需要指向那个需要帮助的人。如果有一个新人走进来或者有人离开了,你不需要重新学习如何指向,你只需要指向当前在场的人即可。PLATO 对任务也这样做。当新的火灾出现或某个智能体离开时,该系统可以即时指向现有的选项,而无需重新训练。

研究人员在模拟野火场景中测试了 PLATO,这是一个数字世界,其中的消防机器人必须扑灭那些会蔓延、随机出现或燃尽的火灾。他们将 PLATO 与其他智能 AI 方法进行了对比,发现 PLATO 处理这种混乱的能力要出色得多。当团队规模发生变化或新火灾出现时,PLATO 仍能保持团队的协调与高效。更令人印象深刻的是,当他们在一个小型的网格上训练 PLATO,然后将其投入到一个更大的、未见过的网格中时,无需任何额外训练,它依然表现强劲。这种“零样本”(zero-shot)能力表明,PLATO 不仅仅是在记忆一张特定的地图,它正在学习一种能在新的、不可预测的情况下发挥作用的灵活技能。论文表明,通过将这种指向机制与理解智能体和任务之间连接关系的图结构大脑相结合,AI 团队即使在周围环境不断变化的情况下也能保持稳健。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →