A complementary study on PlanGPT: Evaluation with defined Performance Metrics and comparison with a planner
本文通过定义的性能指标对 PlanGPT 大语言模型进行了补充性评估,结果表明其相较于传统规划器并无优势,且表现并不优于简单的贪婪搜索策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图指挥一个机器人去清理一个乱七八糟的房间。你有一份规则清单(比如“捡起袜子”、“把袜子放进脏衣篮”),一张房间初始状态的照片,以及一张干净房间的目标照片。机器人需要弄清楚从凌乱状态到整洁状态的具体执行步骤。
在人工智能的世界里,这被称为自动规划(Automated Planning)。通常,我们会使用一种特殊的、高度逻辑化的计算机程序,叫做规划器(Planners)。它们就像是顶尖的象棋高手,会计算每一种可能的走法,以找到那条完美的路径。
最近,一种名为 PlanGPT 的新型人工智能被引入了。请不要把 PlanGPT 仅仅看作是一个逻辑机器,而要把它看作是一个超级创意作家(一种大语言模型),它接受过训练,能够通过“编写”这些逐步执行的指令,而不是通过计算来完成任务。现在的关键问题是:这个创意作家真的能胜任逻辑大师的工作吗?还是说它只是在瞎猜?
这篇论文是一项“补充性研究”,这意味着作者决定对 PlanGPT 的工作进行复核,因为原始报告并没有提供完整的故事。
实验:一场三方竞赛
为了测试 PlanGPT 是否真的好用,作者设置了一场在 7 个不同“房间”(领域)赛道上的比赛,这些领域涵盖了从堆叠积木到移动卡车的各种场景:
- PlanGPT(创意作家): 这种新型 AI,它尝试根据它学到的模式来“猜”出计划。
- A(完美主义者):* 一种传统的规划器,它会花时间寻找绝对最优且最短的路径,但如果房间太乱,它有时会陷入僵局。
- Greedy(短跑选手): 一种传统的规划器,它会抓取它看到的第一个有效路径。它并不总是能找到最好的路径,但它的速度极快。
作者测量了两个指标:
- 计划成本(Plan Cost): 机器人需要执行多少步?(步数越少 = 越好)。
- 规划时间(Planning Time): 计算机生成计划花了多长时间?
结果:作家 vs. 短跑选手
以下是作者的研究发现,我们使用一些简单的类比:
- “完美”路径: PlanGPT 有时能找到和“完美主义者”(A*)一样好的路径,但并非总是如此。
- 速度测试: “短跑选手”(Greedy)几乎总是能最快地制定出计划。PlanGPT 有时比“完美主义者”快,但通常比“短跑选手”慢。
- 大惊喜: 当他们查看综合得分时,PlanGPT 的表现并不比“短跑选手”(Greedy)更好。 在许多情况下,“短跑选手”实际上能找到更好的、更短的计划。
“一招走天下行不通”的问题:
作者指出了 PlanGPT 设计中的一个重大缺陷。为了工作,PlanGPT 需要为每一种类型的房间配备一个不同的**“大脑”(模型)**。
- 如果你想堆叠积木,你需要模型 A。
- 如果你想移动卡车,你需要模型 B。
- 如果你想发射卫星,你需要模型 C。
这就像是为了家里的每一项琐事都要雇佣一位专门的专家。一个人擅长烹饪,另一个人擅长打扫,但你必须为 8 项工作雇佣 8 个人。这消耗了大量的计算机资源。作者问道:仅仅为了完成一项单凭一个快速的“短跑选手”就能搞定的工作,而去雇佣一整个昂贵的专家团队,真的值得吗?
结论
论文得出结论,虽然 PlanGPT 是一个有趣的实验,但它目前还不是一个**“称职”的规划器**。
- 它并不能始终比简单、快速的方法找到更好的计划。
- 它需要海量的资源(8 个不同的模型,大量的计算能力)。
- 它无法处理需要比其训练数据中更多物体的复杂问题。
作者暗示,大语言模型(如 PlanGPT)可能并不是这项特定工作的正确工具。它们可能更适合写故事或聊天,而传统的逻辑程序仍然是规划任务的最佳选择。他们也暗示,或许未来属于另一种 AI——一种旨在进行“推理”而非仅仅是“预测单词”的 AI,但就目前而言,创意作家还没有打败逻辑机器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。