Self-Evolving Software Agents
本文提出了一种融合BDI推理与大语言模型的自进化软件智能体架构,该架构能够基于经验自主更新目标、推理过程及可执行代码,从而展示了大语言模型驱动的软件进化在动态多智能体环境中的可行性及其当前局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一位机器人厨师。过去,如果你想让这位厨师学会烘焙蛋糕,必须有一位人类程序员坐下来,重写厨师的食谱。这位厨师可以完美地遵循指令,但它无法自行决定发明新食谱。它被限制在建造时赋予它的目标和技能之中。
本文介绍了一种新型“自我进化”的软件智能体,它就像一位不仅遵循食谱,还能编写新食谱、改变自身烹饪理念,甚至在工作过程中构建新厨房工具的厨师。
以下是作者马可·罗博尔(Marco Robol)和保罗·焦尔吉尼(Paolo Giorgini)对这一突破的解释:
问题所在:“硬设定”的机器人
目前,大多数智能计算机程序(智能体)就像 GPS 系统。如果交通拥堵,它们可以为你重新规划路线(适应环境),但它们无法决定改变目的地,也无法发明到达目的地的新方法。它们的目标和规则在启动前就由人类“硬编码”设定。它们可以适应,但无法真正进化。
解决方案:双脑系统
作者提出了一种结合两种强大理念的系统:
- BDI(信念 - 欲望 - 意图):将其视为智能体的“日常大脑”。它不断观察世界,决定想要做什么,并选择执行计划。
- LLM(大型语言模型):这是“创意架构师”。它是人工智能中能够理解语言、构想新想法并编写代码的部分。
奇迹发生在将特殊的“进化模块”添加到日常大脑旁边运行时。
工作原理:“夜校”类比
想象智能体是一名白天工作的学生(BDI 循环)。当它遇到无法解决的问题时——例如试图打开一扇没有把手的门——它不会轻易放弃。
相反,它会暂停并召唤它的“夜校”(进化模块)。该模块就像一位老师,说道:
- “你失败了,因为你没有应对这种情况的工具。”
- “让我们发明一个新目标:‘找到开门的方法’。”
- “让我们编写一个新计划,甚至构建一个新工具(代码)来实现它。”
随后,智能体尝试这个新计划。如果成功,它会将新工具和新目标保留在永久记忆中;如果失败,则抛弃该想法。随着时间的推移,智能体建立起自己的发明库,在没有人类程序员触碰代码的情况下改变自身的“基因”。
实验:从零开始学习
团队构建了一个原型,并将其置于一个繁忙且不断变化的数字世界(灵感来源于外卖应用)中。他们几乎不给智能体任何初始设定——仅提供了对世界的基本描述和几个简单工具。他们没有告诉它该做什么。
结果:
- 成功:智能体自行意识到需要完成某些任务(如递送包裹),并编写了相应的代码。它几乎从零先验知识出发,发现了新目标并创造了新行为。
- 局限性:论文承认该系统尚不完美。有时,当环境过于复杂时,智能体难以记住过去成功的技巧,或难以保持新行为的稳定性。这就像一名学生学会了新的数学公式,却忘记了如何进行基础加法。
核心结论
本文表明,我们可以构建不仅遵循指令,还能自学新技能并重写自身操作手册的软件。尽管它仍是一个原型,存在一些成长中的阵痛(特别是在稳定性和记忆过往教训方面),但它证明了软件自我进化的理念是可行的。下一步是教会这些智能体更好地保留所学,以免在情况变得混乱时将其遗忘。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。