← 最新论文
💬 NLP

SePO: Self-Evolving Prompt Agent for System Prompt Optimization

该论文提出了 SePO,一种通过两阶段进化搜索同时优化任务智能体和提示词智能体自身系统提示词的自指框架,证明了其与现有方法相比,在多种基准测试中具有更优越的泛化能力和性能。

原作者: Wangcheng Tao, Han Wu, Weng-Fai Wong

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Wangcheng Tao, Han Wu, Weng-Fai Wong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个聪明但固执的机器人助手(任务智能体/Task Agent),它需要解决复杂的谜题、编写代码或进行数学运算。为了让这个机器人表现得更好,你给了它一套指令,称为“系统提示词(system prompt)”。

长期以来,人类一直是编写这些指令的人。如果机器人失败了,人类会重写指令,再次尝试,并寄希望于更好的结果。一些更新的方法使用一个“教练”(提示词智能体/Prompt Agent)来自动重写这些指令。但问题在于:教练自身的指令仍然是由人类编写且从未改变过的。无论教练尝试了多少次去帮助机器人,它都受困于一份固定的、由人工编写的手册。

SePO (自我进化提示词优化/Self-Evolving Prompt Optimization) 改变了这一局面,它让教练能够“教练自己”。

核心理念:教练教导教练

把 SePO 想象成一个 AI 指令手册的健身房。

  • 旧方法: 你雇佣了一名私人教练(教练)来帮助一名客户(机器人)健身。但教练自己的训练计划是由人类编写的,并且从未更新。教练在帮助客户方面变得更专业了,但教练自己却从未变得更强壮。
  • SePO 方法: 教练同时也是一名客户。教练帮助客户变得强壮,但教练也使用同样的训练方法来改进自己的训练计划。教练不仅在帮助客户变强,教练自己也在变得更聪明、更强大。

运作方式:两个阶段的训练

论文描述了一个类似于人类学习新技能的两步过程:

第一阶段:“新兵训练营”(预训练/Pre-training)
在教练开始帮助任何特定的机器人之前,它先参加了一个包含各种挑战(数学、逻辑谜题、编程、科学)的“新兵训练营”。

  • 在这个阶段,教练尝试解决这些问题。
  • 当它失败时,它会批判自己的指令,重写指令,然后再次尝试。
  • 它保留了一个“剪贴簿”(存档/archive)来记录其最佳指令。如果一条新指令比旧指令效果更好,它就会保留新指令。
  • 结果: 教练进化成了一位大师级的导师,具备了修复指令的通用“技能”,而不仅仅是死记硬背某个特定的技巧。

第二阶段:“专业工作”(微调/Fine-tuning)
现在,教练被雇佣来帮助一个执行特定任务的特定机器人(例如,解决数独问题)。

  • 教练利用其进化后的、超级智能的指令来帮助机器人。
  • 它会针对特定的谜题来微调机器人的指令。
  • 因为教练在第一阶段学会了“如何学习”,所以它可以快速适应新工作,而无需在开始前由人类先重写它的手册。

为什么这很重要(结果)

研究人员在五种截然不同的挑战类型上对其进行了测试:

  1. 数学(高难度竞赛题)
  2. 抽象推理(视觉模式谜题)
  3. 科学(研究生水平的问题)
  4. 编程(编写 Python 程序)
  5. 逻辑(数独谜题)

他们将 SePO 与以下方法进行了对比:

  • Manual-CoT: 由人类编写指令。
  • TextGrad: 一种会调整指令但使用固定的、由人类编写的“评论家”的方法。
  • MetaSPO: 一种学习全局规则但仍依赖于固定的、由人类编写的优化器的方法。

结果:
SePO 在每一项任务中都胜出了。与人类编写的基准线相比,平均准确率提升了 4.49 个百分点

  • 它不仅仅是记住了答案;它学会了一种编写更好指令的通用“技能”。
  • 即使在测试一个它在“新兵训练营”期间从未见过的谜题(数独)时,它的表现仍然优于其他方法。这证明它学习到的是一种可迁移的技能,而非仅仅是一个特定的技巧。

“进化花园”的比喻

想象一下,指令就是花园里的植物。

  • 旧方法: 你种下种子(指令)并浇水。如果一株植物枯死了,你就从袋子里选一颗新种子再试一次。园丁(教练)本身不会改变。
  • SePO: 园丁本身也是一株植物。园丁在照料其他植物的同时,也在生长、进化并变得更擅长园艺。花园会记录下最好的植物(存档),并利用它们作为阶梯,去培育更优秀的植物。最终,这个花园培育出了一位如此熟练的园丁,以至于他可以种出任何东西,甚至是那些他从未见过的植物。

总结

SePO 闭合了环路。SePO 不再是让一个人类为 AI 教练编写一份固定的手册,而是让 AI 教练能够编写并改进自己的手册。这使教练从一个静态的工具变成了一个通过经验变得越来越聪明的学习伙伴,从而在数学、科学、编程和逻辑谜题方面实现了更好的表现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →