← 最新论文
🤖 AI

FAPO: Fully Autonomous Prompt Optimization of Multi-Step LLM Pipelines

FAPO 是一个全自动框架,通过迭代地评估、诊断并优化提示词(prompt)和链式结构(chain structures),来优化多步 LLM 流水线,通过超越 GEPA 基准线,在通用及安全相关的基准测试中实现了最先进的性能。

原作者: Paul Kassianik, Baturay Saglam, Huaibo Zhao, Blaine Nelson, Supriti Vijay, Aman Priyanshu, Amin Karbasi

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Paul Kassianik, Baturay Saglam, Huaibo Zhao, Blaine Nelson, Supriti Vijay, Aman Priyanshu, Amin Karbasi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一支机器人团队正在通力合作解决一个复杂的谜题。每台机器人都有特定的职责:一台负责寻找线索,另一台负责思考线索,第三台则负责写下最终答案。有时,整个团队会失败,但很难判断究竟是哪台机器人出了错。是第一台漏掉了线索?是第二台产生了困惑?还是第三台把答案写成了错误的格式?

这就是多步 LLM 流水线(复杂的 AI 任务链)面临的问题。传统的方法试图通过仅仅重写给“老板”机器人的指令(即提示词/Prompt)来修复整个团队。但如果问题在于团队缺少了一个步骤,或者机器人之间沟通的对象错了,那么仅仅修改指令是没用的。

于是有了 FAPO(全自动提示词优化)。你可以把 FAPO 想象成一个超级聪明的、自主的项目经理(由名为 Claude Code 的 AI 提供支持),它不仅仅是重写指令,它还会观察整个团队的工作过程,找到确切的瓶颈,并修复它。

以下是 FAPO 的工作原理,我们使用简单的类比来解释:

1. 侦探阶段(检查)

FAPO 不靠猜测,而是观察团队解决一个练习谜题的过程。它记录下每一个动作、每一条发现的线索以及每一个思考过程。如果团队得出了错误的答案,FAPO 就会像侦探一样进行分析:

  • “我们失败是因为没找到正确的线索吗?”(检索失败)
  • “我们找到了线索,但理解错了吗?”(推理失败)
  • “我们理解对了,但把答案写成了错误的格式吗?”(格式化失败)

2. “先尝试修复”原则(提示词编辑)

FAPO 遵循一条严格的规则:从小处着手。
如果侦探发现团队只是需要更清晰的指令,FAPO 就会重写提示词(即指令)。这就像告诉机器人:“嘿,去找红色的盒子,不要找蓝色的。”它首先尝试这种方法,因为这是最简单的修复方式。

3. “重新设计”阶段(结构性变更)

如果 FAPO 反复尝试重写指令,但团队仍然失败,原因是他们缺少一个关键步骤(比如需要第四台机器人来复核数学计算),那么 FAPO 就会获得权限去改变团队结构

  • 它可能会向团队中增加一台新机器人。
  • 它可能会改变机器人之间对话的顺序。
  • 它可能会增加一个“安全检查”步骤,强制要求团队在写下最终答案前遵循特定规则。

这是关键的区别:只有当 FAPO 证明仅仅通过改变措辞(提示词)已不足以解决问题时,它才会改变流水线的结构

4. 安全检查员(护栏)

在 FAPO 做出任何改动之前,一个“安全检查员”(另一个 AI 智能体)会检查该计划。这确保了 FAPO 不会意外删除重要规则、泄露隐私数据或破坏评分系统。这就像建筑检查员在装修计划开始前,先对方案进行审核一样。

结果:效果如何?

论文将 FAPO 与另一种名为 GEPA 的工具(它像是一个非常优秀的编辑,仅负责重写指令)进行了对比测试,涵盖了从数学问题到安全任务等六种不同类型的挑战。

  • 计分板: FAPO 在 18 次测试中赢得了 15 次
  • 重大优势: 在处理最困难的任务(如事实核查复杂故事或遵循严格的格式规则)时,FAPO 不仅仅是微调了指令;它意识到团队需要一个新的结构。在这种情况下,FAPO 的得分大幅提升(比竞争对手高出多达 33.8 个百分点)。
  • 安全任务: FAPO 也提高了 AI 模型识别安全漏洞的能力(例如将软件缺陷映射到其诱因),证明了它也能胜任严肃、高风险的工作。

唯一的例外

在一次数学竞赛(AIME)中,FAPO 没有获胜。作者认为这可能是因为数学题目过于困难,且样本量较小,导致 AI 产生了“困惑”或出现了“过拟合”现象(即过度拟合了练习题,而不是真正学好了数学)。

总结

FAPO 就像一位聪明的管理者,它不会仅仅对着工人喊“做得更好”。相反,它会观察工作流,诊断流程在哪里断裂,先修复指令,只有在失败的情况下,才会重新设计整个工作流,使团队更高效。它将一个混乱、失败的 AI 步骤链,变成了一台可靠、高性能的机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →