FAPO: Fully Autonomous Prompt Optimization of Multi-Step LLM Pipelines
FAPO 是一个全自动框架,通过迭代地评估、诊断并优化提示词(prompt)和链式结构(chain structures),来优化多步 LLM 流水线,通过超越 GEPA 基准线,在通用及安全相关的基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一支机器人团队正在通力合作解决一个复杂的谜题。每台机器人都有特定的职责:一台负责寻找线索,另一台负责思考线索,第三台则负责写下最终答案。有时,整个团队会失败,但很难判断究竟是哪台机器人出了错。是第一台漏掉了线索?是第二台产生了困惑?还是第三台把答案写成了错误的格式?
这就是多步 LLM 流水线(复杂的 AI 任务链)面临的问题。传统的方法试图通过仅仅重写给“老板”机器人的指令(即提示词/Prompt)来修复整个团队。但如果问题在于团队缺少了一个步骤,或者机器人之间沟通的对象错了,那么仅仅修改指令是没用的。
于是有了 FAPO(全自动提示词优化)。你可以把 FAPO 想象成一个超级聪明的、自主的项目经理(由名为 Claude Code 的 AI 提供支持),它不仅仅是重写指令,它还会观察整个团队的工作过程,找到确切的瓶颈,并修复它。
以下是 FAPO 的工作原理,我们使用简单的类比来解释:
1. 侦探阶段(检查)
FAPO 不靠猜测,而是观察团队解决一个练习谜题的过程。它记录下每一个动作、每一条发现的线索以及每一个思考过程。如果团队得出了错误的答案,FAPO 就会像侦探一样进行分析:
- “我们失败是因为没找到正确的线索吗?”(检索失败)
- “我们找到了线索,但理解错了吗?”(推理失败)
- “我们理解对了,但把答案写成了错误的格式吗?”(格式化失败)
2. “先尝试修复”原则(提示词编辑)
FAPO 遵循一条严格的规则:从小处着手。
如果侦探发现团队只是需要更清晰的指令,FAPO 就会重写提示词(即指令)。这就像告诉机器人:“嘿,去找红色的盒子,不要找蓝色的。”它首先尝试这种方法,因为这是最简单的修复方式。
3. “重新设计”阶段(结构性变更)
如果 FAPO 反复尝试重写指令,但团队仍然失败,原因是他们缺少一个关键步骤(比如需要第四台机器人来复核数学计算),那么 FAPO 就会获得权限去改变团队结构。
- 它可能会向团队中增加一台新机器人。
- 它可能会改变机器人之间对话的顺序。
- 它可能会增加一个“安全检查”步骤,强制要求团队在写下最终答案前遵循特定规则。
这是关键的区别:只有当 FAPO 证明仅仅通过改变措辞(提示词)已不足以解决问题时,它才会改变流水线的结构。
4. 安全检查员(护栏)
在 FAPO 做出任何改动之前,一个“安全检查员”(另一个 AI 智能体)会检查该计划。这确保了 FAPO 不会意外删除重要规则、泄露隐私数据或破坏评分系统。这就像建筑检查员在装修计划开始前,先对方案进行审核一样。
结果:效果如何?
论文将 FAPO 与另一种名为 GEPA 的工具(它像是一个非常优秀的编辑,仅负责重写指令)进行了对比测试,涵盖了从数学问题到安全任务等六种不同类型的挑战。
- 计分板: FAPO 在 18 次测试中赢得了 15 次。
- 重大优势: 在处理最困难的任务(如事实核查复杂故事或遵循严格的格式规则)时,FAPO 不仅仅是微调了指令;它意识到团队需要一个新的结构。在这种情况下,FAPO 的得分大幅提升(比竞争对手高出多达 33.8 个百分点)。
- 安全任务: FAPO 也提高了 AI 模型识别安全漏洞的能力(例如将软件缺陷映射到其诱因),证明了它也能胜任严肃、高风险的工作。
唯一的例外
在一次数学竞赛(AIME)中,FAPO 没有获胜。作者认为这可能是因为数学题目过于困难,且样本量较小,导致 AI 产生了“困惑”或出现了“过拟合”现象(即过度拟合了练习题,而不是真正学好了数学)。
总结
FAPO 就像一位聪明的管理者,它不会仅仅对着工人喊“做得更好”。相反,它会观察工作流,诊断流程在哪里断裂,先修复指令,只有在失败的情况下,才会重新设计整个工作流,使团队更高效。它将一个混乱、失败的 AI 步骤链,变成了一台可靠、高性能的机器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。