FlowBot: Inducing LLM Workflows with Bilevel Optimization and Textual Gradients
本文介绍了 FlowBot,这是一个数据驱动框架,通过将流程构建为双层优化问题并利用模块化文本梯度进行求解,自动诱导和优化大语言模型工作流,从而实现了与人工设计基线相媲美的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试训练一支由专业机器人组成的团队来解决一个非常棘手的谜题。过去,人类必须坐下来,为每一台机器人手动编写一份严格的指令手册,精确决定它们的工作顺序以及彼此交流时使用的具体措辞。这种方法既缓慢、昂贵,又难以扩展。
本文介绍了FLOWBOT,一种新方法,它让机器人能够自行学习如何组织彼此并进行交流,而无需人类事先编写手册。
以下是其工作原理,使用一个简单的类比:
两级教练系统
将 FLOWBOT 想象为一个拥有两级结构的教练系统:总教练和位置教练。
1. 总教练(外循环):“修正比赛策略”
总教练着眼于全局。他们不担心球员具体说了什么话,而是关注比赛的结构。
- 问题:也许团队试图通过先画图来解决数学问题,这是错误的顺序。或者他们完全遗漏了某个步骤,比如“核对分数”。
- 修正:总教练观察团队失败的地方,然后说:“好吧,我们需要在尝试画图之前增加一个核对分数的步骤”,或者“让我们完全移除画图步骤”。
- 在论文中:这就是外循环。它优化“工作流草图”。它决定有多少个步骤、它们发生的顺序,以及是否添加或移除工具(如搜索引擎)。
2. 位置教练(内循环):“完善战术手册”
一旦总教练制定了比赛策略,位置教练便与个别球员(具体的 LLM 调用)合作,完善他们的具体指令。
- 问题:球员知道要做什么(例如,“搜索事实”),但他们做得不好。也许他们在产生幻觉(编造内容),或者遗漏了关键细节。
- 修正:位置教练不只是说“做得更好”,而是使用一种名为文本梯度的特殊技巧。
- 假设最终答案是错误的。位置教练会询问一位 AI 裁判:“为什么会发生这种情况?”
- 裁判给出文本评论:“你犯了一个错误,因为你没有检查你的来源。”
- 这条评论被反向传递给前一位球员,该球员会说:“哦,我需要确保我的来源对下一个人来说是清晰的。”
- 这个过程一直回溯到第一位球员。
- 在论文中:这就是内循环。它使用“文本反向传播”。就像神经网络使用数学来调整数值一样,FLOWBOT 使用自然语言反馈来调整每一步的文本提示。
“文本梯度”的魔力
在传统计算机科学中,如果计算出错,计算机会使用数学来精确计算需要调整多少数值才能修正它。这被称为“反向传播”。
大型语言模型(LLMs)并不以同样的方式理解数学;它们理解的是语言。因此,FLOWBOT 发明了文本梯度。
- 系统得到的不是一个像
+0.5这样的数字,而是一句话,例如:“你的答案是错误的,因为你假设了 X,但证据显示 Y。下次请检查你的来源。” - 系统将这句话沿着机器人链条反向传递。每个机器人阅读反馈,理解在它们之后的步骤中出了什么问题,并改写自己的指令,以防止未来出现同样的错误。
他们发现了什么?
研究人员在多种不同任务上测试了 FLOWBOT,包括回答复杂的常识问题、编写代码以及遵循严格的指令。
- 从零开始即可运作:与其他需要人类提供良好起始方案的方法不同,FLOWBOT 可以从空白状态开始,自行找出最佳工作流。
- 超越竞争对手:它的表现与(甚至优于)那些人类花费大量时间手工打造完美工作流的系统相当。
- 节省成本:由于学习如此高效,与其他自动化方法相比,它需要更少的"API 调用”(这涉及费用)就能找到正确的解决方案。
核心结论
FLOWBOT 就像一条自我改进的装配线。它不仅微调机器上的指令,还重新排列机器本身。通过使用自然语言反馈来“反向传播”错误,它自动发现组织 AI 模型团队解决复杂问题的最佳方式,从而消除了人类成为每一个工作流架构师的必要性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。