Toward Reliable Design of LLM-Enabled Agentic Workflows: Optimizing Latency-Reliability-Cost Tradeoffs
本文通过引入性能模型并推导最优设计策略(包括一种注水式令牌分配策略),在给定约束下最大化可靠性,从而分析了大语言模型赋能的智能体工作流中延迟、可靠性与成本之间的基本权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是高风险接力赛队的经理。你的团队并非由跑步运动员组成,而是由AI 智能体构成。其中一些智能体是“深思者”(大型语言模型或 LLM),能够进行推理和写作;而另一些则是“专用工具”(如计算器或数据库搜索器),负责执行特定且快速的任务。
你的目标是让团队尽可能可靠地完成比赛(即每次都能得出正确答案),但你面临两个严格的限制:
- 时间:比赛必须在某个截止日期前结束。
- 资金:你用于“燃料”(计算成本)的预算有限。
本文是一份指南,教你如何在“深思者”智能体之间分配燃料和时间,以便在不破产或不过于缓慢的情况下赢得比赛。
智能体的两种“燃料”类型
当一个智能 AI 智能体(LLM)工作时,它会做两件既消耗金钱又消耗时间的事情:
- 思考(推理 Token):在开口说话之前,它会进行内部“思考”。思考得越深入,它提出的解决方案就越好。
- 表达(输出 Token):思考之后,它会写出答案。答案越长,就越清晰、越详细,这也有助于提高可靠性。
本文指出,你不能只是告诉每个智能体“尽可能努力思考并写出一部小说”。你必须讲究策略。
权衡:收益递减曲线
作者发现了一条关于 AI 智能体如何变得更优秀的规则:你支付给它们的越多,它们就变得越好,但其提升的速率会逐渐放缓。
- 类比:想象一下为考试复习。复习的第一小时会让你的成绩获得巨大的提升。第二小时的帮助会稍微少一些。到了第十小时,可能只会增加微不足道的几分。
- 在本文的数学模型中,这被称为“参数化指数可靠性函数”。用通俗的话来说:如果你给一个智能体一点点额外的时间或金钱,它会变得聪明得多。但如果你持续不断地给予更多,它最终会达到一个上限,此时额外的努力几乎无济于事。
问题:如何分配预算?
你拥有一个总的"Token 预算”(即团队可以思考和书写的总字数限制)。你的团队中有 5 个不同的智能体。有些智能体天生非常高效(它们用很少的字数就能迅速变聪明),而另一些则是“慢学习者”(它们需要大量的字数才能达到相同的质量水平)。
旧方法(启发式方法):
大多数人只是平均分配预算。“给,智能体 A 获得 1,000 个字,智能体 B 获得 1,000 个字。”
- 结果:高效的智能体浪费了它们多余的字数(因为它们已经完美了),而慢速的智能体则没有获得足够的字数来很好地完成工作。
本文的解决方案:“注水”策略
作者提出了一种巧妙的方法,称为注水(Water-Filling)。
- 类比:想象你有一个底部有深浅不一的洞的桶(代表你不同的智能体)。你将水(你的 Token 预算)倒入桶中。
- 水会自然地先填满最深的洞(即那些最需要帮助的智能体)。
- 无论洞有多宽,水位都会上升,直到整个桶的水位高度一致。
- 结果:你会给那些“更难满足”的智能体(即效率较低的那些)分配更多的 Token,而给那些已经非常优秀的智能体分配更少的 Token。当桶满了(即你的预算耗尽)时,你就停止注水。
这确保了对于你花在每个智能体上的最后一个 Token,它们都能贡献完全相同的“额外可靠性”。你既不会在已经完美的智能体上浪费金钱,也不会抛弃那些正在挣扎的智能体。
“影子价格”(Token 的价值)
本文引入了一个称为影子价格的概念。你可以将其视为你在这场特定比赛中单个 Token 的“市场价值”。
- 如果你的时间或资金非常紧张,Token 的“价格”就会上涨。
- 数学计算会自动得出这个价格。它会告诉你,每多花一元钱或一秒钟,你能获得多少“可靠性”。
- 目标是确保你资助的每个智能体,其“性价比”(每 Token 获得的可靠性)完全相同。
核心结论
本文证明,如果你希望你的 AI 团队在既不破产也不超时的情况下尽可能可靠,就不应该一视同仁地对待每个人。
相反,你应该使用一个数学公式(注水规则)来识别哪些智能体最需要帮助,并优先将资源投入其中。这种“智能分配”能保证你的整个工作流程比仅仅平均分配资源或猜测如何花钱更加可靠。
简而言之:不要给每个人相同数量的钱。给那些 struggling 的团队成员刚好足够的资源以赶上进度,让明星表现者保持节奏,这样整个团队就能一起冲过终点线。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。