Not All Tokens Are Equal: Inflation-Aware Routing for Agentic LLM Systems
本文介绍了 InflationAgent,一种新颖的路由框架,它通过利用思维链分支熵(CoT Branching Entropy)预测工作流层级的成本,并利用语义交换率(Semantic Exchange Rate)优化模型选择,从而解决了智能体化大语言模型(LLM)系统中存在的“Token 通胀”差距,实现了比 FrugalGPT 等现有方法更高的准确率和更少的 Token 使用量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在为一支机器人舰队经营着一家快递服务公司。有些机器人很小巧、速度快且运行成本低,但它们有时会变得糊涂并掉落包裹。另一些机器人则巨大、超级聪明且昂贵,但它们几乎从不出错。在人工智能的世界里,这些机器人就是“大语言模型”(LLMs)。它们是聊天机器人和编程助手的“大脑”。通常,当我们提出问题时,我们只是把它发送给一个机器人并等待答案。但在现实世界中,情况会变得很混乱。如果那个小机器人搞错了,智能系统不会直接放弃;它会要求机器人再试一次。它甚至可能要求那个巨大的机器人介入。这被称为“智能体系统”(agentic system)——即一组协同工作以解决问题的 AI 智能体。
问题在于,我们一直以来计算这些递送成本的方式都错了。我们一直在支付单次行程的价格,却忘记了如果机器人撞车了必须返回仓库重新尝试,我们支付的是整个往返行程的费用,而不仅仅是单程票。这篇论文是关于一种新的管理这些 AI 团队的方法,这样我们就不会因为派出了一个需要多次重试才能完成任务的错误机器人,而不小心烧光我们的预算。
“再试一次”的隐藏成本
想象一下你在嘉年华的一个游戏摊位前。你有一定数量的代币(有限的钱)可以玩。你可以选择一台每次尝试只需 1 美元的廉价、破旧的机器,或者一台每次尝试需 10 美元的高科技豪华机器。
旧的思维方式很简单:“便宜的机器只要 1 美元,所以我选那个!”但问题在于:这台便宜的机器很棘手。如果问它一个难题,它可能会出错。因此,你必须再次支付 1 美元来尝试第二次。第三次。第四次。到你终于得到正确答案时,你已经在便宜的机器上花了 5 美元。与此同时,那台豪华机器第一次就能搞定,只需 10 美元。
这篇论文将这种隐藏的额外成本称为**“Token 通胀”(Token Inflation)**。它是你以为支付的价格(一次尝试)与你实际支付的价格(五次尝试)之间的差距。作者发现,对于困难的任务,这种通胀是非常巨大的。一个小型的、便宜的模型最终的成本可能是预期值的 4.25 倍,因为它不断失败并需要重试。
新策略:“通胀智能体”(InflationAgent)
研究人员构建了一个名为 InflationAgent 的新系统来解决这个问题。该系统不再仅仅关注单次尝试的价格标签,而是像一位精明的嘉年华经理,准确知道哪些机器容易出故障。
以下是它的工作步骤:
1. “直觉检查”(CoT 分支熵)
在系统向机器人提问之前,它会先进行一个快速、免费的测试。它会让一个小型的本地机器人对问题进行三次不同的思考过程。
- 如果机器人三次给出的答案都一样,系统就知道这个问题很简单。
- 如果机器人给出了三个完全不同、混乱的答案,系统就知道问题很难,且机器人很可能会陷入重试的死循环。
作者将这种测量称为 CoT 分支熵(CoT Branching Entropy)。这就像是在你出发旅行之前,先检查汽车引擎是否在剧烈抖动。这不会产生额外费用,因为它是在本地计算机上进行的,而不是在昂贵的云端服务器上。
2. “价格标签”计算器
利用这个“直觉检查”,系统可以预测“通胀”会有多少。它不只是瞎猜;它使用了一个基于过往数据训练的小型智能计算器(机器学习模型)。它会预测:“如果我们把这个难题发给小型机器人,它可能会失败 3 次,所以实际成本是价格的 3 倍。”
3. “最优交易”选择器
现在,系统会计算 语义交换率(Semantic Exchange Rate, SER)。这是一种高级的问法,即:“我每实际花费一美元,能获得多少准确度?”
- 如果小型机器人很便宜但会失败 4 次,那么它的“交易”就很糟糕。
- 如果大型机器人很贵但能一次成功,那么它的“交易”实际上可能更好。
系统会选择那个能提供最佳价值的机器人,而不仅仅是看最低的标价。
4. “重新开始”规则
这是最重要的技巧。如果系统向一个机器人发送了问题,而它失败了,随后系统决定升级到更大的、更聪明的机器人,它会丢弃之前的失败尝试。
研究人员发现了一些令人惊讶的事实:如果你把小型机器人失败时的那些混乱、困惑的笔记展示给大机器人看,大机器人也会变得困惑!这就像是把一个挣扎中的学生的涂鸦页面展示给一个天才学生看;天才可能会开始怀疑自己。
通过给大机器人一个全新的提示词(Fresh Prompt/干净的起点),系统保持了高准确度。如果他们只是把失败的笔记传递下去,在大难题上,大机器人的准确度会下降 34.8 个百分点。
他们的发现
团队在数学题(GSM8K)和棘手的百科知识问题(HotpotQA)上进行了测试。结果如下:
- 通胀是真实存在的: 在困难的百科问题上,小型模型(Qwen2.5-7B)的通胀率为 4.25×。这意味着,对于你认为要花的每一美元,你实际上花了 4.25 美元,因为机器人一直在失败。
- 用更少的钱获得更好的结果: 当他们设定一个固定预算(严格限制可消耗的 Token 数量)时,他们的系统(InflationAgent)得到了 94.7% 的正确答案。而旧的流行方法(FrugalGPT)仅达到了 91.0%。
- 节省 Token: 为了达到旧方法所实现的 91.0% 的准确度,新系统使用了 31% 更少的 Token。这是一个巨大的节省。
- “更多重试”的危险: 他们发现,仅仅给小型机器人更多尝试的机会(最多 10 次)并不能永远奏效。在某个临界点之后,机器人会被自己过去的失败所困扰,其准确度反而会下降。有时候,与其对着墙壁猛撞,不如换一个更聪明的机器人。
核心结论
这篇论文表明,在 AI 世界中,“便宜”并不总是真的便宜。如果一个模型很可能失败并需要反复尝试,它就会变得既昂贵又低效。通过衡量一个模型陷入困境的可能性(使用“直觉检查”熵)并在切换到更聪明的模型时从头开始,我们可以节省资金并获得更好的答案。
作者基于他们在特定数学和百科数据集上的测试,对这些结果充满信心。他们指出,虽然这在推理任务中效果极佳,但我们仍需研究如何将其应用于更开放式的对话或工具。但就目前而言,他们已经证明,一点点聪明的规划对于防止 AI 预算失控控制有着长远的影响。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。