← 最新论文
🤖 machine learning

BAGEN: Are LLM Agents Budget-Aware?

该论文引入了 BAGEN,这是一个将预算感知定义为渐进式区间估计的框架,并证明了尽管前沿 LLM 智能体在准确预测或警示预算超支方面始终表现不佳,但通过监督微调和强化学习,它们进行可操作性早期停止的能力可以得到显著提升。

原作者: Yuxiang Lin, Zihan Wang, Mengyang Liu, Yuxuan Shan, Longju Bai, Junyao Zhang, Xing Jin, Boshan Chen, Jinyan Su, Xingyao Wang, Jiaxin Pei, Manling Li

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxiang Lin, Zihan Wang, Mengyang Liu, Yuxuan Shan, Longju Bai, Junyao Zhang, Xing Jin, Boshan Chen, Jinyan Su, Xingyao Wang, Jiaxin Pei, Manling Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在派遣一个机器人执行一项漫长且复杂的任务,就像一名需要穿梭于城市、取件并送货的快递员。你给机器人一个预算:也许是 1,000 个“能量点”(token),或者是一笔特定的真实资金。

目前存在的一个重大问题是,现在的智能机器人(AI Agent)在工作时非常不擅长了解自己还剩多少预算。它们通常只有在任务已经彻底失败后,才会意识到自己没钱了。

以下是这篇论文的内容拆解,通过简单的类比进行说明:

1. 核心问题:“盲目”的机器人

现在,如果你问一个机器人:“这次行程要花多少钱?”它通常只会在一开始猜一次。

  • 缺陷: 这就像一名徒步旅行者在还没开始走之前,就去猜还要走多少英里。他们没有考虑到可能会迷路、遇到恶劣天气或走错路。
  • 现实情况: 论文发现,即使是最聪明的机器人也是过度乐观的。它们会想:“我肯定能用剩下的钱完成这项任务!”即便实际上它们正在耗尽燃料。它们会不断把钱花在那些已经无法完成的任务上,仅仅是为了继续尝试。

2. 新的想法:具备“预算意识”的智能体 (BAGEN)

作者提出了一种新型机器人,它的行为就像一个聪明的项目经理。它不会只在开始时猜一次,而是每走一步都会检查自己的钱包。

  • 渐进式区间估计 (Progressive Interval Estimation): 机器人不再说“我大概还需要 500 点”,而是说“我可能还需要 400 到 600 点之间,但如果我很快找不到答案,我可能不得不停止”。
  • “不可能”按钮: 如果机器人意识到自己陷入了一个无法脱身的困境,它应该按下那个写着**“不可能 (IMPOSSIBLE)”**的大红按钮并立即停止,而不是浪费最后几块钱试图继续挖掘下去。

3. 研究发现(“成绩单”)

研究人员在四种不同类型的任务(如解谜、网页搜索和仓库管理)中测试了五款世界上最聪明的 AI 模型。以下是他们的发现:

  • 聪明 \neq 有预算意识: 仅仅因为一个机器人擅长解决谜题,并不意味着它擅长计算成本。事实上,两者的相关性很弱。最好的解谜高手往往是最不擅长估算成本的。
  • “乐观偏差”: 测试中的每一个机器人都过于乐观。它们一致地低估了自己将需要多少钱。机器人在处理任务的能力越弱,对预算的乐观程度反而越高。
  • 为时已晚: 机器人通常只有在已经消耗了 80% 的预算后,才会意识到自己即将失败。等到它们说出“噢不,我们完蛋了”的时候,已经太晚了,无法止损。
  • 可以被训练: 好消息是,这种技能是可以训练的。通过教导机器人(使用一种称为 SFT + RL 的方法),它们学会了更早地停止。
    • 结果: 如果你告诉机器人,一旦它说出“不可能”就立即停止,那么在失败的尝试中,你可以节省 28% 到 64% 的浪费资金,而成功的任务数量仅有极微小的下降。

4. 两种类型的“预算”

论文研究了两种支出类型:

  1. 内部预算(大脑的燃料): 这是 AI 用来思考和对话所消耗的计算能力和“token”。
  2. 外部预算(现实世界的成本): 这是 AI 在采取行动时消耗的实际金钱、时间或物理资源(如仓库空间)。
    机器人在这两者方面都遇到了困难,但“过度乐观”的问题在两者中都是一样的。

5. 总结

论文得出结论:预算意识是一项独立的技能,与智力水平无关。目前的 AI Agent 就像是那些即便油箱已空仍坚持向目的地驶去的司机,寄希望于能奇迹般地找到加油站。

解决方案不一定是要让 AI 变得更“聪明”去完成任务,而是要训练它成为一个更好的会计师。如果我们教会这些智能体在更早的时候说出“我做不到”,我们就能在几乎不损失成功率的前提下,节省大量的资源。

简而言之: 我们不应只要求 AI Agent “完成工作”,而应开始教它们在工作时时刻盯着自己的钱包。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →