← 最新论文
🤖 AI

STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle

本文介绍了 STOCKTAKE,这是一个为期 26 周的供应链基准测试,其特点是采用了一个将状态估计与控制决策分离的公平预言机(fair oracle),研究揭示了尽管先进的 LLM 智能体能够准确诊断隐藏故障,但它们往往无法将这些知识转化为有效的决策,从而导致性能差距,使得某些模型即便具备更好的检测能力,其表现甚至还不如一个对症状无感的基准模型。

原作者: Sagar Deb, Ashwanth Krishnan

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Sagar Deb, Ashwanth Krishnan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位在迷雾缭绕的群岛中航行的船长。你手中的地图并不完整;你无法直接看到隐藏的暗礁或变化的洋流。相反,你只能通过撞击船体的波浪、水的颜色以及风的声音来感知。为了安全航行,你必须根据这些线索来推测水面下的情况。这就是 AI 智能体(AI agents) 在试图进行长期决策时的世界。在这个领域,科学家们正在测试人工智能在多大程度上能像人类船长一样,从嘈于噪声的症状中推断出隐藏的危险,并做出能节省资金或防止灾难的决策。

研究人员提出的核心问题是:当一个 AI 失败时,是因为它没看清线索,还是因为它完美理解了线索却做出了一个糟糕的选择? 这被称为“知行差距”(knowing-doing gap)。这就像一个学生知道数学题的答案,但在写下数字时却因为惊慌而写错了。长期以来,很难区分这两者,因为“正确”的答案通常需要看到 AI 不被允许看到的隐藏暗礁。如果 AI 失败了,我们不知道它是“盲目”还是仅仅“笨拙”。


供应链大盘点

在这篇论文中,研究人员构建了一个名为 STOCKTAKE 的数字游乐场来解开这个谜团。他们创建了一个为期 26 周的模拟环境,其中 AI 扮演一名电子产品进口商的经理。经理的任务是决定每周订购多少件电子产品。问题在于,这个世界充满了隐藏的麻烦制造者:供应商可能正在倒闭,航道可能被封锁,或者需求可能突然激增。AI 看不到这些问题本身,它只能看到每周的仪表盘,上面显示着嘈杂且令人困惑的症状(例如“泊位等待时间过长”或“运费报价上升”)。

为了弄清楚 AI 是“盲目”还是仅仅“笨拙”,研究人员发明了一个 公平预言机(Fair Oracle)。把它想象成一个坐在 AI 旁边的超级聪明、逻辑完美的机器人。这个机器人看到的与 AI 完全相同的混乱仪表盘。它同样无法窥视那些隐藏的麻烦制造者。然而,这个机器人是一个数学天才:它利用完美的概率规则(贝叶斯滤波器)来猜测正在发生的事情,并根据这些猜测计算出绝对最佳的订单量。

通过将 AI 的表现与这个公平预言机进行比较,研究人员可以分别测量两件事:

  1. 感知(Perception): AI 是否正确猜中了出了什么问题?(它是否指出了隐藏的问题?)
  2. 行动(Action): 在猜中问题后,AI 是否采取了正确的步骤?(它是否订购了正确的数量?)

他们使用四种目前最顶尖的 AI 模型(Claude Sonnet 5, GPT-5.4, DeepSeek-V4-Pro, 和 Grok 4.5)进行了实验,涵盖了 50 个不同的“种子”(即隐藏世界的不同版本)。

他们的发现: “知行差距” 是真实存在的

结果令人惊讶,甚至带有一点幽默感。

1. AI 的视力没问题
首先,研究人员检查了 AI 是否能发现隐藏的问题。答案是肯定的。这四个模型在“观察”方面表现出色。它们在 84% 到 88% 的案例中正确识别了隐藏的压力(如港口堵塞或供应商失效)。更棒的是,它们通常能在问题开始后的第一周内就察觉到。事实上,那些最终财务表现最差的模型,反而是识别问题速度最快的。因此,失败的原因并不是 AI “瞎了”。

2. AI 有时无法行动
故事在这里变得有趣了。尽管 AI 知道出了什么问题,但它经常做出错误的举动。

  • “反应不足者”: 一些模型(如 Claude Sonnet 5)会正确诊断问题,但随后会陷入僵局。例如,如果它们看到港口被封锁,它们会完全停止订货,认为现有库存足够。但由于港口封锁,它们的货物从未到达,导致库存耗尽,造成亏损。它们知道问题所在,但行动过于谨慎。
  • “反应过度者”: 其他模型(如 DeepSeek-V4-ProGrok 4.5)则恰恰相反。它们会发现问题并陷入恐慌,订购大量昂贵的空运货物或锁定高价。它们知道问题,但反应过度到了极点,导致花费了远超必要的资金。事实上,在大约一半的测试运行中,这些模型的表现如此糟糕,以至于一个忽略所有症状的简单规则反而能省更多钱。它们的“技能得分”实际上是负数(具体为 -0.23 和 -0.13),这意味着它们的表现低于“对症状视而不见”的基准策略。

3. “知行差距” 是瓶颈
研究发现,一个优秀的 AI 与一个顶尖 AI 之间的差距不在于智能或对世界的观察清晰度,而在于控制力

  • 在“持续性”压力场景下(即问题持续数周的情况),即使 AI 正确诊断了问题,仍有 34% 到 43% 的情况下会出现缺货。
  • 研究人员计算了一个“技能得分”来衡量 AI 与完美的公平预言机之间的差距。两个模型(DeepSeek 和 Grok)得分是负数,意味着它们的表现比一个忽略所有症状的简单规则还要差。然而,这些模型在书面解释中却是最快指出隐藏问题的。

总结

论文的结论是,对于目前的 AI 智能体来说,问题不在于它们无法理解世界上正在发生什么。它们擅长演绎。问题在于将正确的想法转化为正确的行动极其困难。

AI 可能会写出一段完美的文字来解释:“运河关闭了,我们需要增加订货量”,但随后它可能会订货太少、太晚,或者支付过高的解决方案成本。这种“知行差距”是真实存在的:这些模型可以持有正确的信念,却无法有效地将其转化为行动。研究人员指出,解决这个问题不仅需要更聪明的、观察力更强的 AI,还需要更好的方法来教导 AI 如何将其知识转化为正确的、有代价的行动。

简而言之:AI 并没有瞎,它只是手脚不够灵活。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →