← 最新论文
🤖 AI

Do Enterprise Systems Need Learned World Models? The Importance of Context to Infer Dynamics

本文主张,在可配置的企业系统中,智能体应优先在运行时发现活跃的业务逻辑,而非仅仅依赖脆弱且离线训练的世界模型,并通过新推出的 CascadeBench 基准测试证明,该方法能显著提升对部署偏移的鲁棒性。

原作者: Jishnu Sethumadhavan Nair, Patrice Bechard, Rishabh Maheshwary, Surajit Dasgupta, Sravan Ramachandran, Aakash Bhagat, Shruthan Radhakrishna, Pulkit Pattnaik, Johan Obando-Ceron, Shiva Krishna Reddy Ma
发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Jishnu Sethumadhavan Nair, Patrice Bechard, Rishabh Maheshwary, Surajit Dasgupta, Sravan Ramachandran, Aakash Bhagat, Shruthan Radhakrishna, Pulkit Pattnaik, Johan Obando-Ceron, Shiva Krishna Reddy Malay, Sagar Davasam, Seganrasan Subramanian, Vipul Mittal, Sridhar Krishna Nemala, Christopher Pal, Srinivas Sunkara, Sai Rajeswar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对该论文的解读。

核心问题:我们需要死记硬背规则吗?

想象你是一家庞大而复杂的办公楼(企业系统)的新员工。每当你做某件事——比如提交报告或批准请求——都会自动触发不同的后续动作。也许会发送一条通知、更新预算,或者向经理发出警报。

在普通办公室里,这些规则是固定的。但在这种特定类型的企业系统中,每个分公司都有一套独特的规则

  • 纽约分公司可能在文件保存时发送电子邮件。
  • 伦敦分公司可能只是将其记录在电子表格中。
  • 东京分公司可能会触发会议邀请。

此外,经理们可以随时更改这些规则。今天,保存文件会发送电子邮件;明天,他们可能会将其改为发送短信。

这篇论文提出了一个简单的问题:为了预测接下来会发生什么,人工智能(AI)代理需要事先“死记硬背”(学习)所有这些规则,还是可以在需要时直接查阅它们?

两种方法

研究人员测试了 AI 处理这种情况的两种不同方式:

1. “死记硬背者”(学习的世界模型)

这就像一名学生,试图在开始工作前背诵公司每个分公司的每一本规则手册。他们试图将逻辑内化到脑海中。

  • 工作原理: AI 基于历史数据(过去的行动和结果)进行训练,以构建系统如何运作的心理模型。
  • 问题所在: 如果公司更改了规则(即“部署变更”),这名学生的脑海中仍固守着旧规则。他们可能会预测会发送邮件,但新规则规定发送短信。由于他们依赖记忆,因此会出错。当情况发生变化时,他们是“脆弱的”(容易崩溃)。

2. “侦探”(企业发现代理)

这就像一名新员工,不试图死记硬背规则手册,而是随身携带一部手机。

  • 工作原理: 当员工需要知道提交报告会发生什么时,他们不会基于记忆进行猜测。他们会立即致电办公室经理,或查看屏幕上的当前数字规则手册,以确切了解当前规则的规定。
  • 优势: 即使规则明天发生变化,侦探只需查阅新的规则手册。他们是“稳健的”,因为他们立足于当下的现实,而非过去的记忆。

实验:"CascadeBench"

为了测试这一点,研究人员建立了一个名为CascadeBench的游乐场。

  • 设置: 他们创建了数千个具有不同复杂规则的虚拟办公场景。有些规则很简单(例如“如果 X,则 Y")。有些则是复杂的链条(例如“如果 X,则 Y,进而触发 Z,Z 再触发会议”)。
  • 测试: 他们要求不同的 AI 预测某个行动的结果。
    • 有些 AI 必须依赖其训练(死记硬背者)。
    • 有些 AI 被允许实时查阅规则(侦探)。
    • 有些 AI 被直接提供了规则手册(“神谕”)。

他们的发现

结果清晰且令人惊讶:

  1. 死记硬背者在家表现好,出门表现差: 当在完全相同的规则上进行测试时,“死记硬背者”AI 表现非常出色。但一旦规则发生轻微变化(新分公司、新配置),它们的性能就会崩溃。它们无法适应。
  2. 侦探获胜: “发现代理”(实时查阅规则的那个)在规则发生变化时表现要好得多。尽管它们没有“熟记”规则,但它们知道如何立即找到规则。
  3. “神谕”的局限: 当 AI 直接获得规则手册(无需搜索)时,它们的表现最好。这证明了信息是存在的;问题仅仅在于“死记硬背者”在上下文发生变化时无法获取正确的信息。

三个难度等级

研究人员还发现,有些任务比其他任务更容易:

  • 等级 1(基础): 基于数据库结构的简单规则(例如“如果你创建用户,他们将获得默认 ID")。即使是“死记硬背者”也能猜得不错,因为这些都是标准的。
  • 等级 2(链条): 复杂的规则链条(例如“如果你更改优先级,它会触发工作流,进而触发通知”)。在这里,“死记硬背者”惨败。“侦探”成功了,因为它们能在当前的规则手册中追踪链条。
  • 等级 3(隐藏内容): 有时,结果取决于计算机的内部时序或未写在规则手册中的隐藏引擎行为。即使是“侦探”在这里也感到吃力,因为答案 literally 不在它们能阅读的书中。

结论

该论文得出结论,对于企业系统而言,你不应该仅仅依赖一个“死记硬背”了世界的 AI。

由于业务规则不断变化且针对每个客户具体定制,最佳策略是混合策略:

  • 不要仅仅基于过去的数据训练 AI。
  • 赋予 AI 在需要做出决策时查阅当前规则的能力。

这就像开车一样。“死记硬背者”试图记住路线上的每个红绿灯和停车标志。如果施工队移动了标志,他们就会撞车。“发现代理”实时查看路标。如果标志移动了,它们能看到并立即调整。

简而言之: 在一个规则经常变化的世界里,做一个能阅读路标的侦探,比做一个试图死记硬背所有路标的学生要好得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →