← 最新论文
🤖 AI

World of Workflows: A Benchmark for Bringing World Models to Enterprise Systems

本文介绍了 World of Workflows (WoW),这是一个基于 ServiceNow 构建的真实企业级基准测试,旨在通过评估智能体在复杂、不可见工作流环境下的动态建模能力,揭示当前大模型在处理具有连锁反应的企业系统时存在的“动态盲区”问题。

原作者: Lakshya Gupta, Litao Li, Yizhe Liu, Sriram Ganapathi Subramanian, Kaheer Suleman, Zichen Zhang, Haoye Lu, Sumit Pasupalak

发布于 2026-02-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Lakshya Gupta, Litao Li, Yizhe Liu, Sriram Ganapathi Subramanian, Kaheer Suleman, Zichen Zhang, Haoye Lu, Sumit Pasupalak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一个名为 "World of Workflows" (WoW) 的研究项目。如果用大白话来解释,它其实是在测试:当人工智能(AI)进入复杂的“职场”时,它到底是一个只会机械执行命令的“笨实习生”,还是一个能看透公司潜规则、懂得预判后果的“老员工”?

为了让你更好理解,我们可以把这个研究比作一场**“职场生存大挑战”**。

1. 背景:AI 现在的状态——“只会听指令的机械手”

现在的 AI(比如 ChatGPT)在日常生活中很聪明,你让它写诗、写代码,它都能干得不错。但在大型企业里,情况完全不同。

打个比方:
现在的 AI 就像一个刚入职、完全不懂公司规矩的实习生。你跟他说:“小王,把这台电脑分给张三。”他会立刻去操作,动作很快,甚至连表格都填好了。但他不知道,公司里有一条**“隐形潜规则”**:“如果一个员工手里的设备超过3件,他的权限会自动降级。”

结果,小王分完电脑后,张三的权限突然没了,导致后续所有工作都瘫痪了。小王还一脸无辜地看着你:“老板,我按你说的做了啊,没报错呀!”

这就是论文里说的:AI 缺乏“世界模型”(World Model)。它只看到了眼前的动作,却看不见动作背后引发的“蝴蝶效应”。


2. 核心挑战:看不见的“蝴蝶效应”

论文提出了企业系统里的三个“大坑”,这也是为什么 AI 会翻车:

  • 隐形的“潜规则”(Hidden Workflows): 就像公司里那些不写在员工手册里、但一旦触发就会自动运行的流程。你动了一下 A,系统悄悄地在后台把 B、C、D 全改了。
  • 巨大的“信息迷雾”(Limited Observability): 就像你在一个巨大的仓库里干活,你只能看到手里的零件,却看不见整个仓库的货架是怎么摆放的。AI 只能看到“操作成功”的提示,却看不到后台数据库里发生的剧变。
  • 复杂的“连环套”(Cascading Effects): 一个动作引发一个变化,这个变化又触发了另一个规则,最后导致整个系统违规。

3. 论文的贡献:WoW 实验室与“模拟考”

为了测试 AI 到底有多笨,研究人员专门搭建了一个极其真实的**“模拟职场”**(基于 ServiceNow 系统)。

  • WoW 环境: 这是一个拥有 4000 多条规则、55 个复杂工作流的“虚拟公司”。在这里,AI 必须处理资产管理、员工权限、故障报修等各种琐事。
  • WoW-bench(模拟考卷): 研究人员设计了 234 道考题,不只是考 AI “能不能把事办成”,更重要的是考它:
    • 预判能力: “如果你做了这个动作,后台会发生什么变化?”
    • 合规能力: “这个动作会不会违反公司的隐形规定?”
    • 逻辑推理: “为什么这个任务突然失败了?”

4. 实验结果:AI 的“职场危机”

研究人员把目前最顶尖的 AI(比如 GPT 系列、Gemini 等)都拉来考试,结果让人大跌眼镜:

  1. “盲目执行”: AI 的任务成功率看起来还可以,但一旦涉及到“不能违反公司规定”的要求,成功率几乎直接跌到零。它们就像那种只会埋头干活、完全不顾后果的“愣头青”。
  2. “看不见变化”: 当 AI 试图预测“我做了这件事后,数据库会变样吗”时,准确率极低。它们对系统的“物理规律”完全没有概念。
  3. “分不清身份”: AI 经常把“张三”这个名字和“张三的工号”搞混,这在严谨的企业系统里是致命的错误。

5. 总结与未来:我们要什么样的 AI?

这篇论文告诉我们:仅仅让 AI “会说话”、“会用工具”是不够的。

如果我们要让 AI 真正进入企业工作,不能只把它当成一个“聊天机器人”,而要把它培养成一个**“拥有大脑模拟器的专家”**。

未来的 AI 应该具备这种能力:
在按下“确认”键之前,它的大脑里应该先进行一次**“虚拟演习”**——“如果我执行了这个操作,根据公司的潜规则,张三的权限会降级,这会导致后面的任务失败,所以我现在不能这么做,我应该换一种方式。”

一句话总结:这篇论文是在呼吁,我们要让 AI 从“只会按按钮的机器”,进化成“懂得看全局、懂规矩的职场精英”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →