← 最新论文
🤖 AI

DynaSchedBench: Calibrated Dynamic Scheduling Benchmarks and Observability Paradox in LLM-based Scheduling Agents

本文介绍了 DynaSchedBench,这是一个用于动态柔性作业车间调度的校准基准框架,它利用序列事件空间校准器生成严格受控的实例,揭示了一种“可观测性悖论”,即完全的信息访问和工具增强往往会降低基于大语言模型智能体的性能,导致其表现不及强大的调度基线。

原作者: Shijie Cao, Yuan Yuan, Jing Liu

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Shijie Cao, Yuan Yuan, Jing Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何管理一个繁忙的工厂车间,那里机器会故障,新订单随机到达,且截止日期不断变动。这被称为动态柔性作业车间调度

该论文指出,我们一直试图用错误的“模拟测试”来训练这些机器人。以下是他们新方法的分解及其发现,使用了简单的类比。

1. 问题:糟糕的模拟测试

目前,研究人员在两种类型的问题上测试调度人工智能:

  • 静态基准测试:这就像给学生一份固定的 50 道数学题清单。学生可能只是死记硬背这 50 道特定题目的答案,而不是学习如何做数学题。当他们面对新问题时,就会失败。
  • 随机生成器:其他人试图创建无限的随机问题。但这就像掷骰子来生成测试。有时运气好,骰子掷出了“超级简单”的测试,人工智能看起来就很聪明。有时,它掷出了“超级难”的测试,人工智能看起来就很笨。你无法判断人工智能是真的厉害,还是仅仅运气好/运气差。

结果:我们不知道人工智能是真的聪明,还是仅仅在死记硬背测试题,或者只是掷骰子运气好。

2. 解决方案:DynaSchedBench(“校准健身房”)

作者们建立了一个名为DynaSchedBench的新框架。将其想象为一个调度机器人的智能健身房

他们不再只是掷骰子,而是使用一种名为**序列事件空间校准器(SESC)**的特殊工具。

  • 工作原理:想象你想在具有特定风阻的跑道上测试跑步者的速度。与其指望风恰好吹得合适,不如使用这个工具调整风洞机器,直到阻力完全符合你的要求。
  • “压力指数”(SSI):他们创建了一个“难度分数”(就像视频游戏的关卡)。现在,他们可以生成一个保证比“第 4 级”问题更难、但比“第 6 级”问题更容易的“第 5 级”问题。这消除了运气因素。

3. 重大发现:“可观测性悖论”

研究人员测试了大语言模型(LLMs)——也就是那种写文章和与你聊天的同类型人工智能——看看它们能否充当工厂经理。他们给了人工智能三种不同的方式来“观察”工厂:

  • 第 1 级(局部视角):“这是你面前的机器。它是空闲的。你想使用它吗?”(简单事实)。
  • 第 2 级(统计视角):“这是机器,加上整个工厂繁忙程度的摘要。”(简单事实 + 仪表盘)。
  • 第 3 级(神谕视角):“这是机器、仪表盘,以及工厂的秘密蓝图、未来计划和隐藏的瓶颈。”(一切)。

令人惊讶的是
你可能会认为给人工智能更多信息(第 3 级)会让它变得更聪明。事实并非如此。

  • 人工智能在使用简单的仪表盘(第 2 级)时表现最好
  • 当给予包含所有复杂蓝图的“神谕”视角(第 3 级)时,人工智能的表现反而变差了。

类比:想象你在开车。

  • 第 2 级是看着道路和你的速度表。你开得不错。
  • 第 3 级是给你整个交通报告、未来一周的天气模式、发动机内部温度以及道路上每辆车的 GPS 历史记录。
  • 悖论:额外的数据让司机不知所措。他们被噪音搞糊涂了,做出的决定比只看道路时更糟糕。论文将这种现象称为**“可观测性悖论”**。

4. “工具”陷阱

他们还尝试给人工智能特殊工具来“模拟”如果它采取某个行动会发生什么(就像国际象棋电脑向前看一步)。

  • 结果:使用这些工具消耗了大量的“令牌”(计算能力/金钱),但实际上并没有让人工智能在调度方面变得更好。这就像花钱买了一个高级 GPS,但它给出的方向和你自己猜测的一样。

5. 最终结论:擅长猜测,不擅长优化

论文得出结论,当前的人工智能调度代理不是超级优化器。

  • 它们是鲁棒的近似器。这意味着它们擅长做出“安全”、 decent 的猜测,这些猜测几乎和人类专家的快速经验法则一样好。
  • 它们无法 consistently 击败最佳的传统、手工设计的规则(启发式算法)。它们被困在了一个“性能天花板”中。

总结

论文说:“停止在随机或死记硬背的问题上测试人工智能。使用我们新的‘校准健身房’来公平地测试它们。当你这样做时,你会发现给人工智能太多信息实际上会让它们困惑,而且它们目前只是非常擅长猜测,而不是天才。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →