← 最新论文
🤖 machine learning

Finding the Time to Think: Learning Planning Budgets in Real-Time RL

本文引入了变延迟实时强化学习,其中智能体必须随着环境的进展选择思考时间,并提出通过训练一种轻量级门控策略来动态选择与状态相关的规划预算,在多种实时游戏中超越了固定和启发式基准。

原作者: Aneesh Muppidi, Firas Darwish, Dylan Cope, João F. Henriques, Jakob Nicolaus Foerster

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Aneesh Muppidi, Firas Darwish, Dylan Cope, João F. Henriques, Jakob Nicolaus Foerster

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在玩一款像《吃豆人》(Pac-Man)或《俄罗斯方块》(Tetris)这样节奏极快的电子游戏。在正常的游戏中,当你思考“嗯,我是该往左走还是往右走?”时,世界会暂停。你可以花任意长的时间来做出完美的决策。

但在**实时(real-time)**环境下,世界并不会等待。即使你在盯着屏幕思考,幽灵仍在移动,方块仍在落下,时钟也在不停滴答作响。如果你在权衡决策时耗时过久,你可能会错过行动的最佳时机;而一个快速做出的“足够好”的动作,往往比一个“太迟了”的完美动作更有效。

这篇论文探讨了一个特定的问题:你如何决定何时该深入思考,何时该直接反应?

核心理念:“思考预算”

作者引入了一个系统,让 AI 智能体必须为每一个决策选择自己的“思考预算”。

  • 选项 A: 立即反应(花费 0 秒思考)。
  • 选项 B: 花一点时间思考(比如 1 秒)。
  • 选项 C: 花大量时间思考(比如 4 秒)。

问题的关键在于?当 AI 在“思考”(选项 B 或 C)时,游戏世界仍在向前推进。如果它思考了 4 秒,游戏已经前进 4 步了。AI 可能会在这 4 秒钟内错过某个关键的机会。

解决方案:“守门员”(The Gatekeeper)

研究人员构建了一个由两部分组成的团队:

  1. 规划者(大脑): 一个强大且思考缓慢的 AI(基于 AlphaZero),只要给予足够的时间,它就能计算出最佳动作。它就像一位国际象棋大师。
  2. 守门员(管理者): 一个微小且反应极快的 AI,它观察当前的情况并决定:“我们需要让‘规划者’思考 4 秒钟,还是仅仅靠快速的反射动作就够了?”

守门员充当了交通控制员的角色。它本身并不玩游戏,它只是告诉规划者:“嘿,这个情况很危险,请花 4 秒钟思考!”或者“这个情况很无聊,直接动手就行!”

类比:带着时钟的棋手

想象一位快棋选手。他们在整场比赛中拥有有限的棋钟时间。

  • 如果棋局很简单,他们会在 2 秒内走棋。
  • 如果棋局是一个复杂的陷阱,他们可能会花 2 分钟进行分析。

这篇论文中的 AI 也在做同样的事情,但它能自动学习这项技能。它学会了:

  • 在**《吃豆人》**中,如果幽灵离得很远,可以多思考一会儿。如果幽灵就在身后,你必须立即反应。
  • 在**《俄罗斯方块》**中,如果棋盘是空的,你不需要思考。如果棋盘是一片混乱的方块堆,你需要花额外的时间来计算最佳的匹配方式。

他们是如何测试的

他们将这个“守门员”测试在五种不同的游戏中:

  1. 《吃豆人》、《俄罗斯方块》和《贪吃蛇》: 这些是“承诺行动”(committed action)类游戏。当 AI 在思考时,一个“反射型”版本的 AI 会保持游戏运行,以免世界冻结。
  2. 《速度六角棋》(Speed Hex)和《速度围棋》(Speed Go): 这些是“时钟”类游戏。棋盘本身不会移动,但 AI 个人的时钟会随着思考时间的增加而流逝。

结果:
带有“守门员”的 AI 打败了所有其他版本的自己。

  • 它打败了那个总是以固定时间进行思考的版本(要么太慢,要么太快)。
  • 它打败了使用人类设计规则(例如“在游戏中期思考更久”)的版本。
  • 即使他们将“思考”部分放在一台电脑上,而将“游戏”部分放在另一台完全不同的电脑上,它依然有效,这证明了它在现实世界、复杂的硬件设置中也是行之有效的。

为什么这很重要

这篇论文表明,知道何时思考与知道如何思考同样重要。

通过训练一个微小的“管理者”来决定每次动作分配多少时间,AI 变得更加高效。它不再在简单的决策上浪费时间,而是将重度思考留给那些真正关键的时刻。这防止了 AI 因过度思考而陷入“瘫痪”,确保它在永不停歇的世界中依然能保持足够的反应速度以生存下来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →