← 最新论文
🤖 AI

When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning

本文在视觉 - 语言策略中引入了一种可学习的、状态条件化的承诺深度机制,该机制动态决定在重新规划前执行多少个基元动作,通过优化重新规划成本与执行误差之间的权衡,显著优于固定深度基线,并在长视野推理任务上超越了闭源模型。

原作者: Chen Li, Zhantao Yang, Fangyi Chen, Han Zhang, Anudeepsekhar Bolimera, Marios Savvides

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Chen Li, Zhantao Yang, Fangyi Chen, Han Zhang, Anudeepsekhar Bolimera, Marios Savvides

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《何时重新承诺》的通俗解释,辅以日常类比。

核心问题:“过早过多”的困境

想象你正在尝试解决一个复杂的拼图,比如滑动方块游戏或 Sokoban 推箱子游戏。你有一个智能 AI 助手(视觉 - 语言模型),它能观察画面并告诉你该做什么。

过去,这些 AI 助手的工作方式非常僵化。它们必须在再次查看棋盘之前,预先规划固定数量的步骤

  • 如果规划的步数太少(例如 1 步): 它们会查看棋盘,说“向左移动”,等待结果,再次查看,说“向右移动”,以此类推。这很安全,但既缓慢又令人疲惫,因为它们必须不断“寻求帮助”(重新规划)。
  • 如果规划的步数太多(例如 8 步): 它们会说:“好的,我会先向左,然后向上,接着向右,再向下……"然后不加检查地全部执行。这很快,但如果它们在第三步犯了一个小错误,可能会把箱子推到角落里导致永远卡住,而它们直到为时已晚才会意识到这一点。

这篇论文提出了一个问题:为什么 AI 必须为整局游戏只选择一个数字(比如 4)?为什么它不能根据当前情况的棘手程度,临场决定是规划 1 步还是 8 步?

解决方案:“自适应承诺”策略

研究人员构建了一种新型 AI,它学会了回答这个问题:“在再次查看棋盘之前,我应该对我的计划承诺多深?”

这就像开车:

  • 在空旷笔直的公路上(简单状态): 你可以承诺驾驶 10 分钟,而无需过于频繁地检查后视镜或路况。你确信路径是畅通的。
  • 接近有行人的繁忙十字路口时(困难状态): 你只承诺接下来的 5 秒。你需要不断观察、反应并重新规划,因为情况既危险又不可预测。

这篇论文中的 AI 学会了成为这种“聪明的司机”。它不使用固定规则,而是观察当前的拼图状态并决定:“这部分很简单,我会承诺执行 4 步。哦,这部分很棘手,我只承诺执行 1 步,然后再次检查。”

他们如何训练 AI

他们并没有直接告诉 AI 该怎么做,而是通过两个步骤进行了训练:

  1. “家庭作业”阶段(监督微调): 首先,他们向 AI 展示了成千上万个完美解决这些拼图示例。他们教会它如何执行不同长度的动作(1 步、2 步、4 步等),使其知道如何执行这些动作。
  2. “练习赛”阶段(强化学习): 然后,他们让 AI 玩游戏。每次它成功解决一个拼图,就会获得一颗“金星”(奖励)。如果它卡住或浪费了步数,就会得到“大拇指向下”(惩罚)。随着时间的推移,AI 意识到:“嘿,当我接近目标时,我应该规划较少的步数以确保安全。当我离目标较远时,我可以规划更多步数以加快速度。”

结果:击败巨头

研究人员在两个经典拼图上测试了这种新 AI:滑动拼图Sokoban

  • 竞争对手: 他们将他们的 AI 与以下对象进行了比较:
    • 坚持固定步数的旧 AI(例如总是规划 4 步)。
    • 世界上最著名、最庞大的 AI 模型(如 GPT-5.5、Claude Sonnet 和 Gemini),这些模型在没有经过特殊训练的情况下被要求玩游戏。
  • 结果:
    • 那些庞大且著名的 AI 在被要求在没有特殊训练的情况下玩这些拼图时完全失败(0% 成功率)。它们对规则感到过于困惑。
    • “固定步数”的 AI 表现尚可,但效率低下。
    • 新的自适应 AI 成为了赢家。它比任何固定步数的竞争对手都更频繁地解决了拼图(更高的成功率),并且使用了更少的总步数(更高效)。

尽管他们的 AI 比巨型模型小得多(70 亿参数),但由于它知道何时停下来再次查看,因此表现更好。

成功背后的“原因”

这篇论文从数学上证明,固定策略总是次优的。

  • 类比: 想象一个徒步旅行者。如果小径平坦且阳光明媚,他们可以走 10 英里而不查看地图。如果小径雾气弥漫且岩石嶙峋,他们应该每走 100 英尺就查看一次地图。
  • 发现: “不查看地图的最佳行走距离”会根据地形而变化。通过强迫 AI 以固定间隔查看地图,你要么是在浪费时间(在简单的小径上检查太频繁),要么是在迷路(在困难的小径上检查不够频繁)。新的 AI 学会了在它真正需要的时候查看地图。

总结

这篇论文介绍了一种让 AI 规划长序列动作的更智能方法。AI 不再盲目遵循“规划 5 步然后停止”这样的僵化规则,而是学会根据当前情况的难度,动态决定对计划承诺多久。这使得它比以前的方法甚至未经训练的巨大 AI 模型更快、更准确,也更擅长解决复杂的长期问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →