← 最新论文
🤖 AI

Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning

本文提出了∞\infty-THOR 框架,通过构建可扩展的长程轨迹生成系统、名为“Embodied Haystack"的多线索长程推理基准以及配套的超长序列数据集,并结合交错式目标 - 状态 - 动作建模等架构创新,旨在推动具身智能在极端长上下文环境下的推理与规划能力。

原作者: Bosung Kim, Prithviraj Ammanabrolu

发布于 2026-02-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Bosung Kim, Prithviraj Ammanabrolu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ∞-THOR 的新框架,它的目标是教机器人(或者说是“具身智能体”)如何像人类一样,在漫长的时间里记住细节、规划未来,并解决那些需要跨越很长时间才能完成的复杂任务。

为了让你更容易理解,我们可以把这篇论文的核心内容想象成教一个超级健忘的实习生完成一项“寻宝大挑战”。

1. 核心挑战:大海捞针(Embodied Haystack)

想象一下,你给这个实习生布置了一个任务:

  • 上午 9 点:他在厨房看到了一个西红柿。
  • 下午 2 点:他在客厅看到了一个料理台。
  • 下午 5 点:老板突然说:“把那个西红柿放到料理台上。”

对于普通的人工智能来说,这就像是在大海里找一根针(Needle in a Haystack)。因为从早上到下午,中间发生了成千上万件事(走了多少步、看了多少东西、拿起了多少物品),那个“西红柿”和“料理台”的信息早就被淹没在海量数据里了。

这篇论文提出的新任务叫 “具身大海捞针” (Needle(s) in the Embodied Haystack)。它比传统的“大海捞针”更难,因为:

  • 针不止一根:可能需要记住好几个分散在不同时间的线索。
  • 不仅是文字:线索藏在视频画面和动作里,而不仅仅是文本。

2. 解决方案:∞-THOR 框架

为了解决这个问题,作者们造了一个名为 ∞-THOR 的“训练场”。

  • 无限生成的剧本:这个训练场可以自动生成无数条超长的“剧情线”。就像拍电影一样,它可以生成一个长达几百个步骤的故事,确保故事里既有早期的伏笔(西红柿),也有后期的目标(料理台)。
  • 真实的模拟:在这个虚拟世界里,机器人必须真的去“走”、去“看”、去“拿”,而不是只看一张静态图片。

3. 机器人的“大脑”升级(架构与训练)

为了让机器人能记住这么久的事情,作者们尝试了两种给机器人装“大脑”的方法:

  • 方法 A:全记忆回放 (Interleaved Goal-State-Action)

    • 比喻:就像让机器人把从早上 9 点到下午 5 点的所有经历,像放电影一样,一帧一帧地全部读一遍,然后才做决定。
    • 优点:信息最全,不会漏掉细节。
    • 缺点:太累了!现在的电脑很难一次性处理这么长的“电影”(超过 100 万字的文本量)。
  • 方法 B:记忆增强 (Memory-Augmented)

    • 比喻:就像给机器人发了一本日记本。它不需要重读所有电影,而是只读日记里记录的“重点摘要”(比如:“上午 9 点拿了西红柿,下午 2 点到了客厅”)。
    • 优点:轻松,省内存。
    • 缺点:如果摘要写得太简略,可能会漏掉关键细节。

实验发现:在这个特定的长任务中,“全记忆回放”(虽然累但信息全)的效果反而比“看日记”要好。这说明机器人需要看到完整的上下文才能做出正确判断。

4. 训练技巧:如何塞进更多记忆?

既然机器人的“记忆窗口”(Context Window)有限,怎么让它记住更多东西呢?作者们用了两个魔法:

  • 上下文扩展 (Context Extension):就像给机器人的大脑“扩容”。通过特殊的数学技巧(如 YaRN),让原本只能记 3 万字的模型,强行能记 30 万字,而且不糊涂。
  • 并行处理 (Context Parallelism):就像把一本巨厚的书分给 16 个助手同时阅读,然后拼凑起来。这样既快又省内存。

5. 成果:从虚拟到现实 (Sim-to-Real)

最酷的部分来了!作者们发现,在这个虚拟训练场里练出来的“寻宝能力”,竟然可以直接迁移到现实世界!

  • 实验:他们用 ∞-THOR 生成的数据训练了一个模型,然后把这个模型放到一个照片级真实的测试环境(VSI-Bench)里。
  • 结果:模型的表现提升了 11.2%!
  • 意义:这证明了,只要让机器人在虚拟世界里学会“长时间记忆”和“跨时间推理”,它就能更好地处理现实世界中那些需要长时间规划的任务(比如机器人做家务、整理房间)。

总结

这篇论文就像是在说:

“以前的机器人太短视,只能记住眼前的一两件事。我们造了一个超长的虚拟训练场,给机器人安排了‘跨时空寻宝’的考试。通过特殊的训练方法,我们教会了机器人如何像人类一样,记住几天前看到的线索,并在很久之后正确执行任务。这不仅让虚拟机器人变聪明了,还让它们能更好地在现实世界中干活。”

虽然现在的机器人离完美的“长期规划大师”还有距离(比如放东西的动作还不够精准),但这篇论文为下一代能记性超好、能规划长远的机器人打下了坚实的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →