← 最新论文
💻 computer science

TypeGo: An OS Runtime for Embodied Agents

本文介绍了 TypeGo,一种面向具身智能体的操作系统级运行时,它通过将同步的 LLM 请求/响应周期替换为异步、多时间尺度的规划与并发任务管理,从而显著降低延迟并实现实时控制。

原作者: Guojun Chen, Alex Schott, Lin Zhong

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Guojun Chen, Alex Schott, Lin Zhong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一只机器狗如何在繁忙的世界中穿行。目前,大多数机器人的工作方式就像一个等待短信的人:它们停下来,等待“大脑”(大语言模型或 LLM)回复下一步动作,然后才行动。如果“大脑”思考了 5 秒钟,机器人就会僵在那里 5 秒钟。这在现实生活中是太慢了,因为在现实中,你需要躲避掉落的物体,或者在走路时与人交谈。

TypeGo 是一个旨在解决这一问题的全新系统。耶鲁大学的研究人员提出,不应将机器人视为一个等待指令的简单机器,而应将其视为一个智能操作系统(就像运行在你手机或电脑上的软件一样),能够同时管理机器人的身体和大脑。

以下是 TypeGo 的工作原理,我们使用简单的类比来解释:

1. 问题所在:“停下来思考”的瓶颈

想象一个机器人试图穿过房间。

  • 旧方式: 机器人走一步,停下来,询问它的 AI 大脑:“下一步做什么?”AI 思考了 3 秒钟,说“向左转”,然后机器人转弯。接着它再次停下来询问:“下一步做什么?”这导致机器人动作僵硬、缓慢,无法快速应对突发状况。
  • 挑战: AI 大脑很聪明但很慢。现实世界的机器人需要很快。

2. 解决方案:“机器人操作系统”

TypeGo 扮演着一个操作系统的角色,它可以同时运行多个“应用”(任务),就像你的电脑管理屏幕、键盘和扬声器一样,管理机器人的物理部件(腿部、扬声器、摄像头)。

它使用四个不同速度的“思考循环”,让它们协同工作:

  • 反射层 (S0) —— “膝跳反应”:
    • 类比: 想象触摸到热炉。你在大脑意识到烫之前,手就已经缩回来了。
    • 工作原理: 这是一个极快的层级,它不需要等待缓慢的 AI。如果有人走到机器人面前,这个层级会立即发出指令:“停止!”或“后退一步!”它每秒运行 100 次,确保机器人永远不会发生碰撞。
  • 动作流式传输器 (S1) —— “投机型厨师”:
    • 类比: 想象一位厨师,在汤还在沸腾时就开始切菜。他们不会等待汤煮好,而是提前准备好下一步。
  • 工作原理: 当机器人正在行走时,这一层已经在思考下一步的三步动作了。它将这些动作放入一个“队列”(等待线)中。当机器人完成当前步骤时,下一步已经准备就绪。这通过“移动时间”隐藏了“思考时间”。
  • 任务分解器 (S2) —— “项目经理”:
    • 类比: 如果你告诉一个人“打扫房子”,他们会将其拆解为:“先捡起玩具,然后吸尘,最后除尘。”
    • 工作原理: 这一层将一个大目标(如“寻找一个球”)分解成更小、更易处理的块。它会根据机器人看到的情况每隔几秒更新一次计划。
  • 进程调度器 (S3) —— “交通警察”:
    • 类比: 想象一个繁忙的十字路口。交通警察决定谁先通行:是救护车(紧急情况)还是送货卡车(常规任务)。
    • 工作原理: 如果机器人在行走(任务 A),而人类突然要求它坐下(任务 B),调度器会决定哪个任务胜出。它知道如果人类给出了直接指令,该指令具有优先权。如果机器人只是需要避开一堵墙,它会暂停行走任务,处理墙壁问题,然后自动恢复行走。

3. 与机器人交流:“处方”

你不需要编写代码来告诉 TypeGo 该做什么。你只需自然地说话。

  • 任务: “去找一个红色的球。”(这会发送给项目经理)。
  • 反射: “如果任何物体靠近 2 英尺以内,请后退一步。”(这会被编译成一条快速的自动规则,用于反射层)。

4. 如何处理冲突(“技能内核”)

机器人的物理部件是有限的。如果动作发生冲突,它无法同时行走并旋转头部。

  • 内核: 可以将其视为“资源管理器”。它就像夜店的保安。如果“行走”进程想要控制腿部,而“说话”进程想要控制嘴部,内核会允许两者同时进行,因为它们使用的是不同的部件。但如果两个进程都想要控制腿部,内核会暂停其中一个,直到另一个完成,从而确保机器人不会尝试同时做两件相互冲突的事情。

5. 结果:更快、更聪明

研究人员在名为“Kalos”的真实机器狗(Unitree Go2)上测试了 TypeGo。

  • 速度: 与旧方法相比,TypeGo 将做出第一个动作所需的时间缩短了 73%。它还将步骤之间的延迟降低了 50%
  • 多任务处理: 机器人可以在听取人类指令的同时行走;如果人类给出了新命令,机器人可以暂停、倾听,然后恢复行走而不会产生混乱。
  • 安全性: 如果障碍物出现,机器人能瞬间做出反应(不到一秒),无需等待缓慢的 AI 进行思考。

总结

TypeGo 是一种全新的运行机器人的方式。它不再是每做一个动作都要询问缓慢的 AI 大脑,而是赋予机器人一个“操作系统”,使其能够:

  1. 对危险做出即时反应(反射)。
  2. 在移动时提前规划(投机流式传输)。
  3. 同时管理多个任务(调度)。
  4. 使用自然语言与人类交流

其结果是,机器人变得更加鲜活、响应迅速,并且能够应对混乱且不可预测的现实世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →