← 최신 논문
💻 computer science

TypeGo: An OS Runtime for Embodied Agents

이 논문은 동기식 LLM 요청/응답 사이클을 비동기적, 다중 척도 계획 및 병렬 작업 관리로 대체하여 지연 시간을 크게 줄이고 실시간 제어를 가능하게 하는 임바디드 에이전트용 운영 체제 스타일 런타임인 TypeGo를 소개한다.

원저자: Guojun Chen, Alex Schott, Lin Zhong

게시일 2026-07-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Guojun Chen, Alex Schott, Lin Zhong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇 강아지에게 복잡한 세상을 항해하는 법을 가르치고 있다고 상상해 보세요. 현재 대부분의 로봇은 마치 문자를 기다리는 사람처럼 작동합니다. 그들은 멈춰서서, "뇌"(대규모 언어 모델 또는 LLM)가 다음 동작을 알려줄 때까지 기다렸다가 움직입니다. 만약 "뇌"가 생각하는 데 5초가 걸린다면, 로봇은 5초 동안 얼어붙은 채 서 있게 됩니다. 이는 떨어지는 물체를 피하거나, 걷는 도중에 인간과 대화를 해야 하는 실제 현실에서는 너무 느립니다.

TypeGo는 이 문제를 해결하기 위해 설계된 새로운 시스템입니다. 예일 대학교의 연구진은 로봇을 단순히 명령을 기다리는 단순한 기계가 아니라, 로봇의 몸과 뇌를 동시에 관리하는 스마트 운영 체제(컴퓨터나 스마트폰에서 실행되는 소프트웨어와 같은)로 취급할 것을 제안합니다.

TypeGo가 어떻게 작동하는지 쉬운 비유를 통해 설명해 드리겠습니다.

1. 문제점: "멈춰서 생각하기"의 병목 현상

로봇이 방을 가로질러 걸어가려고 한다고 가정해 봅시다.

  • 기존 방식: 로봇이 한 걸음을 내디디고, 멈춰서서 AI 뇌에게 "다음은 뭐야?"라고 묻습니다. AI가 3초 동안 생각한 뒤 "왼쪽으로 돌아"라고 말하면, 로봇은 그제야 방향을 틉니다. 그러고 나서 다시 "다음은 뭐야?"라고 묻기 위해 멈춥니다. 이는 로봇을 덜컥거리며 느리게 만들고, 갑작스러운 상황에 빠르게 반응하지 못하게 합니다.
  • 과제: AI 뇌는 똑똑하지만 느립니다. 실제 세상의 로봇은 빨라야 합니다.

2. 해결책: "로봇 OS"

TypeGo는 컴퓨터가 화면, 키보드, 스피커를 관리하듯, 로봇의 물리적 부품(다리, 스피커, 카메라)을 동시에 관리하며 여러 가지 "앱"(작업)을 실행하는 운영 체제 역할을 합니다.

TypeGo는 서로 다른 속도로 작동하며 협력하는 **네 가지 서로 다른 "사고 루프(Thinking Loops)"**를 사용합니다.

  • 반사 계층 (S0) – "무릎 반사 반응":
    • 비유: 뜨거운 난로에 손을 댔을 때를 상상해 보세요. 당신은 손이 뜨겁다는 것을 뇌가 인지하기도 전에 손을 떼 버립니다.
    • 작동 방식: 이것은 느린 AI를 기다리지 않는 초고속 계층입니다. 만약 사람의 발걸음이 로봇 앞을 지나가면, 이 계층은 즉시 "멈춰!" 또는 "뒤로 물러나!"라고 명령합니다. 이 계층은 초당 100번 실행되어 로봇이 절대 충돌하지 않도록 보장합니다.
  • 액션 스트리머 (S1) – "예측하는 요리사":
    • 비유: 요리사가 수프가 끓기를 기다리는 것이 아니라, 수프가 끓는 동안 이미 채소를 썰기 시작하는 것을 상상해 보세요. 그들은 수프가 다 완성될 때까지 기다리지 않고 다음 단계를 미리 준비합니다.
    • 작동 방식: 로봇이 현재 걷고 있는 동안, 이 계층은 이미 다음 세 걸음을 미리 생각하고 있습니다. 이 단계들을 "큐(Queue, 대기열)"에 넣어둡니다. 로봇이 현재의 걸음을 마칠 때쯤이면, 다음 동작이 이미 준비되어 있습니다. 이를 통해 느린 생각 시간을 빠른 움직임 시간 뒤로 숨깁니다.
  • 태스크 디컴포저 (S2) – "프로젝트 매니저":
    • 비유: 사람에게 "집을 청소해"라고 말하면, 그들은 이를 세분화합니다: "먼저 장난감을 줍고, 그다음 진공청소기를 돌리고, 마지막으로 먼지를 닦는다."
    • 작동 방식: 이 계층은 큰 목표(예: "공 찾기")를 받아 이를 작고 관리 가능한 단위로 나눕니다. 그리고 로봇이 보는 것에 따라 몇 초마다 이 계획을 업데이트합니다.
  • 프로세스 스케줄러 (S3) – "교통 경찰":
    • 비유: 번잡한 교차로를 상상해 보세요. 교통 경찰은 누가 먼저 갈지 결정합니다: 구급차(비상 상황)인가, 아니면 배달 트럭(일상적인 상황)인가?
    • 작동 방식: 로봇이 걷고 있는 중(작업 A)에 사람이 갑자기 앉으라고 명령(작업 B)한다면, 스케줄러는 어떤 작업이 우선순위를 가질지 결정합니다. 스케줄러는 인간이 직접적인 명령을 내리면 그것이 우선순위를 갖는다는 것을 알고 있습니다. 만약 로봇이 단순히 벽을 피해야 하는 상황이라면, 걷기 작업을 잠시 멈추고 벽을 피한 뒤, 자동으로 다시 걷기 작업을 재개합니다.

3. 로봇과 대화하기: "처방전(Prescriptions)"

TypeGo에게 명령을 내리기 위해 코드를 작성할 필요는 없습니다. 그저 자연스럽게 말하면 됩니다.

  • 태스크(Tasks): "빨간 공을 찾아봐." (프로젝트 매니저에게 전달됩니다).
  • 반사(Reflexes): "만약 무언가가 2피트 이내로 가까워지면, 뒤로 물러나." (이것은 빠른 자동 규칙으로 컴파일되어 반사 계층에 입력됩니다).

4. 충돌 처리 방법 (The "Skill Kernel")

로봇은 물리적인 부품이 한정되어 있습니다. 두 동작이 충돌한다면 동시에 걸으면서 머리를 돌릴 수는 없습니다.

  • 커널(Kernel): 이것은 "자원 관리자"라고 생각하면 됩니다. 클럽 입구의 보안 요원과 같습니다. 만약 "걷기" 프로세스가 다리를 원하고, "말하기" 프로세스가 입을 원한다면, 커널은 두 기능이 서로 다른 부위를 사용하므로 둘 다 허용합니다. 하지만 두 프로세스가 모두 다리를 사용하려고 한다면, 커널은 하나가 끝날 때까지 다른 하나를 일시 정지시켜 로봇이 동시에 모순된 행동을 하지 않도록 보장합니다.

5. 결과: 더 빠르고 더 똑똑하게

연구진은 실제 로봇 개(Unitree Go2)인 "Kalos"를 통해 테스트를 진행했습니다.

  • 속도: 기존 방식과 비교했을 때, TypeGo는 첫 번째 움직임을 시작하기까지 걸리는 시간을 73% 단축했습니다. 또한 단계 사이의 지연 시간도 50% 줄였습니다.
  • 멀티태스킹: 로봇은 걷는 동안 인간의 말을 들을 수 있었으며, 인간이 새로운 명령을 내리면 혼란 없이 걷기를 멈추고, 듣고, 다시 걷기를 재개할 수 있었습니다.
  • 안전성: 장애물이 나타나면 로봇은 느린 AI가 생각하기를 기다리지 않고 즉각적으로(1초 미만 안에) 반응했습니다.

요약

TypeGo는 로봇을 구동하는 새로운 방식입니다. 매 동작마다 느린 AI 뇌의 허락을 구하는 대신, 다음과 같은 기능을 갖춘 "운영 체제"를 로봇에게 부여합니다:

  1. 위험에 즉각 반응합니다 (반사).
  2. 움직이는 동안 미리 계획합니다 (예측 스트리밍).
  3. 여러 작업을 동시에 관리합니다 (스케줄링).
  4. 자연어를 사용하여 인간과 대화합니다.

그 결과, 로봇은 더 살아있는 듯하고, 반응이 빠르며, 예측 불가능한 실제 세상을 다룰 수 있는 능력을 갖추게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →