← 최신 논문
🤖 AI

DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?

이 논문은 멀티모달 문맥에 따라 다양한 스케일링 축(추론 깊이, 모델 크기, 메모리 등)에 걸쳐 테스트 시간 연산량을 동적으로 할당함으로써, 단순한 스케일링이나 고정된 모델 선택 방식에 비해 현저히 낮은 지연 시간과 비용으로 프런티어 수준의 성공률을 달성하며 임바디드 플래닝(embodied planning)을 최적화하는 라우팅 프레임워크인 DIRECT를 소개한다.

원저자: Jadelynn Dao, Milan Ganai, Yasmina Abukhadra, Ajay Sridhar, Mozhgan Nasr Azadani, Katie Luo, Clark Barrett, Jiajun Wu, Chelsea Finn, Marco Pavone

게시일 2026-06-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jadelynn Dao, Milan Ganai, Yasmina Abukhadra, Ajay Sridhar, Mozhgan Nasr Azadani, Katie Luo, Clark Barrett, Jiajun Wu, Chelsea Finn, Marco Pavone

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 바쁜 레스토랑 주방의 매니저라고 상상해 보세요. 당신에게는 서로 다른 숙련도와 속도를 가진 요리사 팀이 있습니다:

  • 빠른 준비 요리사 (The Speedy Prep Cook): 빠르고 저렴하며, 양파를 썰거나 설거지를 하는 것과 같은 단순한 작업에 능숙합니다.
  • 마스터 셰프 (The Master Chef): 느리고 비싸지만, 생선을 발라내거나 섬세한 소스를 만드는 것과 같은 복잡한 작업에 탁월합니다.

로보틱스의 세계에서 **시각-언어 모델 (Vision-Language Models, VLMs)**은 이 "헤드 셰프" 또는 플래너 역할을 합니다. 이들은 장면(예: 지저ка운 테이블)을 보고 명령(예: "테이블을 치워줘")을 이해한 뒤, 로봇 팔이 따라야 할 단계별 절차로 이를 세분화합니다.

문제는 많은 개발자가 모든 작업을 동일하게 취급해 왔다는 점입니다. 그들은 그저 마스터 셰프를 고용해 모든 일을 시키고 있습니다. 그들은 "마스터 셰프가 최고라면, 모든 일에 그를 사용해야 해"라고 생각합니다.

하지만 DIRECT라는 논문이 지적하듯, 이는 매우 낭비적인 방식입니다. 마스터 셰프에게 컵 하나를 씻게 하는 것은 시간이 너무 오래 걸리고 비용도 엄청나게 들지만, 사실 빠른 준비 요리사라면 순식간에 해낼 수 있는 일이기 때문입니다.

핵심 아이디어: 스마트한 웨이터

저자들은 DIRECT(Dynamic Inference Router for Embodied Compute Tradeoffs)를 소개합니다. 이것은 주방 문 앞에 서 있는 매우 똑똑한 웨이터와 같습니다.

고객이 요리(로봇 작업)를 주문하면, 웨이터는 단순히 마스터 셰프에게 주문을 넘기지 않습니다. 대신, 웨이터는 주문 내용과 현재 주방의 상태를 살펴봅니다:

  1. 단순한가? (예: "빨간색 컵을 집어 들어.") -> 웨이터는 이 작업을 빠른 준비 요리사에게 보냅니다.
  2. 복잡한가? (예: "책들을 크기별로 분류한 다음, 아무것도 쓰러뜨리지 않고 선반에 올려 둬.") -> 웨이터는 이 작업을 마스터 셰프에게 보냅니다.

이러한 "라우팅(경로 배정)"은 즉각적으로 이루어지며, 시간을 아끼고 비용을 절감하면서도 작업을 완벽하게 수행하게 합니다.

셰프를 "업그레이드"하는 세 가지 방법

논문은 셰프를 더 "똑똑하게" 만드는(이를 "테스트 시간 연산량 스케일링"이라 부릅니다) 세 가지 방법을 테스트했으며, 각 업그레이드가 서로 다른 상황에서 도움이 된다는 것을 발견했습니다.

  1. 더 오래 생각하기 (Chain-of-Thought):

    • 비유: 셰프에게 행동하기 전에 "생각을 소리 내어 말해 보라고" 요청하는 것.
    • 발견: 이는 물리 법칙이나 공간 개념을 추론해야 하는 까다로운 퍼즐(예: "어떤 블록이 다른 블록 아래에 있는가?")에 매우 효과적입니다. 하지만 "숟가락을 집어 들어"와 같은 단순한 작업에는 생각하는 과정이 오히려 속도를 늦출 뿐입니다. DIRECT는 단순한 작업에서는 이 생각하는 과정을 건너뛰도록 학습합니다.
  2. 더 큰 규모의 셰프 고용하기 (Model Size):

    • 비유: 마스터 셰프는 500개의 레시피를 알지만, 주니어 셰프는 50개만 압니다.
    • 발견: 큰 규모의 셰프는 희귀하거나 복잡한 기술(예: "수건 접기" 또는 "서랍 닫기")에 더 뛰어납니다. 하지만 일반적인 작업(예: "컵을 상자에 넣어")의 경우, 큰 셰프가 작은 셰프보다 딱히 더 낫지 않습니다. DIRECT는 일반적인 작업에는 작은 셰프를 사용하고, 희귀한 작업에만 큰 셰프를 아껴둡니다.
  3. 과거를 기억하기 (Memory):

    • 비유: 10분 전에 무슨 일이 있었는지 기억하는 셰프 vs 지금 카운터 위에 무엇이 있는지만 보는 셰프.
    • 발견: 만약 작업이 순서를 기억해야 한다면(예: "첫 번째 블록을 상자에 넣은 다음, 두 번째 블록을 넣어"), 메모리가 있는 셰프가 필요합니다. 하지만 작업이 단 한 단계로 끝난다면, 메모리는 오히려 짐이 됩니다. DIRECT는 실제로 메모리가 필요한 작업일 때만 메모리를 활성화합니다.

결과: 더 빠르고 더 저렴하게

연구팀은 이 "스마트한 웨이터" 시스템을 실제 로봇(Franka arm)과 시뮬레이션 환경에서 테스트했습니다.

  • 결과: DIRECT는 가장 비싸고 강력한 시스템들의 성공률을 따라잡으면서도, 평균적으로 최대 65% 더 빠르게 작업을 수행했습니다.
  • 시사점: 모든 작업에 가장 강력한 도구를 사용할 필요는 없습니다. 적절한 도구를 적절한 작업에 지능적으로 매칭함으로써, 훨씬 적은 비용과 시간으로 "프런티어 수준(최고 수준)"의 성능을 낼 수 있습니다.

요약하자면, DIRECT는 로봇이 어떻게 생각할지에 대해 똑똑해지는 법을 가르쳐줍니다. 이를 통해 단순한 문제에 과하게 생각하지 않고, 복잡한 문제에는 부족하게 생각하지 않도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →