← 최신 논문
🤖 machine learning

When Replanning Becomes the Bottleneck: Budgeted Replanning for Embodied Agents

본 논문은 토큰 예산을 동적으로 할당하고 컨텍스트를 프루닝함으로써 높은 작업 성공률을 유지하면서도 서비스 수준 목표 위반을 크게 줄여, 체화된 에이전트(embodied agents)의 빈번한 LLM 기반 재계획 과정에서 발생하는 지연 시간 병목 현상을 완화하는 예산 제어 프레임워크인 BRACE와 E-RECAP 토큰 프루닝 방법을 소개한다.

원저자: Shuaijun Liu, Feiyang You, Xingwei Chen, Ningxin Su

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Shuaijun Liu, Feiyang You, Xingwei Chen, Ningxin Su

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 소행성 지대를 항해하는 우주선의 선장이라고 상상해 보십시오. 당신에게는 경로를 계획하도록 돕는 매우 똑똑한 AI 부조종사가 있습니다. 하지만 여기 함정이 하나 있습니다. 배가 바위에 부딪히거나 길을 잃을 때마다, 당신은 AI에게 처음부터 다시 전체 경로를 재계산하라고 요청합니다. 처음에는 이 작업이 쉽습니다. 하지만 여정이 길어질수록, AI가 겪은 모든 일들(피했던 바위들, 다른 배들로부터 받은 메시지들, 저지른 실수들)에 대한 "기억"은 거대하고 엉킨 실타래처럼 변해갑니다. 새로운 계획을 요청할 때마다 AI는 그 거대한 실타래를 처음부터 다시 읽어야 합니다. 결국, AI는 자신의 역사에 압도되어 생각하는 데 한참이 걸리게 됩니다. AI가 마침 가장 สุด한 방향을 외쳐낼 때쯤이면, 당신은 이미 또 다른 소행성에 충돌한 상태일 것입니다. 이것이 바로 로봇과 AI 에이전트의 세계에서 발생하는 "재계획(replanning)"의 문제입니다. 이들은 더 많이 배우고 더 오래 작업할수록, 비록 기술적으로는 여전히 업무를 잘 수행하고 있을지라도, 실수를 바로잡는 속도가 느려집니다.

"When Replanning Becomes the Bottleneck(재계획이 병목 현상이 될 때)"이라는 제목의 이 논문은 현실 세계(또는 현실적인 시뮬레이션)에서 움직이고 행동해야 하는 "체화된 에이전트(embodied agents)"—로봇이나 AI 시스템—가 겪는 바로 이 골칫거리를 다룹니다. 저자인 류수이준(Shuaijun Liu)과 그의 팀은 로봇들이 과업을 완수하는 능력은 향상되고 있지만, 숨겨진 지표인 '속도'에서는 실패하고 있다는 사실을 발견했습니다. 그들은 로봇이 목표에 도달하는 데 100% 성공할 수는 있지만, 실수가 발생한 후 어떻게 그곳에 도달할지 결정하는 데 너무 많은 시간을 소비한다면 실시간 마감 시간을 놓치게 된다는 것을 발견했습니다. 이는 시험에서 A를 받았지만 정답지를 작성하는 데 사흘이 걸리는 학생과 같습니다. 성적은 완벽하지만, 시스템은 망가진 것입니다. 이 논문은 BRACE(Embodied Systems를 위한 에이전트 제어용 예산 기반 재계획)라는 새로운 시스템과 E-RECAP이라는 스마트한 가지치기 도구를 소개합니다. BRACE를 AI에게 "새로운 계획을 설명하는 데 정확히 200단어를 사용해야 하며, 반드시 2.5초 안에 끝내야 한다. 만약 못 한다면 이야기를 짧게 줄이겠다"라고 말하는 엄격한 프로젝트 매니저라고 생각하십시오. E-RECAP은 AI의 기억에서 중요하지 않은 부분은 무자비하게 삭제하면서도 중요한 세부 사항은 유지하는 편집자입니다. 이를 통해 AI가 핵심적인 내용을 잊지 않으면서도 더 빠르게 생각할 수 있게 해줍니다.

문제점: "너무 많은 역사"의 덫

로보틱스의 세계에서 에이전트(자율주走行 자동차나 로봇 팔 같은 것들)는 단순히 하나의 완벽한 대본만을 따르지 않습니다. 현실 세계는 무질서합니다. 로봇은 미끄러지고, 센서는 혼란을 겪으며, 다른 에이전트(다른 로봇이나 드론 등)가 예상치 못한 행동을 합니다. 이를 처리하기 위해 현대의 로봇들은 루프를 사용합니다: 상황을 **관찰(observe)**하고, 움직임을 **계획(plan)**하고, **실행(act)**하며, 만약 문제가 생기면 **재계획(replan)**합니다.

문제는 로봇이 재계획을 할 때마다 단순히 현재의 순간만을 보는 것이 아니라는 점 때문에 발생합니다. AI에게 작업 지침, 일어난 모든 일의 전체 기록, 저지른 실수, 그리고 다른 에이전트들로부터 온 메시지가 포함된 방대한 프롬프트를 입력합니다. 로봇이 작업을 수행함에 따라 이 "컨텍스트(context)"는 점점 커집니다. 페이지를 넘길 때마다 앞뒤로 페이지가 계속 추가되는 책을 읽는다고 상상해 보십시오. 결국 책은 너무 두꺼워져서 읽는 데 몇 시간이 걸리게 됩니다.

저자들은 이 컨텍스트가 커짐에 따라 AI가 재계획하는 데 걸리는 시간(지연 시간, latency)이 "헤비 테일(heavy tails)" 현상을 보이기 시작한다는 것을 발견했습니다. 이는 평균적인 재계획 시간은 괜찮아 보일지 몰라도, 가끔씩 AI가 생각에 빠져 너무 오래 걸리는 "롱 테일(long tail)" 구간에 갇힐 수 있음을 의미합니다. 실시간 시스템에서 단 한 번의 긴 지연은 재앙이 될 수 있습니다. 논문은 많은 테스트에서 로봇들이 과업 수행에는 100% 성공했지만, 재계획 호출의 최대 **100%**에서 속도 제한(서비스 수준 목표, SLO)을 위반했음을 보여줍니다. 이는 경주가 끝날 때마다 완주는 하지만, 출발 신호가 울리기 전에 신발 끈을 묶는 데 10분이 걸리는 러너와 같습니다. 승리는 하겠지만, 시스템은 비효율적이고 신뢰할 수 없습니다.

해결책: BRACE와 예산 관리자

이를 해결하기 위해 팀은 BRACE를 만들었습니다. AI가 무제한의 메모리를 가지고 원할 때마다 재계획하게 두는 대신, BRACE는 재계획을 예산이 정해진 자원으로 취급합니다. BRACE는 로봇이 다시 생각해야 할 때마다 다음 세 가지를 결정하는 컨트롤러 역할을 합니다:

  1. 재계획을 해야 하는가? 로봇이 단순히 약간 벗어나 있는 정도라면 전체적인 새 계획이 필요하지 않을 수도 있습니다. BRACE는 불필요한 생각을 피하기 위해 "대기"라고 말할 수 있습니다.
  2. 얼마나 많은 "토큰 예산"을 가지고 있는가? 토큰은 AI가 읽는 텍스트의 단위입니다. BRACE는 AI가 사용할 수 있는 토큰 수를 엄격하게 제한합니다.
  3. 시간 제한(SLO)은 얼마인가? BRACE는 재계획 프로세스가 걸릴 수 있는 엄격한 마감 시간을 설정합니다.

만약 AI가 너무 많은 메모리를 사용하거나 너무 오래 걸리려고 하면, BRACE가 개입합니다. 또한 "쿨다운 윈도우(cooldown windows)"와 같은 안전 기능도 갖추고 있어, 로봇이 매 초마다 당황하여 재계획을 시도함으로써 오히려 속도를 늦추는 것을 방지합니다.

도구: E-RECAP (스마트한 편집자)

예산이 있더라도 AI는 여전히 무언가를 읽어야 합니다. 여기서 E-RECAP이 등장합니다. 이것은 "점진적 토큰 가지치기(progressive token pruning)" 방식입니다. 로봇의 기억을 길고 장황한 이야기라고 상상해 보십시오. E-RE款은 어떤 부분이 결정적이고 어떤 부분이 군더더기인지 아는 매우 똑똑한 편집자입니다.

이 방식은 AI의 내부 "숨겨진 상태(hidden states, 텍-텍스트를 이해하는 방식)"를 살펴보고, 각 단어(토큰)가 얼마나 중요한지에 따라 점수를 매깁니다.

  • 시작 부분(작업 지침)과 끝 부분(가장 최근의 사건들)은 보통 가장 중요하기 때문에 유지합니다.
  • 중요도가 낮거나 반복적인 중간 부분삭제합니다.
  • 이 과정은 AI의 뇌를 통과하며 단계별로 진행되며, 단계가 진행될수록 점점 더 엄격해집니다.

그 결과, 결정적인 정보를 모두 포함하면서도 훨씬 짧고 깔끔한 이야지가 만들어집니다.

연구 결과: 성공을 희생하지 않는 속도

팀은 세 가지 플랫폼인 Meta Habitat(내비게이션을 위한 가상 세계), RoboFactory(로봇 팔과 협업을 위한 시뮬레이션), AirSim(드론과 자동차를 위한 시뮬레이터)에서 BRACE와 E-RECAP을 테스트했습니다.

결과는 놀라웠습니다. Meta Habitat 내비게이션 테스트에서 표준 방식("No BRACE")은 **100%**의 과업 성공률을 달いても 재계획 호출의 **85.5%**에서 속도 제한을 위반했습니다. BRACE와 E-RECAP을 추가했을 때, 성공률은 **100%**로 유지되었지만 속도 제한 위반은 **4.7%**로 급격히 감소했습니다.

RoboFactory 테스트에서의 개선은 더욱 극적이었습니다. 표준 방식은 호출의 **100%**에서 속도 제한을 위반했습니다. BRACE와 E-RECAP을 적용하자 이 수치는 **50.0%**로 떨어졌습니다. 표준 방식이 완전히 실패(성공률 0%)했던 더 어려운 환경에서도, 새로운 시스템은 속도 위반을 **4.6%**로 낮게 유지하면서 **80.0%**의 성공률을 달성했습니다.

또한 시스템은 AI가 처리해야 할 토큰 수를 62%에서 92%까지 줄였습니다. 이는 AI가 동일한(혹은 더 나은) 결과를 얻기 위해 훨씬 적은 일을 했다는 것을 의미합니다. AirSim 드론 테스트에서도 속도 위반이 100%에서 4.7%로 떨어졌습니다.

이것이 왜 중요한가

이 논문은 로봇의 성능을 측정하는 방식을 바꿔야 한다고 주장합니다. 로봇이 어떻게 했는지 알아내는 데 너무 오래 걸린다면, 단순히 "로봇이 성공했다"라고 말하는 것만으로는 충분하지 않습니다. 재계획을 엄격한 예산이 있는 시스템 문제로 다룸으로써, 우리는 똑똑할 뿐만 아니라 빠르고 신뢰할 수 있는 로봇을 구축할 수 있습니다.

저자들은 또한 실험실의 실제 로봇 팔(과일을 집거나 물체를 미는 등의 작업 수행)에서도 이를 테스트했습니다. 시뮬레이션 결과가 주요 초점이었지만, 실제 로봇 테스트에서도 동일한 예산 설정 및 가지치기 기술이 작동하여 성공률을 높이고 지연을 줄이는 것을 확인했습니다.

요약하자면, 이 논문은 기억을 조금 더 아끼고 스마트한 편집자를 사용하여 군더더기를 제거함으로써, 로봇이 자신의 역사에 발이 묶이지 않고 세상 속에서 필요한 속도와 민첩성을 가지고 움직일 수 있다고 제안합니다. 이는 때때로 무엇을 기억할지 아는 것만큼이나, 무엇을 기억하지 않을지 아는 것이 중요하다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →