← 최신 논문
🤖 AI

A Few Words Go a Long Way: Language Guided Robot Policy Synthesis

이 논문은 LLM 코딩 에이전트를 활용하여 반복적인 자연어 수정을 통해 모듈식의 해석 가능한 로봇 정책을 합성함으로써, 복잡하고 장기적인 조작 작업에서 블랙박스 형태의 시각-언어-행동 모델보다 뛰어난 성능을 발휘하는 지속 가능한 기술 라이브러리를 가능하게 하는 프레임워크인 ARCHITECT를 소개한다.

원저자: Daphne Chen, Archit Ritesh Jain, Eric Goossen, Emma Romig, Michael Murray, Nick Walker, Maya Cakmak

게시일 2026-07-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daphne Chen, Archit Ritesh Jain, Eric Goossen, Emma Romig, Michael Murray, Nick Walker, Maya Cakmak

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 옷을 접거나 서랍을 닫는 것과 같은 집안일을 가르치려 한다고 상상해 보세요. 로봇 공학의 세계에는 이를 수행하는 두 가지 주요 방법이 있습니다. 첫 번째 방법은 강아지를 훈련시키는 것과 같습니다. 당신은 로봇에게 사람이 과업을 수행하는 수천 개의 영상을 보여주고, 로봇은 그 패턴을 암기하려고 노력합니다. 이것을 "데이터로부터의 학습(learning from data)"이라고 하며, 많은 현대적 로봇이 작동하는 방식입니다. 하지만 여기에는 함정이 있습니다. 만약 로봇이 색깔이 다른 옷이나 약간 뻑뻑한 서랍처럼 조금이라도 다른 상황을 마주하게 되면, 로봇은 종종 혼란에 빠져 실패하게 됩니다. 그리고 로봇의 뇌가 "블랙박스(미스터리)"이기 때문에 왜 실패했는지 아무도 알 수 없습니다. 두 번째 방법은 사람에게 레시피를 주는 것과 같습니다. 당신은 "컵을 집는다", "테이블로 이동한다", "놓는다"와 같이 구체적인 단계들을 작성합니다. 이것을 "프로그램 합성(program synthesis)"이라고 합니다. 이는 명확하고 논리적이지만, 만약 레시ys가 약간이라도 틀리면 로봇은 여전히 무언가에 부딪힐 수 있으며, 당신은 처음부터 레시피를 다시 작성해야 합니다.

과학자들이 던지는 핵심 질문은 이것입니다. 우리는 두 세계의 장점을 결합할 수 있을까? 우리가 언어를 이해하고, 명확한 지시를 따르며, 처음부터 다시 재학습할 필요 없이 실시간으로 우리의 실수를 통해 배울 수 있는 로봇을 만들 수 있을까? 이것이 바로 로봇을 단순히 똑똑하게 만드는 것을 넘어, '조종 가능하게(steerable)'—즉, 우리가 친구를 이끌 듯이 잘못했을 때 쉽게 가이드할 수 있게—만드는 도전 과제입니다.


당신의 말을 배우는 "로봇 설계자"

워싱턴 대학교, 마이크로소프트 리서치, MIT의 연구진이 개발한 새로운 로봇 뇌인 ARCHITECT를 만나보세요. ARCHITECT를 수백만 개의 영상을 암기하는 로봇이 아니라, 스스로 실행 지침(instruction manual)을 즉석에서 만들어내는 초스마트 로봇 설계자라고 생각하십시오.

ARCHITECT는 수많은 사진을 보고 무엇을 할지 추측하는 대신, 로봇의 과업을 컴퓨터 프로그램을 작성하는 것처럼 취급합니다. 당신이 로봇에게 "수건을 접어줘"라고 말하면, 로봇은 단순히 추측하는 것이 아니라 이미 알고 있는 구성 요소들(예: "잡기", "이동하기", "보기")을 사용하여 단계별로 작은 코드 조각을 작성합니다.

여기 마법 같은 기술이 있습니다: 만약 로봇이 실수하더라도, 당신은 로봇을 다시 재학습시킬 필요가 없습니다. 그저 대화하면 됩니다.

당신이 로봇에게 서랍을 닫는 법을 가르치고 있다고 상상해 봅시다.

  1. 시도: 로봇이 계획을 작성하고 서랍을 밀려고 합니다.
  2. 실패: 로봇이 밀었지만, 서랍이 걸려 있거나 너무 세게 밀어서 로봇 팔이 흔들립니다.
  3. 교정: 당신이 말합니다. "이봐, 서랍이 걸렸어. 앞쪽이 아니라 옆쪽에서 부드럽게 밀어봐."
  4. 수정: ARCHITECT는 단 한 번만 고치는 것이 아닙니다. 그것은 해당 단계에 대한 코드를 다시 작성하고, 새로운 규칙을 자신의 **기술 라이브러리(Skill Library)**에 저장하며, 이를 영원히 기억합니다.

기술 라이브러리는 로봇을 위한 영구적인 노트와 같습니다. 당신이 교정을 해줄 때마다 로봇은 자신의 노트에 새로운 "기술"을 기록합니다. 다음에 유사한 문제에 직면하면, 로봇은 먼저 자신의 노트를 확인합니다. 이는 마치 매번 당신이 고쳐주는 실수를 통해 배우며, 매일 더 똑똑해지고 더 적은 교정을 필요로 하는 로봇을 갖는 것과 같습니다.

이것이 왜 중요한가

연구진은 이 기술을 실제 로봇 팔(Franka Panda)을 사용하여 천 접기, 서랍 닫기, 천 아래 숨겨진 바나나 집기 등 8가지 까다로운 과업에 대해 테스트했습니다.

그들은 ARCHITECT를 현재의 "스타" 로봇 학습 모델들(π0\pi0π0.5\pi0.5라 불리는 모델들) 및 다른 코딩 방식들과 비교했습니다. 결과는 명확했습니다:

  • 블랙박스 모델의 실패: 최상위 AI 모델들은 종-종 막혔습니다. 예를 들어, 천을 접으라는 요청을 받았을 때, 천을 들어 올리기만 하고 접는 데 실패하거나, 문장의 표현이 바뀌면 혼란에 빠질 수 있습니다. 그들은 가장 어려운 과업에서 약 **0%에서 40%**의 확률로 실패했습니다.
  • ARCHITECT의 성공: ARCHITECT는 인간의 도움을 받아 과업의 **80%에서 100%**를 성공시켰습니다. 까다로운 천 접기와 숨겨진 바나나 문제도 훨씬 더 잘 처리했습니다.

하지만 진짜 마법은 **노력(effort)**을 살펴보았을 때 나타났습니다.

  • 처음에 로봇은 과업을 제대로 수행하기 위해 인간으로부터 약 4.7번의 교정이 필요했습니다.
  • 하지만 로봇이 이전 과업들로부터 기술 라이브러리를 구축한 후에는, 새로운 유사 과업에 대해 단 0.8번의 교정만을 필요로 했습니다. 실제로 연구에 참여한 6명 중 3명은 로봇이 첫 번째 과업에서 이미 요령을 배웠기 때문에 두 번째 과업에서는 교정을 전혀 줄 필요가 없었습니다.

로봇이 아직 할 수 없는 것 (현재)

논문은 ARCHITECT가 완벽하지 않다는 점을 신중하게 지적합니다. ARCHITECT는 카메라(눈)나 그리퍼(손)와 같은 자신이 가진 "도구"에 의존합니다. 만약 카메라가 잘 보이지 않거나, 로봇의 손이 미끄러운 공을 잡기에 너무 서투르다면 ARCHITECT는 여전히 어려움을 겪을 수 있습니다. 연구진은 로봇의 가장 큰 실패 지점이 물체를 잡는 것임을 발견했습니다. 즉, 로봇이 처음에 물체를 제대로 잡지 못한다면, 어떤 대화로도 이를 해결할 수 없었습니다.

또한, 로봇은 인간의 도움이 필요합니다. 스스로 모든 문제를 해결할 수는 없습니다. 연구에 따르면 인간이 단 한 번의 교정만 준다면, 로봇이 새로운 상황을 다룰 만큼 충분히 배우지 못할 수도 있습니다. 강력한 "노트"를 구축하기 위해서는 몇 번의 좋은 교정이 필요합니다.

결론

이 논문은 로봇의 미래가 수백만 개의 영상을 먹여서 암기하게 하는 것이 아닐 수도 있음을 시사합니다. 대신, 그것은 대화에 관한 것일 수 있습니다. 로봇 제어를 코드 작성처럼 취급하고 인간이 간단한 말로 실수를 바로잡게 함으로써, 우리는 다음과 같은 로봇을 만들 수 있습니다:

  1. 해석 가능성(Interpretable): 로봇이 스스로 계획을 작성하기 때문에 우리는 그들이 무엇을 하고 있는지 정확히 알 수 있습니다.
  2. 적응성(Adaptable): 값비싼 재학습 없이도 새로운 기술을 배울 수 있습니다.
  3. 효율성(Efficient): 우리가 건네는 말 한마당에 따라 점점 더 나아집니다.

저자들이 말했듯, "몇 마디의 말이 큰 차이를 만듭니다." ARCHITECT를 통해 오늘 건네는 간단한 교정은 내일의 몇 시간의 수고를 덜어줄 수 있으며, 서툰 로봇을 진정으로 경청하는 유능한 파트너로 변화시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →