← 최신 논문
💻 computer science

RHO: Your Coding Agent is Secretly a Roboticist

이 논문은 도구 사용이 가능한 코딩 에이전트가 환경 피드백을 통해 해석 가능한 다중 파일 신경 기호 정책 저장소를 탐색하도록 하는 새로운 훈련 패러다임인 로보틱스 하네스 최적화(Robotics Harness Optimization, RHO)를 소개하며, 이는 실시간 로보틱스 작업에서 기존의 다회차 에이전트 시스템보다 뛰어난 효율성과 최첨단 성능을 달성한다.

원저자: Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 컵을 집어 테이블 위에 놓는 법을 가르치려 한다고 상상해 보세요.

과거의 방식: "즉석에서 수정하는" 프로그래머
이전에는 이 작업을 수행하기 위해 초지능형 AI(대규모 언语言 모델)가 다급한 프로그래머 역할을 하는 것이 최선이었습니다. 로봇이 컵을 떨어뜨리거나 테이블을 놓칠 때마다, AI는 동작을 멈추고, 생각하고, 실수를 고치기 위해 새로운 코드를 작성한 다음 다시 시도했습니다. 이것은 마치 요리사가 수프 맛을 본 뒤 소금이 부족하다는 것을 깨닫고, 요리를 멈춘 뒤, 새로운 레시피를 쓰고, 처음부터 다시 시작하는 것과 같습니다. 작동은 하지만, 느리고 번거로우며, AI가 자신의 지침을 다시 작성하느라 계속 멈춰 서야 하기 때문에 로봇이 실세계에서 유용하게 쓰일 만큼 빠르게 움직일 수 없습니다.

새로운 방식: RHO ("사전 준비" 코치)
이 논문은 RHO(Robotics Harness Optimization)를 소개합니다. RHO는 로봇이 움직이는 동안 AI가 코드를 작성하게 두는 대신, 훈련(training) 단계에서 엄격하고 성찰적인 코치 역할을 합니다.

RHO가 어떻게 작동하는지 다음과 같은 간단한 비유를 통해 설명하겠습니다.

1. "리포지토리(Repository)" (단순한 메모가 아닌 전체 도구 상자)

대부분의 AI 시스템은 문장 하나를 수정하거나 작은 함수 하나를 조정(예: 레시피에서 재료 하나를 바꾸는 것)하여 로봇을 고치려고 합니다. RHO는 다릅니다. RHO는 로봇의 두뇌를 하나의 파일 라이브러리 전체(리포지토리)로 취급합니다.

  • 비유: 로봇의 두뇌가 단순히 지침이 적힌 포스트잇이 아니라, 매뉴얼, 도구 세트, 안전 체크리스트, 내비게이션 지도가 갖춰진 전체 작업실이라고 상상해 보세요. RHO는 단순히 포스트잇을 수정하는 것이 아니라, 작업실 전체를 재구성하고, 도구를 교체하며, 매뉴얼 전체를 한꺼번에 다시 씁니다.

2. "도구 사용 에이전트" (실제로 만들 수 있는 견습생)

RHO는 단순한 텍스트 생성기가 아닌 특별한 AI 에이전트를 사용합니다. 이는 손이 달린 코딩 에이전트입니다.

  • 비유: 이 에이전트는 로봇을 어떻게 고칠지 말로만 설명하는 것이 아니라, 실제로 로봇의 코드 파일을 열고, 테스트를 실행하고, 로봇의 "비디오 피드"를 통해 무엇이 잘못되었는지 확인하고, 에러 로그를 점검한 뒤 실제로 코드를 다시 작성할 수 있습니다. 이는 매뉴얼을 읽고, 렌치를 집어 들고, 엔진을 고친 뒤, 직접 시운전까지 해보는 견습생과 같습니다.

3. "진화적 탐색" (적자생존)

RHO는 단 하나의 해결책만 시도하지 않습니다. RHO는 진화적 과정을 실행합니다.

  • 비유: 토너먼트를 상상해 보세요. AI는 로봇의 "두뇌"(서로 다른 코드 리포지토리)를 100가지 버전으로 만듭니다. 그리고 이들을 시뮬레이션에 투입하여 과제를 수행하게 합니다.
    • 어떤 버전은 처참하게 실패합니다.
    • 어떤 버전은 적당히 해냅니다.
    • 몇몇 버전은 아주 훌륭하게 수행합니다.
    • AI는 "승자"들을 골라 그들의 장점만을 결합하여 새로운 세대의 100개 로봇을 만들어냅니다. 이 과정을 수백 번 반복합니다.
    • 결정적으로, RHO는 "파레토 프런티어(Pareto Frontier)"를 유지합니다. 즉, 모든 면에서 가장 뛰어난 로봇 하나만을 남기는 것이 아니라, 특정 작업에 가장 특화된 로봇을 남깁니다. 이는 로봇이 다른 일에는 서툴더라도, 현재 맡은 특정 작업만큼은 전문가가 되도록 보장합니다.

4. 결과: "즉시 배포 가능한" 로봇

훈련이 끝나면, RHO는 단 하나의 완벽한 "리포토리"(완성된 코드 파일 세트)를 생성합니다.

  • 마법 같은 점: 이 로봇을 실제 환경에 배치했을 때, 더 이상 AI의 사고 과정이 필요하지 않습니다. 로-봇은 멈춰서 코드를 작성할 필요가 없습니다. 이미 작성된, 고도로 최적화된 코드를 실행하기만 하면 됩니다.
  • 비유: 시험을 치르는 동안 모든 수학 공식을 찾아봐야 하는 학생과, 이미 공식을 암기하고 수천 문제를 연습하여 준비가 된 학생의 차이와 같습니다. RHO 로봇은 "숙제"(훈련) 단계에서 이미 힘든 일을 모두 마쳤기에, "시험"(배포) 단계에서 즉시 완벽하게 수행할 준비가 된 학생입니다.

실제로 무엇을 달성했는가?

논문은 이 방법이 현재의 최첨단 기술(state-of-the-art)보다 훨씬 뛰어나다고 주장합니다.

  • 속도 및 신뢰성: 블록 쌓기나 물체 이동과 같은 표준 로봇 벤치마크에서, RHO는 단 한 번의 빠른 실행만으로 70%의 성공률을 기록했습니다. AI가 끊임없이 멈춰서 코드를 다시 써야 했던 이전의 최고 방식은 훨씬 느리면서도 **68%**의 성공률을 보였습니다.
  • 혼돈 대응 능력: 연구진이 규칙을 변경했을 때(예: 물체의 위치를 바꾸거나 작업 설명을 변경함), 다른 AI 모델들(OpenVLA 등)은 완전히 실패(성공률 0%)했습니다. 반면 RHO는 여전히 **45%**의 성공률을 유지했습니다.
  • 효율성: 더 복잡한 실제 시뮬레이션 환경에서, RHO는 로봇이 "생각"하는 시간을 20% 줄였고, 호출해야 하는 도구의 수를 27% 줄였음에도 불구하고 성공률을 두 배로 높였습니다.

핵심 요약

RHO는 무거운 작업의 중심을 배포(로봇이 작동 중일 때)에서 훈련(로봇이 학습할 때)으로 옮김으로써 게임의 판도를 바꿉니다. RHO는 똑똑하고 도구를 자유자재로 사용하는 AI를 사용하여, 견고하고 해석 가능하며(인간이 읽을 수 있는 코드), 실행 시 별도의 사고 과정 없이 즉시 구동될 수 있는 완전한 다중 파일 코드 라이브러리를 진화시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →