← 최신 논문
🤖 AI

Towards the Harness of Embodied Agents

이 논문은 상태 인식을 위한 지속적인 심볼릭 씬 그래프(symbolic scene graph)와 행동 피드백을 위한 평가 메커니즘을 통합함으로써 코딩 에이전트 패러다임을 물리적 세계로 확장하고, 이를 통해 폐쇄형 에이전틱 루프(closed agentic loop)를 통한 장기 과업의 성공적인 수행을 가능하게 하는 임바디드 에이전트용 하네스인 Thea를 소개한다.

원저자: Qi Wang, Tianyi Wang, Chengyang Li, Shikun Ban, Yurun Chen, Yizhong Ge, Jason Qin, Chengtai Li, Wentao Zhu

게시일 2026-08-13
📖 5 분 읽기🧠 심층 분석

원저자: Qi Wang, Tianyi Wang, Chengyang Li, Shikun Ban, Yurun Chen, Yizhong Ge, Jason Qin, Chengtai Li, Wentao Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 집안일을 가르치려고 노력 중이라고 상상해 보세요. 오랫동안 과학자들은 똑똑한 로봇을 만드는 비결이 단순히 스스로 모든 것을 알아낼 수 있을 만큼 똑똑한 '두뇌'를 구축하는 것이라고 생각했습니다. 하지만 여기에는 함정이 있습니다. 현실 세계는 무질서하고 예측 불가능하며, 비디오 게임처럼 '저장 버튼'이 존재하지 않습니다. 로봇이 컵을 떨어뜨리면, 그 컵은 깨집니다. 로봇이 벽에 부딪히면, 움직일 수 없게 됩니다. 이것이 바로 **체화된 AI(Embodied AI)**의 영역입니다. 즉, 물리적인 몸 안에 살며 현실 세계와 상호작나하는 인공지능을 말합니다.

이 과제를 이해하기 위해, 당신이 컴퓨터를 사용하는 방식을 생각해 보세요. 코드를 작성할 때 실수를 하면, 컴퓨터는 즉시 "Error: Line 5"라고 알려줍니다. 이는 무언가 잘못되었다는 명확한 신호를 주며, 당신은 이를 수정할 수 있습니다. 이것을 **폐쇄 루프(closed loop)**라고 합니다. 당신이 행동하면, 피드백을 받고, 그에 따라 조정하는 것입니다. 디지털 세상에서 이러한 피드백은 무료이며 즉각적입니다. 하지만 물리적 세상에서 로봇은 "잡기 실패(Grasp Failed)"라는 팝업창을 받지 못합니다. 그저 손을 쥐었을 뿐이고, 컵이 떨어졌을 수도 있고, 혹은 아예 잡지 못했을 수도 있습니다. 로봇은 무슨 일이 일어났는지 추측해야 합니다. 이 논문은 다음과 같은 큰 질문을 던집니다. 컴퓨터 프로그래머처럼 세상이 쉬운 답을 주지 않더라도, 자신의 실수를 통해 배울 수 있는 로봇을 만들 수 있을까?


로봇의 "하네스(Harness)": 두뇌를 몸으로 연결하기

**테아(Thea)**를 만나보세요. 이 논문의 저자들은 단순히 더 똑똑한 로봇 두뇌를 만드는 것이 아니라, "하네스(harness, 마구)"를 만들고 있습니다. 하네스를 말의 안장과 고삐라고 생각해보세요. 말(로봇의 몸)은 강하고 기수(AI 두뇌)는 똑똑하지만, 하네스가 없다면 기수는 말을 효과적으로 조종할 수 없습니다. 테아는 바로 그 하레스입니다. 테아는 강력한 AI 모델을 가져와서, 로봇이 학습하고, 실수로부터 회복하며, 길고 복잡한 작업을 완수할 수 있도록 로봇의 몸과 연결해 줍니다.

이 논문은 비결이 단순히 진공 상태에서 AI를 더 "똑똑하게" 만드는 것이 아니라고 제안합니다. 대신, 그 주변에 적절한 인프라를 구축하는 것이 핵심입니다. 저자들은 로봇의 능력(움직이기, 잡기, 보기 등)을 AI가 호출할 수 있는 단순한 "도구"로 감싸고, 그 도구들이 제대로 작동했는지 끊임없이 확인하는 시스템을 만듦으로써, 이전에는 불가능했던 작업들을 수행할 수 있음을 보여줍니다.

두 가지 큰 문제: 세상을 읽는 법과 승리를 아는 법

이 논문은 디지털 세상(코딩 에이전트가 사는 곳)과 물리적 세상(로봇이 사는 곳) 사이의 두 가지 거대한 격차를 식별합니다.

1. 세상은 읽기가 어렵다 (솔루션: "장면 그래프(Scene Graph)")
컴퓨터 프로그램에서 컴퓨터는 모든 파일이 정확히 어디에 있는지 압니다. 전체 "코드베이스"를 한 번에 읽을 수 있죠. 하지만 로봇은 카메라를 통해 빨대로 보는 것처럼 세상의 아주 작은 단면만을 봅니다. 컵을 잠시 보았다가, 고개를 돌리면 테이블을 보게 됩니다. 로봇이 스스로 기록하지 않는 한, 컵이 어디에 있었는지 기억하지 못합니다.

  • 해결책: 테아는 **장면 그래프(Scene Graph)**를 구축합니다. 이것을 로봇이 들고 다니는 지속적이고 마법 같은 노트라고 상상해 보세요. 로봇이 무언가를 볼 때마다 노트에 기록합니다: "컵은 테이블 위, 램프 근처에 있음." 설령 로봇이 고개를 돌리더라도, 노트는 그것을 기억합니다. 이는 혼란스럽고 흐릿한 세상을 AI가 코드처럼 이해할 수 있는 명확하고 읽기 쉬운 지도로 바꿔줍니다.

2. 세상은 "종료 코드(Exit Codes)"를 주지 않는다 (솔루션: "평가자(Evaluator)")
컴퓨터 프로그램이 실행되면, 프로그램은 종료되면서 "성공(Success)" 또는 "오류(Error)"를 출력합니다. 하지만 로봇이 병을 집으려고 시도할 때, "성공"이라는 신호를 받지는 못합니다. 그저 계속 움직일 뿐이죠. 로봇은 자신이 실제로 병을 잡았는지, 아니면 그냥 허공을 쥐었는지 어떻게 알 수 있을까요?

  • 해결책: 테아는 **평가자(Evaluator)**를 도입합니다. 이것은 로봇 바로 옆에 서 있는 엄격한 심판과 같습니다. 로봇이 무언가를 잡으려고 시도한 후, 평가자는 결과를 보고 "놓쳤습니다", "잡긴 했지만 미끄러졌습니다", 또는 "잘했습니다!"라고 말합니다. 이는 물리적 세상에 결여된 "종료 코드" 역할을 합니다. 만약 로봇이 실패한다면, 평가자는 단순히 "아니오"라고 말하는 데 그치지 않고, 실패했는지(예: "너무 멀리 있었습니다")를 설명하여 로봇이 더 나은 계획으로 다시 시도할 수 있게 합니다.

작동 방식: 학습의 루프

마법은 루프 속에서 일어납니다. AI는 자신의 "노트(장면 그래프)"를 살펴보고, 무엇을 할지 결정한 뒤, "컵 잡기"와 같은 도구를 선택합니다. 로봇이 이를 실행합니다. 그다음, 평가자가 결과를 확인합니다.

  • 성공하면: 로봇은 노트를 업데이트하고 다음 단계로 넘어갑니다.
  • 실패하면: 평가자가 이유를 알려줍니다. AI는 그 이유를 읽고, 계획을 수정하여 다시 시도합니다.

단순해 보일 수 있지만, 이것은 모든 것을 바꿉니다. 논문은 이 루프가 없다면, 만약 로봇이 10단계를 거쳐야 하는 작업을 수행할 때 각 단계의 성공 확률이 85%라면, 전체 작업을 완수할 확률은 매우 낮아진다는 점을 보여줍니다(20% 미만). 하지만 이 하네스가 있다면, 로봇이 실패했을 때 성공할 때까지 반복합니다. 갑자기 전체 작업을 완수할 확률이 90% 이상으로 치솟습니다.

연구 결과 (그리고 한계점)

연구진은 세 가지 다른 로봇(휠 기반 휴머노이드 Astribot S1, 이동형 암 AgileX Cobot Magic, 그리고 정교한 손을 가진 소형 로봇 Unitree G1)을 대상으로 테아를 테스트했습니다. 그들에게 물건 하나를 집는 것부터 방을 가로질러 이동하기, 지저집한 캐비닛에서 특정 아이템 찾기, 그리고 그것을 다른 테이블로 옮기기까지 다양한 과제를 부여했습니다.

  • 결과: 테아는 모든 테스트에서 가장 성공적인 시스템이었습니다. 과제가 더 어렵고 길어질수록, 이 "하네스(평가자 포함)"가 없는 다른 시스템들은 실패하기 시작했고 회복하지 못했습니다. 그러나 테아는 계속 시도하고, 위치를 조정하며, 막혔을 때 도움을 요청했습니다.
  • "능동적 지각(Active Perception)": 한 데모에서 로봇은 보조 배터리를 찾으라는 명령을 받았습니다. 배터리는 테이블 위에 없었습니다. 대신, 로봇은 자신의 "노트"를 사용하여 캐비닛을 확인하지 않았음을 깨달았습니다. 로봇은 캐비닛으로 가서 서랍을 열고 아이템을 찾아냈습니다. 단순히 스크립트를 따르는 것이 아니라, 새로운 곳을 찾아봐야 한다는 것을 스스로 알아낸 것입니다.
  • "종료 코드"의 정확도: 평가자는 성공 또는 실패를 판단하는 데 매우 뛰어났으며, 약 93%의 정확도를 보였습니다. 논문은 이 높은 정확도가 매우 중요하다고 언급합니다. 만약 심판이 너무 자주 틀린다면 로봇은 혼란에 빠지기 때문입니다.

이것이 왜 중요한가

이 논문은 우리가 결코 실수를 하지 않는 "초지능적" 로봇 두뇌를 기다릴 필요가 없다고 제안합니다. 대신, 우리는 실수를 하고, 그로부터 배우고, 회복할 수 있는 시스템을 구축할 수 있습니다. "하네스"가 핵심입니다. 하네스는 서로 다른 로봇의 몸이 동일한 똑똑한 두뇌를 사용할 수 있게 해주며, 동일한 두뇌가 서로 다른 로봇에서 작동할 수 있게 해줍니다.

저자들은 이것이 완벽하게 완성된 제품이 아니라는 점을 분명히 합니다. "노트(장면 그래프)"는 아직 완벽하지 않으며, 때때로 사물의 위치를 헷-갈려 하기도 합니다. "심판(평가자)"도 100% 정확하지 않습니다. 또한 로봇은 매 동작마다 언어 모델을 통해 생각해야 하기 때문에 여전히 다소 느립니다. 하지만 방향은 명확합니다. AI 주변에 적절한 인프라를 구축함으로써, 우리는 서툰 로봇을 우리의 무질서한 실제 가정집을 누빌 수 있는 믿음직한 조력자로 바꿀 수 있습니다. 로봇 공학의 미래는 단순히 더 나은 두뇌를 만드는 것이 아니라, 더 나은 하네스를 만드는 것에 달려 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →