← 최신 논문
💻 computer science

Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation

이 논문은 최소한의 인터페이스를 갖춘 범용 에이전트 제어를 활용하는 제로샷 임바디드 에이전트가 시각-언어 내비게이션에서 최대 78%의 성공률을 달성하며 산업 규모의 정책에 필적할 수 있음을 입증하며, 특정 소프트웨어 하네스보다 모델 선택이 성능의 주요 동인임을 강조한다.

원저자: Jian Zhou, Xunyi Zhao, Gengze Zhou, Zerui Li, Sihao Lin, Jiajun Liu, Qi Wu

게시일 2026-07-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jian Zhou, Xunyi Zhao, Gengze Zhou, Zerui Li, Sihao Lin, Jiajun Liu, Qi Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 토스터가 단순히 빵을 굽는 것을 넘어, 어떤 조각을 구울지 결정하고, 주방이 깨끗한지 확인하며, 집을 태워 먹지 않고 어떻게 식탁까지 빵을 가져갈지 고민할 수 있는 세상을 상상해 보십시오. 이것이 바로 **체화된 인공지능(Embodied AI)**의 꿈입니다. 즉, 컴퓨터에 물리적인 몸(로봇과 같은)을 주고 실세계를 스스로 탐색할 수 있는 두뇌를 부여하는 것입니다. 오랫동안 과학자들은 로봇에게 개를 훈련시키듯 "훈련"시키거나(성공할 때까지 같은 작업을 수천 번 반복하게 함), 혹은 인간이 작성한 엄격한 "대본"(예: "문이 보이면 열어라"와 같은 규칙 목록)을 제공하는 방식으로 이들을 가르치려 노력해 왔습니다. 하지만 만약 우리가 아주 똑똑한 컴퓨터에게 카메라 한 대와 몇 개의 기본적인 버튼만 주고, "주방을 찾아가라"고 말한 뒤 나머지는 알아서 해결하도록 내버려 둔다면 어떨까요? 이것이 바로 이 논문이 던지는 핵심 질문입니다. 특수한 로봇 훈련을 받지 않은 범용 AI가 직접 운전대를 잡고 집 안을 누빌 수 있을까요?

이 연구의 연구진은 디지털 로봇을 이용해 시뮬레이션된 집 안에서 이 아이디어를 테스트하기로 했습니다. 그들은 내비게이션에 사용되는 모든 화려한 도구들—지도, GPS, 미리 프로그래밍된 경로, 혹은 특수한 "로봇 두뇌" 훈련—을 모두 제거했습니다. 대신, 그들은 AI에게 정면만을 바라보는 단 하나의 카메라(마치 사람이 외시경을 통해 보는 것과 같은 방식)와 네 가지 단순한 명령어(앞으로 이동, 왼쪽으로 회전, 오른쪽으로 회전, 정지)를 건네주었습니다. 그러고 나서 AI에게 "수영장을 지나 바와 의자 사이를 지나 코너에서 멈춰라"와 같은 복잡한 음성 지시를 따르도록 요청했습니다. 목표는 AI가 인간의 도움 없이 관찰하고, 생각하고, 행동하며, 스스로의 실수를 바로잡는 진정한 "에이전트(agent)", 즉 의사 결정자가 될 수 있는지 확인하는 것이었습니다.

결과는 놀라울 정도로 흥미로우면서도 겸허하게 만들었습니다. 연구팀은 이러한 "제로샷(zero-shot)" 에이전트들(로봇을 본 적이 없는 상태인 에이전트들)이 실제로 꽤 잘 길을 찾을 수 있다는 것을 발견했습니다. fable-5라는 강력한 AI 모델을 사용했을 때, 로봇은 지도나 특수한 훈련 없이도 표준 테스트에서 목표 지점에 **78%**의 확률로 성공적으로 도달했습니다. 이는 수백만 개의 사례를 학습한 값비싼 산업용 로봇의 성능과 맞먹는 수준이기에 매우 놀라운 일입니다. 이는 특수한 소프트웨어가 아니라, "두뇌" 자체가 대부분의 핵심적인 역할을 수행하고 있음을 시사합니다.

하지만 이 논문은 또한 명확한 한계선도 긋고 있습니다. AI는 짧은 거리의 이동에는 뛰어나지만, 여정이 길어지면 비틀거리기 시작합니다. 만약 작업이 여러 방을 통과해야 하거나 5분 전의 위치를 기억해야 하는 경우, 성공률은 26%에서 39% 사이로 급격히 떨어집니다. AI는 자신이 본 모든 것을 기억해야 하기 때문에 혼란을 겪으며, 그 "기억"이 너무 과부하되기 때문입니다. 더욱이, 연구진이 이 기술을 실제 물리적인 로봇 개에 적용했을 때, AI는 완벽하게 추론했지만 자신의 몸이 공간을 얼마나 차지하는지 이해하지 못해 계속 벽에 부딪혔습니다. AI는 어디로 가야 할지는 알았지만, 문을 어떻게 통과해야 하는지는 몰랐던 것입니다.

결국, 이 논문은 우리가 새로운 시대의 문턱에 서 있음을 시사합니다. 우리는 매 작업마다 새로운 특수 로봇 두뇌를 만들 필요가 없을지도 모릅니다. 대신, 기존의 초지능형 AI가 자신의 기억을 관리하고 물리적 신체를 이해할 수 있는 적절한 도구를 갖추게 함으로써 그들이 직접 제어권을 갖도록 하면 됩니다. 이는 당신의 로봇이 단순히 명령을 따르는 것을 넘어, 자신의 모험을 스스로 주도하게 될 날을 향한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →