← 최신 논문
💻 computer science

Ludi0.1{}_{\scriptscriptstyle 0.1}: An Agentic System for Socially Intelligent Robots

이 논문은 맥락 인식 추론과 적응형 행동을 통해 사회적으로 지능적인 로봇이 모호하고 다회차에 걸친 인간과의 상호작용을 처리할 수 있도록, 미세 조정된 시각-언어 모델과 특화된 내비게이션 및 조작 도구를 결합한 에이전트 시스템인 Ludi0.1{}_{\scriptscriptstyle 0.1}를 소개한다.

원저자: Wooseong Chung, William Cong, Jakub Dworakowski, Ethan Ewer, Tri Wahyu Guntara, Yeonwoo Jeong, Tianchong Jiang, Chaewon Kim, Hyunseo Kim, Jinwoo Kim, Jinyeon Kim, Yea-Seul Kim, Jack Kunde, Kangwook Le
게시일 2026-08-25
📖 5 분 읽기🧠 심층 분석

원저자: Wooseong Chung, William Cong, Jakub Dworakowski, Ethan Ewer, Tri Wahyu Guntara, Yeonwoo Jeong, Tianchong Jiang, Chaewon Kim, Hyunseo Kim, Jinwoo Kim, Jinyeon Kim, Yea-Seul Kim, Jack Kunde, Kangwook Lee, Sangheon Lee, Robert Nowak, Junha Roh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수십 년 동안 도움이 되는 로봇에 대한 꿈은 단순한 현실에 의해 제한되어 왔습니다. 즉, 기계는 엄격한 지시를 따르는 데는 탁월하지만, 인간 대화의 복잡하고 변화무쌍한 본질을 이해하는 데는 서툴다는 점입니다. 만약 당신이 전통적인 로봇에게 "빨간색 캔을 가져다줘"라고 말한다면, 그 로봇은 빨간색 캔을 찾아 가져오겠지만, 그 과정 도중에 당신이 마음을 바꾼다 하더라도 이를 인지하지 못합니다. 이 로봇은 자신의 의도가 진화했음을 깨닫고, 동작을 멈추고, 새로운 정보에 기반하여 행동을 조정할 수 있는 사회적 지능이 부족합니다. 이러한 경직된 프로그래밍과 유동적인 인간 상호작용 사이의 간극은 현재 연구자들이 해결하려고 노력 중인 핵심 과제입니다. 분야의 목표는 단순히 로봇에게 보고 움직이는 법을 가르치는 것을 넘어, 사람들이 함께 협업할 때처럼 로봇이 실시간으로 듣고, 기억하고, 추론하며, 마음을 바꿀 수 있도록 가르치는 것으로 이동하고 있습니다.

Ludo Robotics의 한 팀은 Ludi0.1이라는 새로운 시스템을 통해 이 목표를 향한 중요한 발걸음을 내디뎠습니다. 이것은 모든 것을 한 번에 처리하려고 시도하는 단일 소프트웨어가 아니라, 중앙의 '두뇌'의 안내 아래 협력하는 일련의 전문화된 도구들로 구성된 조율된 팀입니다. 이 두뇌는 이미지와 언어를 모두 이해하도록 훈련된 인공지능의 일종이지만, 특히 실제 대화의 주고받는 과정을 처리하도록 학습되었습니다. 연구진은 이 두뇌가 자신이 보는 것을 보고, 사람이 말하는 것을 들으며, 방금 일어난 일을 기억하고, 그 후에 말할지, 움직일지, 물건을 집을지, 아니면 기다릴지를 결정할 수 있는 시스템을 구축했습니다. 핵심적인 혁신은 이 시스템이 방해와 수정을 처리하도록 설계되었다는 점입니다. 만약 어떤 사람이 콜라를 달라고 요청하기 시작하여 로봇이 그것을 향해 손을 뻗고 있는데, 갑자기 사람이 "사실, 그녀는 펩시를 더 좋아해"라고 말한다면, Ludi0.1은 기존의 계획이 더 이상 유효하지 않다는 것을 이해합니다. 로봇은 콜라를 향한 손길을 멈추고, 펩시에 집중을 전환하며, 새로운 지침에 따라 상호작용의 흐름을 깨뜨리지 않고 작업을 계속합니다.

이를 구축하기 위해 연구진은 처음부터 모든 것을 배우려고 시도하는 하나의 거대한 모델에 의존하지 않았습니다. 대신, 중앙의 추론 모델이 관리자 역할을 하는 구조를 만들었습니다. 이 관리자는 정보의 흐름을 받습니다: 로봇의 눈으로부터 오는 실시간 비디오 피드, 사람이 방금 말한 텍스트, 그리고 로봇이 지금까지 수행했거나 생각했던 모든 기록입니다. 이 전체 그림을 바탕으로 관리자는 다음에 사용할 도구를 결정합니다. 이 도구들은 특정 작업에 특화된 프로그램들로, 예를 들어 물체가 팔이 닿는 거리 안에 있는지 확인하거나, 침실과 같은 이름이 붙은 방으로 이동하거나, 실제로 물체를 잡는 등의 역할을 합니다. 관리자는 명확한 질문을 던지기로 결정할 수도 있고, 책상으로 걸어가기로 결정할 수도 있습니다. 결정적으로, 이 시스템은 로봇에 연결된 현장 GPU 워크스테이션에서 로컬로 실행되도록 구축되었습니다. 이는 로봇이 생각하거나 행동하는 동안 인터넷 연결을 기다릴 필요가 없음을 의미합니다. 덕분에 로봇은 말하거나 움직이는 도중에도 즉각적으로 반응할 수 있습니다.

팀은 사람처럼 서고 걷는 휴머노이드 로봇인 Unitree G1을 통해 이 시스템을 테스트했습니다. 그들은 로봇을 훈련시키기 위해 가정 환경 시뮬레이션을 생성하여 수천 개의 복잡한 상호작용 사례를 만들어냈습니다. 이러한 훈련 시나리오에서 로봇은 모호한 요청을 처리하고, 작업 도중의 수정 사항을 다루며, 다단계 심부름을 관리하는 연습을 했습니다. 예를 들어, 로봇은 사용자가 "가운데 있는 노트북을 가져와"라고 말하면, 물건을 집기 전에 먼저 장면을 살펴서 어떤 노트북이 가운데에 있는지 식별해야 한다는 것을 배웠습니다. 훈련 데이터에는 사용자가 마음을 바꾸거나, 로봇을 방해하거나, 로봇이 이미 행동하는 도중에 새로운 정보를 제공하는 상황이 포함되었습니다. 연구진은 이러한 특정 상호작용 패턴에 맞춰 중앙 추론 모델을 미세 조정함으로써, 로봇이 작업을 훨씬 더 성공적으로 완수하게 된다는 것을 발견했습니다. 테스트 결과, 시스템은 28개의 복잡한 시나리오 중 20개를 엔드 투 엔드(end-to-end)로 완료했으며, 이는 훈련되지 않은 동일 모델보다 크게 향상된 수치입니다.

Ludi0.1의 성공은 대화와 물리적 행동을 동일한 현실에 접지(grounding)시키는 능력에 있습니다. 로봇은 단순히 단어를 내뱉는 것이 아니라, 자신이 보고 있는 것과 하고 있는 것에 직접 연결된 단어를 말합니다. 만약 로봇이 어떤 방으로 이동하고 있다면, 자신이 어디로 가고 있는지 설명할 수 있습니다. 만약 물체에 손이 닿지 않는다면, 정직하게 말할 수 있습니다. 시스템은 상호작용의 공유된 이력을 유지하여, 사용자가 원래 콜라를 원했지만 펩시로 바꿨다는 사실을 기억할 수 있게 합니다. 이 기억은 단순한 사실의 목록이 아니라, 로봇이 내리는 모든 새로운 결정을 형성하는 살아있는 맥락입니다. 연구진은 사용자가 침실에 있는 사람에게 음료를 가져다 달라고 요청했을 때, 로봇이 첫 번째 캔을 향해 손을 뻗는 도중에 사용자가 주문을 콜라에서 펩시로 정정하는 실제 환경 테스트를 통해 이를 입증했습니다. 로봇은 즉시 멈추고, 올바른 음료로 전환하여, 침실로 이동한 뒤, 책상 위에 음료를 놓으면서 동시에 사용자에게 자신의 행동을 설명했습니다.

시스템이 인상적이긴 하지만, 연구진은 현재의 한계를 명확히 밝히고 있습니다. 로봇의 지능은 중앙의 두뇌와 별도의 전문화된 도구들의 조합입니다. 두뇌는 무엇을 할지 결정하고 도구는 작업을 수행하지만, 이들은 아직 하나의 통합된 정신은 아닙니다. 이러한 분리는 때때로 지연을 일으키거나, 마치 시스템의 서로 다른 부분들이 하나의 개체로서 행동하기보다는 서로에게 말을 거는 것처럼 느껴지게 하여 행동을 다소 파편화되게 만들 수 있습니다. 팀은 다음 단계로 이 모듈형 접근 방식을 넘어서는 것을 목표로 하고 있습니다. 그들은 지각, 언어, 기억, 그리고 물리적 제어를 하나의 응집된 시스템으로 깊이 통합하는 단일 파운데이션 모델인 차세대 버전, Ludi 1.0을 향해 나아가고 있습니다. 현재로서는 Ludi0.1이 작동 가능한 프로토타입이자 귀중한 데이터의 원천 역할을 하고 있습니다. 로봇이 사람과 어떻게 상호작용하는지 관찰함으로써, 연구진은 차세대 진정한 통합 사회적 로봇을 훈련하는 데 필요한 실제 세계의 흔적들을 수집하고 있습니다.

이 논문에서 제시된 연구는 시스템이 인간 의도의 예측 불가능성을 처리하도록 설계된다면, 유동적인 인간-로봇 협업이 오늘날에도 가능하다는 것을 보여줍니다. 연구진은 추론 핵심체와 특화된 물리적 기술, 그리고 견고한 상호작용 기억을 결합함으로써, 로봇이 작업 도중의 변화에 적응할 수 있음을 보여주었습니다. 이것은 해결된 문제는 아니며, 현재의 시스템은 완전히 학습된 통합 지능보다는 구조화된 아키텍처에 여전히 의존하고 있습니다. 그러나 결과는 명확한 경로를 제시합니다. 멈추고, 듣고, 수정하고, 계속하는 능력은 더 이상 이론적인 개념이 아니라, 지금 바로 구축하고 테스트할 수 있는 역량입니다. 팀이 이 시스템을 계속 정교화함에 따라, 과거의 경직된 기계와 미래의 협력적 파트너 사이의 간극은 계속해서 좁혀지고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →