HumanCLAW: Can Vision-Language Models Act Through a Body?
이 논문은 체화된 지능을 평가하기 위해 시각-언어 모델의 의사결정과 운동 실행을 분리하는 프레임워크인 HumanCLAW를 소개하며, 현재의 모델들이 장기적 물리 과업에 실패하는 주요 원인이 인식 능력의 부족보다는 체화된 자기 인식의 결여에 있음을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑한 로봇에게 비디오 게임을 가르치고 있다고 상상해 보세요. 하지만 이건 그냥 평범한 게임이 아닙니다. 로봇이 넘어지거나, 넘어지거나, 벽에 부딪히거나, 꽃병을 쓰러뜨릴 수도 있는 실제 물리적인 몸체를 조종해야 하는 게임입니다. 인공지능의 세계에는 로봇을 위한 두 가지 주요 '두뇌' 유형이 있습니다. 한 유형은 수백만 개의 특정 비행 경로를 암기한 조종사와 같습니다. 이들은 이전에 본 것을 똑같이 수행하는 데는 뛰어나지만, 바람이 다르게 불면 추락할 수도 있습니다. 다른 유형은 '시각-언어 모델(Vision-Language Model, VLM)'입니다. 이것은 거대한 책 도서관과 카메라 눈을 가진 로봇이라고 생각하면 됩니다. 이 모델은 이야기를 읽고, 사진을 보고, "빨간 소파를 찾아 그 위에 앉아라"와 같은 복잡한 개념을 이해할 수 있습니다. 이들은 추론하고 대화하는 데는 놀랍도록 뛰어나지만, 실제로 몸을 움직여 본 적은 없습니다.
큰 질문은 과학자들이 지금 던지고 있는 질문입니다. 이 '책을 잘 아는' 로봇이 실제로 현실 세계에서 무언가를 할 수 있을까요? 이 모델이 "주방으로 가라"와 같은 높은 수준의 아이디어를 어떻게 넘어지지 않고 걷기 위해 필요한 아주 미세하고 찰나적인 근육의 움직임으로 바꿀 수 있을까요? 보통 로봇이 실패할 때, '두뇌'가 잘못된 결정(예: 벽으로 걸어 들어감)을 내린 것인지, 아니면 '몸'이 그 일을 해내지 못한 것인지(예: 균형을 잃음) 구별하기 어렵습니다. 이 미스터리를 해결하기 위해 연구자들은 생각하는 것과 움직이는 것을 분리하여, 로봇의 두뇌가 정확히 어디에서 막히는지 볼 수 있는 방법이 필요했습니다.
여기서 HumanCLAW라는 새로운 연구가 등장합니다. 연구진은 이 스마트한 AI 두뇌들이 물리적인 세상 속에서 인간과 유사한 신체를 제어할 수 있는지 확인하기 위해 특별한 테스트 환경을 구축했습니다. 그들은 AI에게 움직임을 훈련시킨 것이 아니라, 단지 카메라와 목표, 그리고 "앞으로 걷기", "회전하기", "앉기"와 같은 기본적인 동작 목록을 주었을 뿐입니다. 그런 다음, AI가 물건을 찾아 그 위에 앉기 위해 41개의 서로 다른 가상 주택을 탐색하도록 했습니다.
결과는 다소 충격적이었습니다. 오늘날 가장 똑똑하고 진보된 AI 모델들조차 거의 매번 실패했습니다. 가장 우수한 모델조차 시도의 약 **16.8%**에서만 성공했습니다. 즉, 그들은 83% 이상의 시간 동안 실패했다는 뜻입니다.
이상한 점은 이 부분이었습니다. AI가 "눈이 멀어서" 실패한 것이 아니었습니다. 목표 물체(예: 소파)가 화면에 나타났을 때, AI는 거의 항상 그것을 인식했습니다. 그들은 자신이 무엇을 보고 있는지 알고 있었습니다. 문제는 보는 능력이 아니라, 그것이 어디에 있는지 아는 것이었습니다.
연구진은 이 AI 모델들이 심각한 '신체 기억상실증'을 앓고 있다는 것을 발견했습니다. 이들은 가구의 모습은 완벽하게 보이지만, 자신의 다리가 어디에 있는지는 전혀 모르는 유령과 같습니다. AI가 걸으려고 할 때, 이미 소파에 도착했음에도 불구하고 계속 걸어가거나, 아직 멀리 떨어져 있는데도 이미 도착했다고 생각하며 너무 일찍 멈춰 서기도 했습니다. 소파에 앉으려고 할 때, 소파가 바로 아래에 있지 않다는 것을 깨닫지 못하고 허공에 몸을 낮추며 아무것도 없는 곳에 앉아버리기도 했습니다. 또한 벽에 부딪혔다는 사실을 인지하지 못한 채 벽으로 돌진하거나 장애물에 걸려 넘어지기도 했습니다.
이 연구는 이러한 AI 모델들이 세상을 묘사하는 데는 매우 뛰어나지만, 그 안에서 자신의 위치를 파악하는 데는 형편없다는 것을 보여줍니다. 그들은 의자가 어떻게 생겼는지는 말할 수 있지만, 넘어지지 않고 그 위에 앉기 위해 어떻게 해야 하는지는 알아내지 못합니다. 연구진은 AI가 현실 세계에서 진정으로 행동하는 로봇이 되기 위해서는, 단순히 보는 법뿐만 아니라 자신의 몸이 어디에 있는지, 그리고 자신의 몸이 주변 세계와 어떻게 상호작용하는지를 '느끼는' 법을 가르쳐야 한다고 결론지었습니다. 이 '체화된 자기 인식(embodied self-awareness)' 문제를 해결하기 전까지, 아무리 똑똑한 AI 두뇌라도 물리적인 기계 속의 서투른 유령으로 남을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.