← 최신 논문
💻 computer science

Vision-Based Dribbling for Humanoid Soccer via Privileged Representation Learning

본 논문은 휴머노이드 로봇이 명시적인 상태 추정이나 특권 정보에 의존하지 않고 온보드 깊이 관측으로부터 직접 정적 및 동적 상대에 맞서 강건한 시각 기반 축구 드리블을 학습할 수 있도록, 정책 내에 시간적 깊이 인코더를 삽 Embedding(임베딩)하는 통합 강화 학습 프레임워크를 제안한다.

원저자: Flavio Maiorana, Valerio Spagnoli, Eugenio Bugli, Flavio Volpi, Daniele Affinita, Vincenzo Suriani, Daniele Nardi, Luca Iocchi

게시일 2026-07-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Flavio Maiorana, Valerio Spagnoli, Eugenio Bugli, Flavio Volpi, Daniele Affinita, Vincenzo Suriani, Daniele Nardi, Luca Iocchi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

첨단 고글을 쓴 채 축구공을 드리블하며 경기장을 가로지르는 로봇 축구 선수를 상상해 보세요. 이제, 공의 정확한 속도와 위치를 알고 있는 슈퍼컴퓨터가 머릿속에 있는 대신, 자신의 눈을 통해 들어오는 비디오 피드만으로 모든 것을 파악해야 하는 로봇을 상상해 보세요. 동시에 넘어지지 않으려 애쓰면서 말이죠. 그것이 바로 이 논문에서 다루는 놀라운 도전 과제입니다.

연구진은 휴머노이드 로봇이 '보는 것'과 '움직이는 것'을 하나의 거대한 뇌로 결합하여 축구공을 드리블하는 법을 배우는 시스템을 구축했습니다. 보통 로봇은 계주 경기처럼 만들어집니다. 한 팀이 공을 감지하면, 그 정보를 두 번째 팀에 전달하여 경로를 계획하게 하고, 세 번째 팀이 다리를 움직이게 하는 방식이죠. 하지만 저자들은 이 전통적인 방식이 마치 다른 사람이 그린 지도를 보며 운전하려는 것과 같다고 주장합니다. 만약 지도가 약간 틀렸거나 공이 아주 잠깐 가려지기라도 하면 운전자는 충돌하고 맙회의 됩니다. 대신, 그들은 로봇에게 물리 법칙을 일일이 계산하기보다는 균형을 잡는 느낌을 익히며 자전거 타기를 배우는 사람처럼, 인지와 제어를 함께 학습하도록 가르쳤습니다.

이 로봇을 가르치기 위해 그들은 영리한 2단계 훈련 캠프를 사용했습니다. 먼저, 로봇이 '특권 정보(privileged information)'라고 불리는 '치트키'를 사용하는 비디오 게임 시뮬레이션에서 연습하게 했습니다. 로봇은 벽 뒤에 있는 적이나 공이 어디에 있는지까지도 정확히 알 수 있었습니다. 로봇은 이 치트 모드에서 공을 가까이 유지하고 장애물을 피하는 법을 익히며 완벽하게 드리블하는 법을 배웠습니다. 그다음 단계에서는 이 치트키를 제거했습니다. 그들은 '비전 인코더(vision encoder)'—학생을 가르치는 개인 과외 선생님이라고 생각하면 됩니다—가 실제 세상에서 로봇이 보게 될 것과 동일한 깊이 카메라 영상을 보고, 그 '치트키' 숫자들이 무엇이었을지 추측하도록 훈련시켰습니다. 로봇의 뇌는 이 추측치를 사용하여 결정을 내렸고, 결과적으로 오직 눈만을 사용하여 게임을 플레이하는 법을 효과적으로 배웠습니다.

이러한 훈련의 결과는 매우 인상적이었지만, 몇 가지 매우 구체적인 한계가 있었습니다. 로봇이 공을 뺏으려는 아무도 없는 빈 경기장에서 플레이할 때, 로봇은 완벽한 스타였으며 **100%**의 성공률을 보였습니다. 경로에 정지해 있는 장애물(콘이나 벽 같은 것) 하나를 추가했을 때도 여전히 환상적인 성과를 거두며, **96%**의 성공률을 기록했고 목표 지점에 도달하는 데 걸린 시간도 아주 조금 더 길어졌을 뿐이었습니다.

하지만 로로봇이 움직이는 적을 마주하면 이야기가 달라집니다. 두 번째 로봇이 공을 쫓아다니며 쳐내려고 프로그래밍되었을 때, 성공률은 **46%**로 떨어졌습니다. 이러한 시뮬레이션에서 로봇은 훨씬 더 자주 넘어지거나 공을 놓쳤으며, 상대방과 **68%**의 확률로 부딪혔습니다. 저자들은 로봇이 스스로 보고 움직이는 데는 뛰어나지만, 적극적으로 방해하려는 살아있는 움직이는 상대를 향해 반응하는 것이 여전히 큰 과제라고 제안합니다. 로봇의 눈은 잘 작동하고 있었습니다. 공과 적을 여전히 잘 볼 수 있었지만, '뇌'가 넘어지지 않으면서 움직이는 목표물을 피하는 방법을 알아내는 것은 아직 진행 중인 과제로 남아 있습니다.

이 모든 과정이 Booster T1이라는 특정 로봇 모델을 사용한 컴퓨터 시뮬레이션 내부에서 일어났다는 점을 기억하는 것이 중요합니다. 저자들은 이것이 미래를 위한 강력한 토대라고 조심스럽게 언급하면서도, 아직 실제 경기장의 실제 로봇에 대해 테스트하지 않았음을 밝히고 있습니다. 그들은 비디오 피드를 통해 학습하며 균형을 잡는 법을 배우는 이 방식이 로봇을 위한 유망한 길을 제시한다고 제안하지만, 현재로서는 이 로봇은 월드컵에 나갈 준비가 된 선수가 아니라 가상 교실에 있는 매우 재능 있는 학생일 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →