← 최신 논문
💻 computer science

Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy

이 논문은 기계로 재구성된 지시어만을 사용하여 로봇의 시각-언어-행동 정책에 그리스어를 추가하는 것을 조사하며, 견고한 평가를 위해서는 잘못된 결론을 피하기 위한 공백 벤치마크와 시드 복제가 필요함을 밝히는 동시에, 이중 언어 학습이 특정 구문에 대한 과적합에도 불구하고 대조군 대비 일관된 개선을 가져온다는 것을 입증한다.

원저자: Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos

게시일 2026-09-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

보고, 이해하고, 움직일 수 있는 로봇들이 현실이 되고 있지만, 현재 이들은 영어라는 단 하나의 언어만을 구사합니다. 이 기계들은 인간이 과업을 수행하는 영상을 보고 학습하는데, 이때 지시 사항은 영어로 작성되어 있습니다. 이 단어들을 이해하도록 돕는 소프트웨어는 방대한 양의 영어 텍스트를 바탕으로 훈련되었기에, 특정 언어인 영어에 매우 능숙합니다. 그리스어나 다른 언어를 사용하는 사람들에게 이는 높은 장벽이 됩니다. 로봇이 물체를 움직이는 장면에서 그리스어 지시가 포함된 영상 라이브러리는 존재하지 않으며, 이를 처음부터 구축하려면 모든 동작마다 로봇 팔을 수동으로 가이드하는 데 수개월이 걸릴 것입니다. 연구자들이 던진 질문은 간단했습니다. 기존의 영어 데이터를 컴퓨터를 이용해 그리스어로 번역하여, 전체 시스템을 다시 구축하지 않고도 로봇에게 새로운 언어를 이해하도록 가르칠 수 있을 것인가 하는 점이었습니다.

결과는 단순한 번법(translation)보다 훨씬 더 복잡한 것으로 밝혀졌습니다. 아테네의 Sophea AI와 KIEFER SA의 연구팀은 오픈 소스 로봇 시스템을 가져와 기계가 생성한 수천 개의 그리스어 지시문을 입력했습니다. 그들은 로봇의 두뇌나 물리적 구조를 변경하지 않았습니다. 단순히 영어 텍스트를 그리스어 텍스트로 교체했을 뿐입니다. 번역 과정은 몇 시간 만에 끝날 정도로 빠르고 쉬웠습니다. 하지만 진짜 작업은 로봇이 실제로 명령을 이해했는지 측정하려고 시도할 때 시작되었습니다. 로봇 공학의 세계에서는 시스템이 실제로 무언가를 하고 있는 것이 아니라 그저 추측하고 있을 뿐인데도 성공한 것처럼 보이게 속이는 것이 놀라울 정도로 쉽습니다. 연구자들은 보통 명확한 합격 또는 불합격을 판정하는 표준 테스트들이 완전히 속아 넘어갔다는 것을 발견했습니다. 그들은 로봇이 명령이 터무니없는 내용이거나 심지어 그리스어를 전혀 배운 적이 없는 상황에서도 높은 성공률로 명령을 따를 수 있다는 것을 발견했습니다. 이는 로봇이 단어를 읽는 것이 아니라 장면과 사물을 인식하는 법을 배우고 있었기 때문입니다.

이를 해결하기 위해 연구팀은 로봇을 테스트하는 새로운 방법을 고안해야 했습니다. 그들은 로봇에게 의도적으로 잘못된 그리스어 지시를 내려서 로봇이 여전히 과업을 수행하려 하는지 확인하는 대조군을 구축했습니다. 그 결과, 10개의 과업으로 구성된 작은 세트에서 기계 번역된 그리스어 지시로 훈련된 로봇은 약 84%의 확률로 성공하는 것처럼 보였습니다. 그러나 잘못된 지시를 주었을 때도 로봇은 약 82%의 확률로 성공했습니다. 이는 로봇이 그리스어를 읽는 것이 아니라, 그저 시각적 설정에 반응하고 있음을 증명했습니다. 로봇은 언어를 완전히 무시하고 있었습니다.

연구자들은 다른 접근 방식을 시도했습니다. 그들은 로봇이 동일한 장면 내에서 여러 가능한 목표 중 하나를 선택해야 하는 90개의 더 큰 과업 세트를 사용했습니다. 여기서 언어는 로봇에게 무엇을 할지 알려주는 유일한 신호가 됩니다. 연구진은 영어와 그리스어 지시를 모두 학습한 로봇이 그리스어 명령을 약 27%의 확률로 따를 수 있다는 것을 발견했는데, 이는 무작위 확률보다 유의미하게 높은 수치였습니다. 그러나 영어 데이터의 뒷받침 없이 그리스어 지시로만 훈련된 로봇은 무작위 추측보다 겨우 나은 수준에 불과했습니다. 이중 언어 훈련이 그리스어 전용 훈련보다 평균적으로 더 나은 성능을 보였지만, 통계적 범위가 크게 겹쳤기 때문에 영어 훈련이 그리스어 학습을 위한 필수적인 발판 역할을 했다고 확정적으로 결론 내릴 수는 없었습니다. 가장 강력한 발견은 대상 언어의 시연(demonstrations)이 필요하지만, 그것만으로는 불충분하다는 것이었습니다. 그리스어로만 훈련된 정책은 언어를 거의 따르지 못하며, 여러 차례의 테스트 실행 동안 자신의 실패 하한선(failure floor)으로부터 불과 3포인트 차이 내에 머물렀습니다.

또한 이 연구는 로봇이 인간과 같은 방식으로 그리스어를 배우고 있지 않다는 점을 밝혀냈습니다. 대신 로봇은 기계 번역기가 사용하는 특정한 문구 형식을 암기하고 있었습니다. 연구진이 다른 컴퓨터 프로그램으로 작성된 그리스어 문장으로 테스트했을 때, 로봇의 성능은 급격히 떨어졌습니다. 로봇은 언어 자체가 아니라 첫 번째 번역기의 스타일을 학습했던 것입니다. 이를 해결하기 위해 연구진은 동일한 과업을 일곱 가지의 서로 다른 그리스어 표현으로 가르쳤습니다. 이 간단한 변화는 로봇을 훨씬 더 견고하게 만들었으며, 새로운 표현으로 테스트했을 때 발생하는 성능 저하를 절반으로 줄였습니다. 이는 로봇이 단일 기계의 문체를 넘어 일반화하기 위해서는 훈련 데이터의 다양성이 필수적임을 보여주었습니다.

아마도 가장 놀라운 발견은 상식적인 개선책이 오히려 로봇을 더 나쁘게 만들었다는 점일 것입니다. 연구팀은 이미 그리스어에 적응된 모델로 로봇 훈련을 시작하면 유리할 것이라 생각하여 이를 시도했습니다. 하지만 결과적으로 로봇은 영어와 그리스어 모두에서 더 낮은 성능을 보였습니다. 또한 로봇의 뇌 부분 중 언어를 처리하는 부분을 자유롭게 학습하도록 두는 실험도 수행했는데, 이 역시 성능을 저하시켰습니다. 이 결과는 이러한 특정 시스템의 경우, 언어 이해 부분을 원래 훈련된 상태 그대로 유지하고, 새로운 언어 지시를 사용하여 로봇이 움직이는 법만을 가르치는 것이 최선의 전략임을 시사합니다.

연구진은 또한 시뮬레이션 테스트보다 훨씬 더 방대한 실제 로봇 데이터 컬렉션에 이 방법들을 적용해 보았습니다. 그들은 5만 개 이상의 실제 로봇 에피소드를 그리스어로 번역했습니다. 그러나 테스트를 실행하는 데 필요한 물리적 로봇 하드웨어가 부족하여 이 데이터의 성공 여부를 측정할 수 없었습니다. 이는 이 분야의 주요 병목 현상을 부각시켰습니다. 데이터를 번역하는 것은 저렴하고 빠르지만, 로봇이 실제로 학습했는지 검증하는 것은 느리고 비용이 많이 들며 물리적 장비가 필요하다는 점입니다.

결론적으로, 이 논문은 로봇에게 새로운 언어를 추가하는 것이 가능하지만, 그것이 단순한 번역만큼 간단한 일은 아니라고 결론짓습니다. 그것은 이미 해당 언어를 이해하고 있는 특정 유형의 베이스 모델, 새로운 언어와 영어의 혼합 훈련 데이터, 그리고 로봇이 실제로 듣고 있는지 확인하기 위해 의도적인 실패를 포함하는 매우 신중한 테스트 과정을 필요로 합니다. 로봇은 인간처럼 깊이 있게 언어를 배우는 것이 아니라, 특정 단어 패턴을 행동과 연관 짓는 법을 배웁니다. 또한 영어가 그리스어를 어떻게 지원하는지에 대한 정확한 메커니즘은 확립된 규칙이라기보다 여전히 열린 질문으로 남아 있지만, 로봇은 이를 수행하기 위해 영어 훈련의 안정성을 필요로 합니다. 이 연구는 해당 분야의 다른 이들에게 경고의 메시지를 전달합니다. 로봇의 성공률을 액면 그대로 믿지 말고, 로봇이 그저 추측하고 있는 것이 아님을 입증할 수 있는 대조군을 통해 반드시 테스트하십시오. 다국어 로봇으로 가는 길은 단지 데이터뿐만 아니라, 그 데이터가 실제로 이해되었음을 증명하는 엄격한 규율로 닦여집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →