LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization
본 논문은 객체, 상태, 지시사항, 환경에 대한 일반화된 교란 조건에서 평가될 때 현재 비전-언어-행동 모델이 암기 학습에 심각한 의존성을 보이며 성능이 완전히 붕괴됨을 입증함으로써 공정한 평가 기준의 채택을 촉구하는 견고한 벤치마크인 LIBERO-PRO 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇 셰프를 훈련시켜 샐러드를 만들게 한다고 상상해 보세요. 누군가 샐러드 드레싱 병을 집어 바구니에 넣는 동영상을 보여줍니다. 로봇은 이를 보고 학습한 뒤, 같은 일을 하라고 요청하면 완벽하게 수행합니다. 당신은给它에 높은 점수인 95% 를 줍니다. 그리고 "와, 이 로봇은 지시를 따르는 데 천재군"이라고 생각합니다.
하지만 여기에 반전이 있습니다: 로봇은 실제로 사고하지 않습니다. 그것은 단지 특정 대본을 외운 앵무새처럼 행동할 뿐입니다.
이것이 바로 논문 LIBERO-PRO의 핵심 이야기입니다. 저자들은 현재 이러한 "비전 - 언어 - 행동 (VLA)" 로봇을 테스트하는 방식이 결함이 있다고 주장합니다. 이는 마치 학생에게 수학 시험을 치르게 할 때, 연습했던 문제와 완전히 동일한 질문을 내되 숫자만 1 밀리미터씩 이동시킨 것과 같습니다. 학생은 100% 를 받지만, 숫자를 조금만 바꾸면 완전히 실패합니다.
다음은 이 논문이 발견한 내용을 간단한 비유로 정리한 것입니다:
1. "기계적 암기"의 함정
현재의 표준 테스트 (LIBERO 라고 함) 는 너무 쉽습니다. 로봇들은 일련의 작업으로 훈련된 뒤, 정확히 동일한 작업으로 테스트받습니다. 단지 아주 작고 거의 보이지 않는 변화 (예: 그릇을 왼쪽으로 1 인치 이동) 만 있을 뿐입니다.
- 결과: 로봇들은 90% 이상의 점수를 받습니다.
- 현실: 그들은 작업을 이해하는 것이 아니라, 훈련 중에 본 장면의 영화를 재생할 뿐입니다. 그들은 "바구니"나 "샐러드 드레싱"이 무엇인지 실제로 이해하는 대신, 방의 배치와 동작 순서를 외워 "속임수"를 치고 있는 것입니다.
2. "LIBERO-PRO" 스트레스 테스트
이를 해결하기 위해 저자들은 LIBERO-PRO를 만들었습니다. 이는 속임수를 쓰는 자를 잡기 위해 고안된 "돌발 시험"과 같습니다. 로봇이 실제로 적응할 수 있는지 확인하기 위해 네 가지 요소를 체계적으로 교란시켰습니다:
- 객체 교체 (가짜):
- 테스트: 로봇에게 "샐러드 드레싱을 집어라"라고 말합니다. 하지만 장면에는 샐러드 드레싱이 없습니다. 대신 알파벳 수프 캔이 있습니다.
- 로봇의 반응: 로봇은 수프를 무시하고, 드레싱이 보통 놓여 있는 빈 공간을 바라보며 허공을 잡으려 합니다. 기억에 너무 매몰되어 객체가 없거나 다르다는 사실조차 눈치채지 못합니다.
- 부조리한 지시:
- 테스트: 로봇에게 "샐러드 드레싱을 집어라"라고 말하지만, 그 다음 단어를 "fdsgfdsgsd" 같은 말도 안 되는 소리로 바꿉니다.
- 로봇의 반응: 로봇은 멈추거나 "이해하지 못한다"고 말하지 않습니다. 대신 샐러드 드레싱을 집어 올립니다. 이는 로봇이 실제로 당신의 말을 듣고 있는 것이 아니라, 보이는 것에 기반해 추측하고 있음을 증명합니다.
- 이동하는 표적 (위치 이동):
- 테스트: 훈련 영상에서 객체가 있던 위치에서 약간만 이동시킵니다.
- 로봇의 반응: 로봇은 이전 위치로 손을 뻗어 객체를 완전히 놓칩니다. 로봇은 현재 객체가 "어디에" 있는지 개념이 없으며, 단지 "어디에 있어야 했는지"만 알고 있을 뿐입니다.
- 콤보 작업:
- 테스트: 로봇이 각각 따로 할 줄 아는 두 가지 간단한 작업 (그릇을 집어 올리고, 그다음 가스레인지 켜기) 을 하나의 새로운 지시로 결합해 수행하라고 요청합니다.
- 로봇의 반응: 실패합니다. 로봇은 두 가지 학습된 동작을 연결해 새로운 계획을 세울 수 없습니다. 이는 음계와 화음을 연주할 줄 아는 음악가가 있지만, 노래를 연주하라고 하면 얼어붙는 것과 같습니다.
3. 큰 드러냄
저자들이 OpenVLA 나 Pi0 같은 최상위 로봇들에게 이러한 "스트레스 테스트"를 수행했을 때, 결과는 충격적이었습니다.
- 표준 테스트 점수: 90% 이상 (완벽해 보임).
- LIBERO-PRO 점수: 0% (완전한 실패).
로봇들은 순식간에 무너졌습니다. 다른 객체, 이동한 객체, 이상한 지시, 또는 새로운 작업 조합을 처리할 수 없었습니다.
결론
이 논문은 현재 로봇 테스트의 "골드 스탠더드"가 오해의 소지가 있다고 결론 내립니다. 이는 마치 천 번을 운전해 본 완벽하게 직선이고 빈 트랙에서 자동차를 운전하는 능력만으로 운전자의 실력을 판단하는 것과 같습니다.
저자들은 과학계에 오래되고 쉬운 테스트를 사용하는 것을 중단할 것을 촉구하고 있습니다. 대신 LIBERO-PRO를 사용하도록 요구하며, 이는 로봇들이 단순히 외운 대본을 읊조리는 것이 아니라, 실제로 보고, 이해하고, 복잡하고 예측 불가능한 실세계에 적응할 수 있는지 증명하도록 강제합니다.
간단히 말해: 로봇들은 아직 똑똑하지 않습니다. 그들은 단지 암기하는 데 매우 능할 뿐입니다. LIBERO-PRO 는 그 차이를 마침내 드러내는 테스트입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.