BadWAM: When World-Action Models Dream Right but Act Wrong
이 논문은 월드-액션 모델(World-Action Models, WAMs)이 미세한 시각적 섭동을 통해 모델의 상상된 미래와 실행된 행동을 분리할 수 있는 적대적 공격에 취약하며, 이로 인해 모델의 내부 예측이 여전히 그럴듯하게 유지됨에도 불구하고 심각한 작업 실패를 초래할 수 있음을 보여주는 통합 프레임워크인 BadWAM을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
꿈꾸는 로봇과 은밀한 글리치(Glitch)
현재 보이는 것에 단순히 반응하는 것이 아니라, 다음에 일어날 일을 "꿈꾸는" 로봇을 상상해 보십시오. 이것은 컴퓨터가 로봇 팔이나 이동형 베이스와 같은 물리적인 몸체를 제어하는 법을 배우는 분야인 **체화된 AI(Embodied AI)**의 최첨단 기술입니다. 전통적으로 로봇은 반사적인 복서와 같았습니다. 펀치를 보면 즉시 카운터 펀치를 날리는 식이었죠. 하지만 현대의 "월드-액션 모델(World-Action Models, WAMs)"은 체스 그랜드마스터에 더 가깝습니다. 움직임을 취하기 전에 이들은 마음속으로 미래를 시뮬레이션합니다. "내가 이 컵을 잡으면 쏟아질까? 내가 여기로 발을 내디디면 넘어질까?"라고 스스로에게 묻습니다. 이러한 결과(consequences)를 상상하는 능력은 로봇을 더 안전하고 똑똑하게 만들어 내장된 안전 점검 장치 역할을 할 것으로 기대됩니다. 만약 로봇이 꿈꾸는 미래가 위험해 보인다면, 로봇은 멈추고 다시 생각해야 합니다.
연구자들이 던져온 핵심 질문은 이것입니다: 이 꿈꾸는 로봇은 정말로 안전한가? 만약 로봇이 자신의 미래를 점검할 수 있다면, 해커가 로봇을 속일 수 있을까요? 새로운 연구에 따르면, 그 대답은 우려스러운 "예"입니다. 이 논문은 먼지 한 톨이나 벽 위의 미묘한 패턴처럼 카메라 피드에 가해진 아주 작고 거의 보이지 않는 변화가 로봇의 뇌를 혼란에 빠뜨릴 수 있는 시나리오를 탐구합니다. 무서운 점은 로봇이 꿈꾸기를 멈추는 것이 아니라, 로봇이 완벽하고 안전한 미래를 꿈꾸면서도 정작 몸은 완전히 재앙적인 행동을 하고 있다는 사실입니다. 마치 로봇이 줄타기를 안전하게 하고 있다고 꿈꾸고 있지만, 실제 다리는 절벽 아래로 발을 내딛고 있는 것과 같습니다.
논문의 발견: BadWAM
치 리(Qi Li)와 신차오 왕(Xinchao Wang)이 이끄는 연구진은 이 로봇들을 테스트하는 새로운 방법인 BadWAM을 소개합니다. BadWAM을 로봇의 꿈에 대한 "스트레스 테스트"라고 생각하십시오. 그들은 로봇이 아무것도 눈치채지 못한 채 임무에 실패하도록 속일 수 있는지 확인하고 싶었습니다. 그들은 **월드-액션 드리프트(World-Action Drift)**라고 부르는 특정한 취약점을 발견했습니다.
보통 로봇을 해킹한다고 하면, 로봇이 존재하지 않는 것을 보게 만들어 당황하거나 멈추게 하는 것을 상상합니다. 하지만 BadWAM은 더 은밀한 것을 찾아냈습니다. 연구진은 아주 작은 시각적 트릭을 사용하여 로봇의 "꿈"(미래 예측)은 완벽하게 정상적으로 보이게 만들면서, 동시에 로봇의 "행동"(실제로 하는 일)을 탈취할 수 있음을 보여주었습니다.
논문은 이 공격이 작동하는 두 가지 주요 방식을 두 가지 다른 종류의 문제처럼 설명합니다:
- "오버트 하이잭(Overt Hijack)" (행동 전용 공격): 이것은 요란하고 난잡한 버전입니다. 공격자는 로봇이 즉시 잘못된 행동을 하도록 시각적 입력을 적절히 조작합니다. LIBERO라는 데이터셋을 이용한 테스트에서 이 공격은 잔혹했습니다. 로봇의 성공률을 매우 신뢰할 수 있는 **96.5%**에서 불안정한 **43.1%**로 떨어뜨렸습니다. 로봇은 물체를 집으려 했지만 결국 그것을 쳐서 넘어뜨리거나 완전히 놓쳐버렸습니다.
- "스텔스 고스트(Stealth Ghost)" (상상 보존 공격): 이것은 진정으로 무서운 부분입니다. 여기서 공격자는 변장의 명수입니다. 공격자는 로봇의 꿈이 여전히 완벽하고 안전해 보이도록 시각적 입력을 미세하게 조정합니다. 만약 당신이 로봇에게 "다음에 무슨 일이 일어날 것 같니?"라고 묻는다면, 로봇은 "블록을 잡아서 부드럽게 놓을 것 같아요"라고 답할 것입니다. 그리고 로봇의 마음속에서는 실제로 그런 일이 일어나고 있습니다. 하지만 현실에서 로봇은 엉뚱한 곳을 향해 손을 뻗거나 블록을 떨어뜨리고 있습니다. "꿈"과 "행동"이 어긋난 것입니다. 로봇은 성공을 실행하고 있다고 믿으면서 재앙을 실행하고 있습니다.
연구진은 이 "드리프트(drift)"가 중대한 보안 구멍임을 발견했습니다. 그들은 이 테스트를 다양한 유형의 로봇 뇌(Joint WAM 및 IDM WAM이라 불림)에 실시했으며, 로봇의 미래 예측이 여전히 진실에 매우 근접해 있음에도 불구하고(즉, "꿈"을 온전하게 유지함에도 불구하고) 로봇이 임무에 실패한다는 것을 발견했습니다. 실제로 그들은 "미래 거리(future distance, 꿈이 변화한 정도)"를 매우 작게 유지하면서도 로로봇을 실패하게 만들 수 있다는 것을 발견했습니다. 이는 단지 로봇의 "꿈"을 점검하는 것만으로는 충분히 안전을 보장할 수 없음을 시사합니다.
공격 방식
논문은 BadWAM이 로봇의 비밀 코드나 내부 가중치(weights)를 알 필요가 없다고 설명합니다. 이는 블랙박스 테스터처럼 작동합니다. 공격자는 로봇에게 시각적 입력을 보내고, 거기서 나오는 행동을 확인한 뒤, 행동을 더 악화시킬 수 있는지 확인하기 위해 입력을 미세하게 조정합니다. 이 과정을 마치 돌덩이를 깎아내는 조각가처럼 반복하여, 로봇을 실패하게 만드는 아주 작고 보이지 않는 패턴을 찾아냅니다.
가장 흥지는 발견 중 하나는 로봇이 어떻게 실패하는가 하는 점입니다. 로봇은 즉시 미친 듯이 행동하지 않습니다. 논문은 로봇이 종종 정상적으로 행동하며 시작된다는 것을 보여줍니다. 첫 번째 물체는 성공적으로 잡을 수도 있습니다. 하지만 작업이 계속됨에 따라 움직임이 서서히 경로를 벗어납니다. 이는 "천 번의 칼질에 의한 죽음(death by a thousand cuts)" 시나리오입니다. 로봇은 두 번째 물체를 넘어뜨리고, 세 번째 물체를 놓치며, 결국 전체 미션을 실패하게 됩니다. 이 모든 과정 동안 로봇의 내부 시뮬레이션은 모든 것이 계획대로 진행되고 있다고 주장합니다.
또한 연구는 이 트릭이 다른 로봇들에게도 통하는지 살펴보았습니다. 연구진은 한 종류의 로봇 모델에 대해 공격을 훈련시켰을 때, 그것이 약간 다른 다른 모델들에도 효과가 있다는 것을 발견했습니다. 이는 문제가 특정 소프트웨어의 버그가 아니라, 이러한 "꿈꾸는" 로봇들이 자신의 생각과 행동을 연결하는 방식의 근본적인 결함임을 시사합니다.
안전 점검의 한계
논문은 또한 이미지를 흐리게 처리하거나 카메라 피드에 노이즈를 추가하는 등의 간단한 방어책을 테스트하여 해커의 트릭을 씻어내고자 했습니다. 이러한 기법들이 어느 정도 도움이 되기는 했지만, 만능 해결책은 아니었습니다. 이러한 방법들은 공격을 막지 못하거나, 공격받지 않을 때조차 로봇의 성능을 저하시켰습니다. 연구진은 또한 로봇의 꿈과 행동이 일치하지 않을 때 경고를 보내는 "탐지기"를 구축하려 시도했지만, 이 탐지기는 오경보를 피하기 위해 주의 깊게 설정되었을 때 대부분의 공격을 놓쳤습니다.
이 연구의 결론은 로봇 공학 분야에 던지는 경종입니다. "로봇이 미래를 상상할 수 있다면 안전할 것이다"라는 아이디어는 취약합니다. 논문은 진짜 위험이 로봇이 잘못된 것을 보는 것뿐만 아니라, 로봇의 상상과 행동이 서로 어긋날 수 있다는 점이라고 지적합니다. 로봇은 자신이 옳은 일을 하고 있다고 확신하면서도, 실제로는 잘못된 일을 하고 있을 수 있습니다.
실험에서 연구진은 아주 작은 양의 시각적 노이즈(섭동 크기 0.06)만으로도 매우 성공적이었던 로봇을 실패하기 쉬운 로봇으로 바꿀 수 있음을 보여주었습니다. 그들은 단순히 로봇을 망가뜨린 것이 아니라, 로봇이 무엇을 하고 있는지에 대한 생각과 실제 행동 사이의 연결을 끊어놓았습니다. 이는 차세대 안전한 로봇을 위해 엔지니어들이 단순히 미래를 예측하는 능력에만 의존해서는 안 된다는 것을 의미합니다. 그들은 로봇의 꿈이 현실과 일치하는지 끊임없이 확인하는 시스템을 구축해야 하며, 이를 통해 꿈꾸는 자와 행하는 자가 여전히 같은 페이지에 있는지 확인해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.