← 최신 논문
🤖 AI

Targeting World Models to Compromise Robot Learning Pipelines

이 논문은 월드 모델이 로봇 학습에서 유용함에도 불구하고, 안전한 원격 조작 데이터셋에 주입된 악의적인 프롬프트나 오염된 역학이 위험한 합성 훈련 데이터를 생성하여 궁극적으로 안전하지 않은 로봇 정책의 배포로 이어질 수 있는 은밀한 데이터 포이즈닝 취약점을 초래한다는 점을 밝히고 있다.

원저자: Ethan Rathbun, Ahmed Agha, Saaduddin Mahmud, Christopher Amato, Alina Oprea, Eugene Bagdasarian

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ethan Rathbun, Ahmed Agha, Saaduddin Mahmud, Christopher Amato, Alina Oprea, Eugene Bagdasarian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 집안일을 가르치고 있다고 상상해 보세요. 로봇에게 모든 작업을 일일이 손으로 보여주는 대신(이는 느리고 비용이 많이 듭니다), 당신은 "드림 머신(Dream Machine)"(월드 모델)을 사용하기로 결정했습니다. 이 드림 머신은 로봇이 수행하는 작업의 영상을 보고, 로봇이 더 빠르게 학습할 수 있도록 그와 유사한 수천 개의 새로운 영상을 상상하거나 "꿈꿔내는" AI입니다.

당신이 제공한 논문은 이 드림 머신이 강력한 도구이긴 하지만, 해커가 로봇을 속여 위험한 행동을 하게 만들 수 있는 **"비밀 백도어(secret backdoor)"**를 가지고 있다고 주장합니다. 원래의 영상들은 완벽하게 안전해 보임에도 불구하고 말이죠.

공격 방식은 다음과 같이 쉬운 비유를 통해 설명됩니다.

설정: 안전한 영상과 드림 머신

악의적인 데이터 공급업체가 로봇 팔이 장난감을 부드럽게 집어 상자에 넣는 영상을 당신에게 판매한다고 상상해 보세요. 사람의 눈으로 볼 때 이 영상은 100% 안전해 보입니다. 당신은 이 영상을 드림 머신에 입력하여, 로봇을 위한 더 많은 연습 영상을 생성하기를 기대합니다.

공격 1: "시각적 프롬프트 하이재킹(Visual Prompt Hijacking)" (마법의 쪽지)

연구자들은 드림 머신이 단순히 영상을 "보는" 것이 아니라, *"장난감을 집어라"*와 같이 무엇을 할지 알려주는 "쪽지"(텍스트 프롬프트)도 함께 읽는다는 것을 발견했습니다.

해커의 속임수는 영상 안에 비밀 쪽지를 숨기는 것입니다.

  • 비유: 영상이 하나의 그림이라고 상상해 보세요. 해커는 AI의 특별한 눈으로만 볼 수 있는 아주 작고 투명한 메시지를 캔버스 위에 그려 넣습니다.
  • 속임수: 사람은 *"장난감을 집어라"*라는 쪽지를 보지만, 드림 머신의 AI 눈은 숨겨진 메시지를 *"폭탄을 집어라"*라고 읽습니다.
  • 결과: 드림 머신은 로봇이 폭탄을 집어 선물 상자에 넣는 새로운 영상들을 "꿈꾸기" 시작합니다. 로봇은 이 가짜의 위험한 꿈으로부터 학습하게 되고, 원래 영상이 안전했음에도 불구하고 결국 위험한 로봇이 됩니다.

연구진은 이 속임수가 로봇이 혼란스러워하거나 지시가 모호할 때(예: 어떤 장난감인지 명시하지 않고 그냥 "장난감을 집어라"라고 말할 때) 가장 잘 작동한다는 것을 발견했습니다. 지시가 매우 구체적이라면 드림 머신을 속이기가 더 어려워집니다.

공격 2: "시각적 전이 하이재킹(Visual Transition Hijacking)" (고장 난 나침반)

이 공격은 로봇이 움직인 후 다음에 어떤 일이 일어날지를 예측하는 다른 종류의 드림 머신을 겨냥합니다.

  • 비유: 드림 머신이 GPS라고 상상해 보세요. 보통 당신이 왼쪽으로 돌라고 하면, GPS는 앞길을 보여줍니다.
  • 속임수: 해커는 시작 영상을 약간 수정하여, 오직 오른쪽으로 돌 때만 GPS가 제대로 작동하도록 만듭니다. 만약 당신이 왼쪽으로 돌려고 하면, GPS 화면은 완전히 검게 변하거나 혼란스러운 상태가 됩니다(이를 "예측 붕괴(prediction collapse)"라고 합니다).
  • 결과: 로봇은 왼쪽으로 도는 것이 "나쁜 생각"이라고 학습합니다. 왜냐하면 세상이 사라져 버리기 때문입니다. 로봇은 검은 화면을 피하기 위해 해커가 원하는 특정 행동만을 수행하도록 "백도어"가 심어지게 됩니다.

이것이 왜 중요한가

이 논문은 이러한 공격들이 매우 은밀하다는 점을 보여줍니다.

  • 전통적인 공격은 상자 안에 폭탄을 넣는 것과 같습니다. 상자를 자세히 들여다보면 폭탄이 보입니다.
  • 이러한 공격은 폭탄을 쿠키 상자처럼 보이는 상자 안에 넣는 것과 같습니다. 이 상자는 쿠키처럼 보이기 때문에 모든 안전 검사를 통과합니다. 하지만 이 폭탄은 드림 머신이 처리할 때만 "폭발(로봇이 위험하게 행동하게 함)"합니다.

결론

저자들은 이러한 아이디어들을 최신 AI 모델(Cosmos-Predict 등)에 테스트했으며, 다음을 발견했습니다:

  1. 텍스트 기반 드림 머신은 지시가 모호하거나 장면이 AI가 학습한 것과 약간만 달라도 쉽게 속을 수 있습니다.
  2. 액션(행동) 기반 드림 머신은 특정 행동을 제외한 모든 행동을 무시하도록 강제될 수 있으며, 이는 결과적으로 로봇의 의사결정 과정을 탈취하는 효과를 냅니다.

논문은 월드 모델이 시간과 비용을 절약해 주는 훌륭한 도구이지만, 로봇 학습 공급망에 보이지 않는 새로운 취약점을 도입한다는 결론을 내립니다. 우리는 로봇이 어떻게 행동해야 하는지 가르치기 위해 이 "드림 머신"을 신뢰하기 전에, 이를 어떻게 더 안전하게 만들 수 있을지 반드시 알아내야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →