← 최신 논문
🤖 machine learning

Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models

이 논문은 '상상 후 행동(imagine-then-act)' 방식의 월드 모델에서 공격자가 안전 시스템을 우회하고 작업 실패를 유발하기 위해 미래의 잠재 궤적(latent trajectories)을 쉽게 오염시킬 수 있는 '신뢰된 상상(trusted imagination)'을 결정적인 취약점으로 식별하는 동시에, 이러한 매니폴드 외(off-manifold) 섭동에 대해 완벽한 탐지를 달성하는 파라미터가 없는 디노이저 탐지기(denoiser detector)를 제안한다.

원저자: Linghan Chen, Kaiyan Ji, Minyu Guo

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Linghan Chen, Kaiyan Ji, Minyu Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "신뢰하는 꿈"

로봇이 단순히 지금 보이는 것에만 반응하는 것이 아니라, 먼저 앞으로 몇 초 동안 어떤 일이 일어날지 꿈을 꾸는 모습을 상상해 보세요. 로봇은 미래에 대한 정신적 영화(이를 "상상"이라고 부릅니다)를 만들고, 그 영화를 검토한 다음, 그 꿈을 바탕으로 무엇을 할지 결정합니다.

이 논문은 로봇의 실제 몸(그의 "반응형 정책")은 강력하고 속이기 어렵지만, 그 은 매우 취약하다고 주장합니다. 만약 누군가 꿈을 망쳐놓는다면, 로봇의 몸이 여전히 완벽하게 작동하고 있더라도 로봇이 끔찍한 결정을 내리도록 속일 수 있습니다.

두 가지 유형의 로봇

저자들은 로봇이 이러한 꿈을 사용하는 두 가지 방식을 설명합니다.

  1. "반응형" 로봇 (안전한 로봇):

    • 작동 방식: 미래에 대해 꿈을 꾸지만, 꿈을 단지 빠른 힌트로만 사용합니다. 로봇은 자신의 꿈이 맞는지 확인하기 위해 끊임없이 실제 세계를 체크합니다. 만약 꿈은 "점프하라"고 말하는데 실제 세계는 "벽이 있다"고 말한다면, 로봇은 꿈을 무시하고 멈춥니다.
    • 결과: 공격자가 꿈을 망치더라도 로봇은 괜찮습니다. 로봇은 그저 나쁜 꿈을 무시하고 계속 작업을 수행합니다. 논문에서는 이를 "무효 결과(null result)"라고 부릅니다. 로봇의 실제 작업에 아무런 나쁜 일이 일어나지 않기 때문에 지루한 결과라는 뜻입니다입니다.
  2. "오라클(Oracle)" 로봇 (취약한 로봇):

    • 작동 방식: 이 로봇은 자신의 꿈을 절대적인 진리로 취급합니다. 행동하기 전에 실제 세계를 확인하지 않습니다. 로봇은 "내 꿈이 뭐라고 말하는가?"라고 묻고, 그 예측에 따라 행동합니다. 이는 마치 밖을 내다보지 않고 "꿈이 '안전'하다고 하면 문을 연다"라고 말하는 안전 게이트와 같습니다.
    • 결과: 이것이 약점입니다. 만약 당신이 꿈을 오염시키면, 로봇은 거짓말에 따라 행동하게 됩니다. 논문은 이러한 유형의 로봇의 경우, 카메라 입력에 가해진 아주 작고 거의 보이지 않는 변화만으로도 성공적이었던 작업이 완전한 실패로 변할 수 있음을 보여줍니다.

공격: 꿈을 망치는 법

연구진은 이 "꿈꾸는" 과정을 해킹하는 방법을 찾아냈습니다.

  • 방법: 로봇이 보는 이미지에 아주 작고 눈에 보이지 않는 양의 "노이즈(정적)"를 추가합니다. 로봇의 뇌는 매끄러운 계산이 가능하도록 수학적으로 설계(미분 가능)되어 있기 때문에, 연구진은 **투영 경사 하강법(Projected Gradient Descent)**이라는 기술을 사용할 수 있습니다.
  • 비유: 로봇의 꿈이 지도라고 상상해 보세요. 연구진은 지도를 새로 그릴 필요 없이, 시작점을 아주 살짝만 밀어내면 됩니다. 지도는 서로 연결되어 있기 때문에, 그 작은 움직임이 전체적인 미래 예측 경로를 바꿔 놓습니다.
  • 비대칭성 (핵심 발견):
    • 꿈을 깨뜨리는 것은 쉽다: 꿈을 "잘못된" 곳으로 밀어 넣는 것은 매우 쉽습니다. 연구진은 단순한 무작위 노이즈를 더하는 것보다 꿈을 오염시키는 것이 60배 더 효과적이라는 것을 발견했습니다. 꿈은 흐릿하고 터무니없는 엉망진창인 상태가 됩니다.
    • 꿈을 제어하는 것은 어렵다: 꿈을 특정한 새로운 장면(예: 실제로는 차고에 있는데 주방에 있다고 믿게 만드는 것)으로 유도하는 것은 매우 어렵습니다. 꿈은 정밀하게 조종되는 것에 저항합니다. 이는 마치 무거운 바위를 언덕 위 특정 지점으로 밀어 올리려는 것과 같습니다. 경로에서 벗어나게 만드는 것은 쉽지만, 원하는 곳으로 정확히 조준하여 보낼 수는 없습니다.

방어: "탐지견"

연구진은 오염된 꿈이 어떻게 "잘못되었는지"(현실의 자연스러운 경로를 벗어남) 알고 있기 때문에, 탐지기를 만들었습니다.

  • 작동 방식: 이들은 "디노이저(denoiser, 이미지를 깨끗하게 만드는 도구)"를 사용하여 꿈을 검사합니다. 만약 꿈이 자연스럽고 깨끗한 예측이라면 디노이저는 만족합니다. 하지만 꿈이 해킹되었다면 디노이저는 혼란에 빠지고 이를 경고합니다.
  • 결과: 이 탐지기는 매우 뛰어납니다. 해킹된 꿈을 100% 잡아냈습니다(AUC 1.0).
  • 함정: 연구진은 해킹을 탐지기로부터 숨기려는 "적응형 공격자(adaptive attacker)"를 만들어 테스트했습니다. 그 결과, 공격자가 해킹을 숨기려면 해킹을 멈춰야 한다는 것을 발견했습니다. 꿈을 오염시키면서 동시에 자연스럽게 보이게 만드는 것은 불가능합니다. 방어 체계는 유효합니다.

실제 세계 테스트

연구진은 자신의 꿈을 사용하여 움직임을 계획하는(오라클 방식) LaDi-WM이라는 특정 로봇 시스템에서 이를 테스트했습니다.

  • 결과: 연구진이 인간은 알아차릴 수 없을 정도로 아주 미세한 노이즈로 꿈을 공격했을 때, 로봇의 성공률은 70%에서 5%로 급락했습니다.
  • 비교: 만약 (표적 공격이 아닌) 일반적인 무작위 노이즈를 동일한 양만큼 추가했다면, 로봇은 여전히 잘 작동했습니다(70%). 이는 공격이 단순히 "카메라를 고장 낸 것"이 아니라, 로봇의 상상력을 구체적으로 타격했다는 것을 증명합니다.

요약

  • 문제점: 자신의 "미래 예측"을 신뢰하는 로봇은 취약합니다.
  • 공격: 입력값에 아주 작고 보이지 않는 변화를 주어 이러한 예측을 쉽게 깨뜨릴 수 있습니다.
  • 방어: 이러한 깨진 예측은 "부자연스럽게" 보이기 때문에 쉽게 탐지할 수 있습니다.
  • 교훈: 로봇의 몸이 튼튼하다고 해서 그 뇌(또는 플래너)까지 안전한 것은 아닙니다. 만약 로봇이 미래에 대한 신뢰하는 예측에 의존한다면, 그 예측은 새로운 위험 요소가 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →