← 최신 논문
🤖 AI

TRAP: Tail-aware Ranking Attack for World-Model Planning

본 논문은 세계 모델에서 상상된 궤적의 장꼬리 순위 구조를 악용하여 의사결정에 중요한 경로들의 상대적 순서를 교란함으로써 장기 계획 장악을 유도하고, 깨끗한 입력에서는 탐지를 회피하면서 지속적인 행동 편차를 초래하는 새로운 백도어 공격 프레임워크인 TRAP 을 소개합니다.

원저자: Siyuan Duan, Ke Zhang, Xizhao Luo

게시일 2026-05-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Siyuan Duan, Ke Zhang, Xizhao Luo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 비디오 게임을 하거나 자동차를 운전하도록 가르친다고 상상해 보세요. 이 로봇은 지금 당장 보는 것에만 반응하는 것이 아니라, "세계 모델 (World Model)"을 사용합니다. 이 세계 모델을 꿈꾸는 엔진이라고 생각하세요. 움직임을 결정하기 전에 눈을 감고 다음 몇 분 동안의 수백 가지 "만약에" 시나리오를 상상합니다. 스스로에게 묻습니다. "왼쪽으로 가면 어떻게 될까? 오른쪽으로 가면 어떻게 될까?"

그런 다음 이 꿈들을 점수화합니다. 가장 높은 점수를 받은 것들 (예: 가장 많은 점수를 얻거나 추락을 피하는 것) 을 선택하여 따릅니다.

문제: 꿈속의 교활한 속임수

이 논문의 연구자들은 이러한 꿈꾸는 로봇을 해킹하는 새로운 방법을 발견했습니다. 그들은 이 방법을 TRAP이라고 부릅니다.

일반적으로 해커들은 로봇의 즉각적인 시야를 교란시켜 속이려고 합니다 (예: 정지 표지판에 스티커를 붙여 로봇이 속도 제한 표지판이라고 생각하게 만드는 것). 하지만 저자들은 이러한 "꿈꾸는" 로봇의 경우, 1 초간의 시야를 교란하는 것만으로는 충분하지 않다는 것을 발견했습니다. 로봇의 꿈꾸는 엔진이 작은 오류들을 보정하는 데 너무 능숙하기 때문에 작은 결함들은 무시당합니다.

실제 약점:
연구자들은 로봇이 모든 개별 꿈의 정확한 점수에 관심이 있는 것이 아니라, 상위 몇 개의 순위에만 관심을 가진다는 것을 깨달았습니다.

  • 로봇이 100 개의 경로를 상상한다고 가정해 보세요.
  • 90 개는 끔찍합니다 (낮은 점수).
  • 10 개는 그럭저럭 괜찮습니다.
  • 2 개는 놀랍습니다 (분포의 "꼬리" 부분).

로봇은 거의 항상 그 상위 2 개의 놀라운 경로 중 하나를 선택합니다. 나머지 98 개는 실제로 중요하지 않습니다.

공격: TRAP (꼬리 인식 순위 공격)

TRAP 공격은 카드 전체를 사라지게 하려 하지 않고, 덱의 상위 두 장의 카드를 특별히 바꾸는 마술사와 같습니다.

  1. 트리거: 해커는 로봇의 카메라 화면에 아주 작고 거의 보이지 않는 패치 (작은 스티커나 특정 픽셀 패턴과 같은 것) 를 부착합니다.
  2. 꿈의 전환: 로봇이 이 패치를 보자마자 꿈꾸는 과정을 시작합니다. 패치 때문에 로봇이 평소 선택하던 "놀라운" 경로들이 상상 속에서 갑자기 약간 더 나빠 보입니다. 반면, 이전에는 끔찍했던 ("나쁜") 경로가 갑자기 약간 더 좋아 보입니다.
  3. 장악: 로봇의 내부 순위 시스템이 뒤집힙니다. "나쁜" 경로가 이제 1 위가 되고, "좋은" 경로는 5 위가 됩니다. 로봇은 자신의 꿈을 신뢰하며 나쁜 경로를 선택합니다.

TRAP 의 작동 원리 (비밀 소스)

이 논문은 이전의 공격들이 모든 것의 점수를 동시에 낮추려 했기 때문에 실패했다고 설명합니다. TRAP 은 더 영리합니다.

  • 꼬리 인식 (Tail-Aware): 로봇의 행동을 실제로 결정하는 소수의 최고 점수 꿈들인 "꼬리" 부분에만 집중합니다. 로봇이 애초에 선택하지 않을 90% 의 꿈들은 무시합니다.
  • 이중 게이트 (Dual Gating): 무거운 바위를 밀려고 한다고 상상해 보세요. 잘못된 방향으로 너무 세게 밀면 미끄러질 수 있습니다. TRAP 은 두 개의 "게이트" (안전 점검) 를 사용하여 순위가 올바른 방향으로만 밀리도록 하고, 로봇의 뇌가 혼란을 느껴 완전히 작동을 멈출 정도로 너무 세게 밀지 않도록 합니다. 이로 인해 공격은 은밀하고 안정적으로 유지됩니다.

결과

연구자들은 다양한 게임과 제어 작업 (가상의 치타를 조종하거나 휴머노이드 로봇을 걷게 하는 것 등) 을 수행하는 두 가지 유명한 "꿈꾸는" 로봇 (DreamerV3 와 TD-MPC2) 에서 이를 테스트했습니다.

  • 정상적인 행동: 로봇이 트리거를 보지 않을 때는 완벽하게 정상적으로 행동합니다. 활성화되기 전까지는 순진해 보이는 "트로이 목마"입니다.
  • 공격 하에: 작은 트리거가 나타나면 로봇의 성능이 급락합니다. 많은 경우 게임에서 승리하던 것이 완전히 실패로 변했습니다.
  • 은밀성: 이 공격은 로봇이 작은 시각적 오류를 무시하는 데 매우 능숙하더라도 작동합니다. TRAP 은 단순히 이미지를 흐리게 하는 것이 아니라 최상의 아이디어들의 순위를 표적하기 때문에, 로봇 자신의 논리가 잘못된 선택을 하도록 속입니다.

왜 이것이 중요한가

이 논문은 우리가 미래를 상상하며 계획하는 더 똑똑하고 자율적인 에이전트들을 구축함에 따라, 이러한 특정 취약점에 대해 우려해야 한다고 결론 내립니다. 로봇이 미래를 꿈꾸는 데 능숙하다고 해서 안전한 것은 아닙니다. 로봇의 가장 좋은 꿈들의 순서를 미묘하게 재배열할 수 있다면, 로봇의 전체 미래를 장악할 수 있습니다.

간단히 말해: TRAP 은 로봇의 눈을 망가뜨리는 것이 아니라, 로봇이 상상하는 "최고의" 미래가 실제로는 재앙이 되도록 로봇의 꿈들을 재배열합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →