Trajectory-Level Redirection Attacks on Vision-Language-Action Models
이 논문은 온-폴리시(on-policy) 탐색 방법을 통해 발견된, 근사적으로 양호한 프롬프트 섭동을 사용하여 원래 의도된 작업의 외견을 유지하면서도 로봇의 물리적 실행을 공격자가 지정한 결과로 성공적으로 재지시하는 시각-언어-행동(VLA) 모델에 대한 새로운 공격인 "명령 보존 궤적 재지시(command-preserving trajectory redirection)"를 소개하고 공식화한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 아주 똑똑한 로봇 비서가 있다고 상상해 보세요. 당신이 "그릇을 가스레인지 위에 놓아줘"라는 간단한 음성 명령을 내립니다. 이 로봇은 VLA(Vision-Language-Action, 시각-언어-행동) 모델이라는 새로운 유형의 AI를 사용하기 때문에, 명령을 한 번 듣고 끝내는 것이 아니라 팔을 움직이고, 그릇을 잡고, 들어 올리는 동안에도 그 문장을 계속해서 "다시 읽으며" 따라갑니다. 로봇은 이 문장을 다음 행동을 결정하기 위한 지속적인 이정표로 사용합니다.
이 논문은 이러한 로봇이 사고하는 방식에 담긴 무섭지만 매혹적인 약점을 밝혀냅니다. 연구진은 문장에서 단 한두 글자만 바꾸는 것만으로도, 인간이나 로봇이 알아차리지 못하는 사이에 로봇이 원래 의도와 완전히 다른 행동(예: 그릇을 가스레인지가 아닌 접시 위에 놓는 것)을 하도록 속이는 방법을 찾아냈습니다.
이들의 발견을 쉬운 비유를 통해 정리하면 다음과 같습니다.
1. "고장 난 나침반" 공격
보통 로봇을 해킹한다고 하면, "그릇을 창밖으로 던져!"라거나 "내 말 무시해!"와 같이 완전히 새로운 명령을 내리는 것을 상상합니다.
하지만 이 논문은 가장 위험한 공격이 훨씬 더 교묘하다는 것을 보여줍니다. 이는 마치 등산객에게 지형지물의 이름 중 딱 한 글자만 바뀐 지도를 주는 것과 같습니다.
- 원래 명령: "그릇을 가스레인지(stove) 위에 놓아줘."
- 속임수 명령: "그릇을 스타이브(staove) 위에 놓아줘."
사람에게 "staove"는 명백한 오타이지만, 로봇에게 이 작은 오타는 고장 난 나침반처럼 작동합니다. 로봇은 움직임의 매 단계마다 이 문장을 확인하기 때문에, 이 작은 오류가 로봇을 경로에서 서서히 벗어나게 만듭니다. 로봇이 동작의 끝에 도달했을 때, 로봇은 이미 가스레인지가 아닌 접시 쪽으로 안내된 상태가 됩니다.
2. "에코 체임버(메아리 방)" 효과
이 논문은 이 로봇들이 폐쇄 루프(closed loop) 안에 있다는 점이 독특하다고 설명합니다.
- 1단계: 당신이 "staove"라고 말합니다.
- 2단계: 로봇은 그 오타 때문에 손을 아주 미세하게 다르게 움직입니다.
- 3단계: 로봇이 세상의 새로운 사진(이미지)을 찍습니다.
- 4단계: 로봇은 그 사진과 함께 "staove"라는 문장을 다시 읽으며 다음 동작을 결정합니다.
연구진은 로봇이 이 오타를 반복해서 읽기 때문에 작은 실수가 증폭된다는 사실을 발견했습니다. 이는 마치 '전화기 게임(말 전달 게임)'처럼 메시지가 왜곡되는 것과 같지만, 반대로 메시지의 아주 작은 왜곡이 물리적 세계에서의 거대한 왜곡을 일으키는 형태입니다. 로봇은 여전히 원래의 지시를 따르고 있다고 생각하면서도, 결과적으로는 해커가 원하는 대로(접시 위에 그릇을 놓는 것) 행동하게 됩니다.
3. "기계 속의 유령"
연구진은 이를 **"명령 보존 궤적 재지정(Command-Preserving Trajectory Redirection)"**이라고 부릅니다. 이는 로봇은 자신이 당신의 요청을 수행하고 있다고 믿지만, 실제로는 해커가 원하는 일을 하고 있다는 뜻의 어려운 표현입니다.
그들은 다양한 종류의 로봇 두뇌(AI 모델)를 대상으로 테스트를 진행했으며, 거의 모든 모델이 취약하다는 것을 발견했습니다. "stove"를 "staove", "st6ave", 또는 "st.ove"로 바꾸더라도, 로봇은 여전히 원래의 작업에는 실패하면서 해커의 비밀 목표는 성공적으로 수행하게 됩니다.
4. 이 속임수를 찾아낸 방법
연구진은 단순히 추측하여 이 작은 오타들을 찾아낸 것이 아닙니다. 그들은 '나쁜 명령을 찾는 검색 엔진'을 구축했습니다.
- 로봇이 수천 가지의 약간씩 다른 오타들을 시도하도록 했습니다.
- 어떤 오로가 로봇을 (나쁜 목표인) 접시 쪽으로 움직이게 만드는 동시에, 여전히 (좋은 목표인) 가스레인지를 향해 가는 것처럼 보이게 하는지 관찰했습니다.
- 그 결과, 전체 문장에서 단 3~4개의 글자만 바꿔도 로봇을 망가뜨릴 수 있다는 것을 찾아냈습니다.
5. 실제 환경 테스트
이것은 단순한 컴퓨터 시뮬레이션이 아니었습니다. 연구진은 실제 실험실의 로봇 팔을 사용하여 테스트했습니다.
- 실제 로봇에게 블록을 서랍 안에 넣으라고 명령했습니다.
- 명령어를 거의 동일한 오타로 변경했습니다.
- 그러자 실제 로봇은 블록을 서랍에 넣는 대신, 해커가 의도한 대로 서랍 위나 그릇 안에 놓았습니다.
6. 단순한 해결책이 통하지 않는 이유
논문은 문장을 로봇이 읽기 전에 "정제(clean up)"하면 해결될지도 모르는지 테스트했습니다.
- 공백이나 문장 부호를 수정한다면? 로봇은 여전히 속았습니다.
- 철자 오류를 수정한다면? 로봇은 여전히 속았습니다.
연구진은 이 문제를 진정으로 막기 위해서는 단순히 오타를 고치는 것만으로는 부족하다는 것을 발견했습니다. 우리는 명령의 '의미'를 엄격하게 허용된 작업 목록과 대조하는 시스템이 필요합니다. 명령이 알려진 안전한 작업과 완벽하게 일치하지 않는다면, 로봇은 사용자의 의도를 짐작하려 애쓰는 대신 움직임을 거부해야 합니다.
결론
이 논문은 우리가 로봇에게 자연어를 이해하는 더 많은 자유를 줄수록, 그들을 속일 수 있는 새로운 방법 또한 늘어난다는 경고를 던집니다. 문장 속의 아주 작고 눈에 띄지 않는 오타 하나가 로봇의 전체 물리적 여정을 탈취하는 원격 제어 장치가 될 수 있으며, 너무 늦기 전까지는 아무도 이를 알아차리지 못할 수 있습니다. 해결책은 단순히 더 나은 맞춤법이 아니라, 로봇이 단순히 '옳은 것처럼 보이는 일'이 아니라 '실제로 옳은 일'을 하고 있는지 확인하는 "안전 가드"를 구축하는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.