When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents
본 논문은 공격자가 LLM 기반의 체화된 에이전트가 인지하는 환경 상태 정보를 조작하여 에이전트의 작업 이해, 계획 및 실행을 오염시킴으로써 로봇 시스템의 안전성과 신뢰성을 저해하는 새로운 공격 표면인 "상태-의미 주입(State-Semantic Injection)"을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신의 목소리를 이해하고, 방 안을 둘러보며, 당신을 돕기 위해 팔을 어떻게 움직일지 결정할 수 있는 로봇을 상상해 보십시오. 흔히 '체화된 에이전트(embodied agents)'라고 불리는 이러한 기계들은 점점 더 흔해지고 있습니다. 이들은 단순히 경직된 명령 목록을 따르는 것이 아니라, 강력한 언어 모델을 사용하여 자신이 보고 있는 것에 기반해 다음에 무엇을 할지 결정합니다. 결정을 내리기 위해 로봇은 주변 환경에 대한 정신적 이미지를 구축하며, 물체가 어디에 있는지, 그것이 무엇이라 불리는지, 그리고 서로 어떻게 연관되어 있는지를 기록합니다. 로봇은 이 정신적 이미지를 신뢰할 수 있는 사실로 취급하며, 컵을 집거나, 문을 열거나, 선반을 정리하기 위한 계획을 세우는 견고한 토대로 삼습니다. 만약 그 정신적 이미지 속의 정보가 틀리다면, 로로봇의 계획도 틀릴 것입니다. 이는 새로운 종류의 위험을 만들어냅니다. 만약 누군가 당신이 로봇에게 건넨 말은 바꾸지 않으면서, 로봇의 마음속에 있는 사실들을 몰래 바꾼다면 어떤 일이 벌어질까요?
연구자들은 인공지능이 텍스트나 이미지 속에 숨겨진 혼란스러운 지시문에 의해 속을 수 있다는 사실을 오래전부터 알고 있었습니다. 하지만 새로운 연구는 물리적 세계와 상호작용하는 로봇에 대해 더 깊은 질문을 던집니다. 이 연구는 공격자가 로봇에게 가짜 명령을 외치는 대신, 로봇이 생각하는 데 사용하는 방의 설명을 조용히 수정하는 시나리오를 탐구합니다. 연구진은 만약 로봇에게 환경에 대한 거짓된 설명이 제공된다면, 로봇이 그 거짓말을 믿고 계획을 변경하여 실제로 현실 세계에서 잘못된 행동을 할 것인지 알고 싶어 했습니다. 연구 결과, 답은 '예'였습니다. 로봇은 사람이 명령을 내리는 동안에도 완전히 인지하지 못하는 사이에 엉뚱한 물체를 잡거나 엉뚱한 곳으로 이동하도록 유도될 수 있었습니다.
우한 대학교와 버팔로 대학교의 과학자들이 이끄는 연구팀은 '환경 상태-텍스트 주입(Environment State-Text Injection)'이라고 부르는 방법을 개발했습니다. 이 방식이 어떻게 작동하는지 이해하기 위해, 특정 책을 선반에서 찾도록 임무를 받은 로봇을 상상해 보십시오. 보통 로봇은 선반을 보고, 책을 발견하면, 그 위치를 기록합니다. 이 실험에서 연구진은 로봇이 무엇을 보고 있는지 보고하는 역할을 하는 시스템의 단 한 부분만을 침해했습니다. 그들은 인간의 요청을 바꾸지도 않았고, 로봇의 두뇌나 모터를 해킹하지도 않았습니다. 대신, 그들은 로로봇이 읽는 책에 대한 설명을 단순히 바꾸었습니다. 그들은 책에 대한 설명을 토마토와 같은 다른 물체의 설명으로 바꾸거나, 책의 위치를 선반의 다른 지점으로 변경했습니다. 결정적으로, 이 거짓된 설명은 로봇의 센서로부터 온 정상적이고 정직한 보고서처럼 보이도록 만들었습니다. 이것은 로봇에게 "토마토를 잡아라"라고 명령하는 것이 아니라, 로봇이 보고 있는 것에 대한 거짓말이었습니다.
연구진은 실제 가정이나 사무실 환경을 모방하도록 설계된 세 가지 서로 다른 시뮬레이션 세계에서 이 아이디어를 테스트했습니다. 그들은 로봇의 두뇌 역할을 하기 위해 고급 언어 모델을 사용했습니다. 한 테스트에서 로봇은 테이블 중앙으로 블록을 옮기라는 요청을 받았습니다. 연구진은 상태 보고서를 수정하여 해당 블록이 사실은 다른 블록이라고 말하게 했습니다. 로봇은 거짓 보고를 믿고 잘못된 블록을 옮기도록 계획했습니다. 또 다른 테스트에서 로봇은 빵을 집으라는 명령을 받았습니다. 연구진은 상태를 변경하여 빵이 사실은 토마토라고 말하게 했습니다. 그러자 로봇은 토마토를 집는 것으로 계획을 변경했습니다. 결과는 놀라웠습니다. 거짓 정보가 로봇의 계획 시스템에 전달되었을 때, 로봇은 거의 모든 경우에서 새로운 목표를 채택했습니다. 한 특정 설정에서는 로봇이 거짓말에 맞춰 계획을 변경하는 비율이 100%에 달했습니다.
하지만 이야기는 로봇이 단순히 마음을 바꾸는 것으로 끝나지 않습니다. 연구진은 또한 로봇이 실제로 그 계획을 수행할 수 있는지 관찰했습니다. 여기서 테스트는 더 어려워집니다. 설령 로봇이 빵 대신 토마토를 잡기로 결정하더라도, 로봇은 여전히 토마토에 도달할 수 있어야 하며, 토마토가 실제로 로봇이 잡을 수 있는 곳에 있어야 합니다. 연구 결과, 로봇이 계획은 거의 항상 변경했지만, 행동을 완수하는 데는 항상 성공하지는 못했다는 것을 발견했습니다. 시뮬레이션에서 로봇은 환경에 따라 약 43%에서 48% 정도의 확률로 잘못된 행동을 성공적으로 수행했습니다. 계획을 바꾸는 것과 행동을 완수하는 것 사이의 이 간극은 중요합니다. 이는 로봇이 다른 목표를 갖도록 쉽게 속을 수는 있지만, 물리적 법칙은 여전히 적용된다는 것을 보여줍니다. 로봇은 존재하지 않는 물체를 잡을 수 없으며, 막혀 있는 지점에 도달할 수 없습니다.
이것이 단순한 시뮬레이션의 결과물이 아님을 증명하기 위해, 연구진은 실제 물리적 로봇에서도 이 방법을 테스트했습니다. 그들은 로봇에게 경로를 따라 이동한 뒤 시작 지점으로 돌아오라는 간단한 지시를 내렸습니다. 그런 다음 연구진은 컴퓨터가 실제 위치와 다른 곳에 있다고 암시하는 환경에 대한 거짓 보고를 로봇에게 입력했습니다. 거짓말을 믿은 로봇은 경로를 변경했습니다. 지시받은 대로 루프를 완료하는 대신, 로봇은 컴퓨터를 향해 방향을 틀어 의도된 경로를 벗어났습니다. 이 실험은 환경에 대한 거짓말이 로봇의 내부 상태를 통해 전달될 때, 실제 기계가 인간 운영자의 의도와 다르게 움직이게 할 수 있음을 확인시켜 주었습니다.
연구진은 이 방법을 다른 알려진 로봇 공격 방식들과 비교했습니다. 이전의 공격들은 주로 숨겨진 명령을 외치거나 로봇이 안전 규칙을 무시하도록 강제하는 '탈옥(jailbreak)'을 포함했습니다. 연구진은 이러한 기존 방식들이 물리적 세계에서 로봇이 특정한 행동을 하도록 만드는 데에는 덜 효과적이라는 것을 발견했습니다. 새로운 방법은 로봇의 프로그래밍과 싸우는 대신, 로봇이 의존하는 사실 자체를 교체했기 때문에 더 효과적이었습니다. 이것은 요리사에게 소리를 지르는 것이 아니라 레시피의 재료를 바꾸는 것과 같았습니다. 로봇은 레시피를 완벽하게 따랐지만, 재료가 잘못되었기 때문에 최종 결과물은 고객이 주문한 것과 달랐습니다.
연구진은 자신들의 연구가 입증하지 못한 부분에 대해서도 주의 깊게 명시했습니다. 그들은 공격자가 어떻게 로봇의 시스템에 접근할 수 있는지에 대해서는 보여주지 않았습니다. 그들은 공격자가 로봇의 내부 보고 중 아주 작은 부분을 변경할 수 있는 방법을 이미 가지고 있다고 가정했습니다. 또한 이 현상이 모든 상황의 모든 로봇에게 일어날 것이라고 주장하지도 않았습니다. 그들의 작업은 언어를 사용하여 행동을 계획하는 특정 유형의 로봇에 초점을 맞추었습니다. 그들은 이러한 기계들에 있어, 로봇이 진실이라고 생각하는 것과 실제로 진실인 것 사이의 경계가 매우 얇다는 것을 발견했습니다. 만약 그 경계가 넘어진다면, 로봇은 그 거짓말에 따라 행동할 것입니다.
이 연구는 차세대 도움을 주는 기계들의 근본적인 취약성을 강조합니다. 로봇이 우리의 가정과 일터에 점점 더 통합됨에 따라, 그들이 환경을 이해하는 방식에 대한 무결성은 안전 문제와 직결됩니다. 만약 로봇이 자신의 세계에 대한 설명을 신뢰할 수 없다면, 그 로봇을 그 세계에서 안전하게 행동하도록 신뢰할 수 없습니다. 이 연구는 이러한 기계들을 보호하기 위해서는 단순히 소프트웨어를 보안하는 것 이상의 것이 필요함을 시사합니다. 즉, 로봇이 결정을 내리는 데 사용하는 사실들이 진짜임을 보장해야 한다는 것입니다. 연구진은 이 공격이 더 긴 기간 동안, 그리고 더 복잡하고 변화하는 환경에서 어떻게 전개될지 연구하며 이 작업을 계속할 계획입니다. 현재로서는 결론이 명확합니다. 거짓말을 믿는 로봇은 그 거짓말에 따라 행동할 것이며, 때때로 그 행동은 바로 우리 눈앞에서 일어날 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.