← 최신 논문
🤖 AI

CIVA: Critic-Induced Value-Subspace Attacks on Visual World-Model Agents

본 논문은 에이전트의 크리틱(critic)에 의해 유도된 저차원 값 부공간(low-dimensional value subspace)을 악용하여, DreamerV3와 같은 시각적 월드 모델 에이전트를 효과적으로 방해하는 시간적으로 일관되고 비용 효율적인 섭동을 생성하는 화이트박스 공격 방법인 CIVA를 제안한다.

원저자: Jiancheng Wang, Mingli Zhu, Tong Zhang, Jiaqi Ruan, Wei Wang, Siyuan Liang, Dacheng Tao

게시일 2026-08-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiancheng Wang, Mingli Zhu, Tong Zhang, Jiaqi Ruan, Wei Wang, Siyuan Liang, Dacheng Tao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 급격히 진화하는 세상에서, 미래를 상상함으로써 행동을 학습하는 새로운 세대의 의사결정 시스템이 등장했습니다. 현재 보고 있는 이미지만에 단순히 반응하는 기존의 프로그램들과 달리, 이 진보된 에이전트들은 환경에 대한 내부적인 정신 모델(internal mental model)을 구축합니다. 이들은 카메라의 비디오 피드와 같은 일련의 시각적 입력을 받아, 이를 과거에 일어난 일을 기억하고 다음에 일어날 일을 예측하는 숨겨진 추상적 상태로 압축합니다. 이러한 내부 상태 덕분에 이들은 마치 운전자가 도로의 곡선을 미리 예상하는 것처럼 여러 단계 앞을 계획할 수 있습니다. 이러한 시스템이 비디오 게임에서 실제 로봇 공학 및 안전이 중요한 작업으로 이동함에 따라, 이들을 어떻게 방해할 것인가를 이해하는 것이 중요한 질문이 되었습니다. 만약 에이전트가 지속적인 내부 예측의 흐름에 의존한다면, 카메라 피드의 짧고 순간적인 결함이 문제가 될까요, 아니면 에이전트의 기억이 이를 완화해 줄까요? 이것이 현재 연구자들이 해결하려고 노력 중인 핵심적인 수수께끼입니다.

한 과학자 팀은 이러한 "월드 모델(world-model)" 에이전트를 무너뜨리는 방법이 모든 비디오 프레임을 무작위 노이즈로 공격하는 것이 아니라, 에이전트의 '두뇌'가 가장 민감하게 반응하는 시각 데이터 내의 특정하고 숨겨진 방향을 찾는 것임을 발견했습니다. 걷기, 탁구 치기, 또는 개방형 환경에서 생존하기 위해 훈련된 에이전트들에 초점을 맞춘 연구에서, 연구진은 이러한 시스템이 매우 특정한 방식으로 공격받을 때 놀라울 정도로 취약하다는 것을 발견했습니다. 그들은 CIVA, 즉 '비평가 유도 가치 부공간 공격(Critic-Induced Value-Subspace Attacks)'이라 불리는 방법을 개발했습니다. 핵심 아이디어는 이러한 에이전트들이 자신의 미래가 얼마나 좋을지를 지속적으로 추정하는 내장된 "점수 기록자(scorekeeper)"를 가지고 있다는 점입니다. 이 점수 기록자가 작은 변화에 어떻게 반응하는지 연구함으로써, 연구진은 에이전트의 점수를 낮추는 가장 효과적인 방법이 시각 데이터를 매우 좁고 저차원적인 경로를 따라 밀어내는 것임을 찾아냈습니다. 이 경로는 무작위가 아닙니다. 이는 에이전트 자신의 내부 논리가 의사결정에 결정적이라고 드러낸 이미지 공간 내의 특정한 방향 집합입니다.

연구진은 두 다리로 걷거나 퐁(Pong) 게임을 하는 것과 같은 복잡한 과업을 수행하도록 훈련된 DreamerV3라는 정교한 에이전트를 대상으로 이 접근법을 테스트했습니다. 연구진은 공격자가 에이전트가 보는 현재 이미지를 수정할 수 있는 시나리오를 설정했으며, 인간의 눈에는 방해가 보이지 않도록 픽셀을 변경할 수 있는 엄격한 제한을 두었습니다. 이러한 시스템을 해킹하려는 이전의 시도들은 종-종 각 비디오 프레임을 독립적인 타겟으로 취급하여 시퀀스의 모든 사진에 노이즈를 추가하곤 했습니다. 그러나 연구진은 이러한 방식이 월드 모델 에이전트에게는 통하지 않는다는 것을 발견했습니다. 에이전트는 과거의 프레임을 기억하고 이를 내부 상태로 혼합하기 때문에, 고립된 노이즈의 폭발은 씻겨 나가고 잊혀집니다. 에이전트의 기억은 필터 역할을 하여 무작위적인 프레임 단위 공격의 영향을 희석시킵니 다.

이를 극복하기 위해 연구진은 먼저 에이전트의 내부 "점수 기록자"를 조사하여 이미지의 어떤 미세한 변화가 예측된 미래 점수의 가장 큰 하락을 유발하는지 확인하는 일련의 오프라인 실험을 수행했습니다. 그들은 이러한 효과적인 변화들을 수천 개 수집했고, 수학적 기법을 사용하여 그들 사이의 공통된 실마리를 찾아냈습니다. 그들은 가장 파괴적인 모든 변화가 아주 작은 저차원 부공간(subspace)에 집중되어 있다는 것을 발견했습니다. 가능한 모든 이미지 변경 방식이 서로 다른 방향인 거대한 다차원 방을 상상해 보십시오. 연구진은 에이전트의 약점이 방 전체에 퍼져 있는 것이 아니라, 사실 그 안의 단 하나의 좁은 복도에 국한되어 있다는 것을 발견했습니다. 일단 이 복도를 식별하자, 그들은 전체 방을 탐색하는 것을 멈췄습니다. 대신, 공격을 이 좁은 경로 내에서만 움직이도록 제한했습니다.

최종 단계에서 연구진은 이 발견을 실시간으로 적용했습니다. 에이전트가 플레이하는 동안, 공격자는 그 좁은 복도 내에서 최선의 움직임을 계산한 다음 그 변화를 시간에 따라 부드럽게 처리했습니다. 이 매끄러운 처리는 매우 중요했습니다. 이는 섭동(perturbation)이 한 프레임에서 다음 프레임으로 넘어갈 때 떨리거나 깜빡거리지 않도록 보장하며, 그렇지 않으면 쉽게 눈에 띄거나 계산 비용이 많이 들게 됩니다. 공격을 일정하게 유지하고 에이전트의 내부 논리에 정렬시킴으로써, 연구진은 에이전트가 잘못된 결정을 내리도록 지속적으로 속일 수 있었습니다. 결과는 놀라웠습니다. 걷기 과업에서 에이전트의 성능은 26% 이상 떨어졌으며, 이는 테스트된 다른 어떤 방법보다 훨씬 높은 실패율이었습니다. 퐁 게임에서는 그 하락폭이 더욱 극적이어서, 에이전트의 점수가 거의 86% 가까이 폭락했습니다.

아마도 가장 중요한 점은, 연구진의 방법이 효과적일 뿐만 아니라 효율적이고 미묘하다는 것을 보여주었다는 것입니다. 공격이 적은 수의 방향으로 국한되었기 때문에, 모든 프레임의 모든 픽셀에 대해 변화를 계산하려 했던 이전 방법들보다 훨씬 적은 컴퓨팅 파워를 요구했습니다. 시각적 변화는 인간 관찰자에게는 원래의 비디오와 거의 구별할 수 없을 정도로 미묘하게 유지되었지만, 에이전트의 기능을 완전히 망가뜨렸습니다. 또한 연구진은 단순히 공격을 매끄럽게 만들거나 무작위 패턴을 사용하는 것만으로는 충분하지 않다는 것을 입증했습니다. 에이전트의 점수 기록자가 찾아낸 방향 대신 무작위 방향 세트를 사용했을 때 공격은 거의 실패했습니다. 이는 성공의 열쇠가 단순히 공격의 수학적 구조에 있는 것이 아니라, 피해 대상인 에이전트의 특정 내부 구조에 맞춰져 있었다는 사실을 확인시켜 주었습니다.

이러한 발견은 지능형 시스템을 공격하는 방식에 대한 우리의 생각이 바뀌어야 함을 시사합니다. 메모리와 내부 모델에 의존하는 에이전트의 경우, 가장 위험한 취약점은 그들이 보는 개별 이미지가 아니라, 그 이미지들이 시간이 지남에 따라 처리되는 특정한 방식에 있습니다. 연구진은 에이전트 자신의 내부 신호에 귀를 기울임으로써 그 실패로 가는 지름길을 찾을 수 있음을 보여주었습니다. 이것이 이 시스템들이 고장 났다는 의미는 아니지만, 연속적인 내부 상태를 사용하여 의사결정을 내린다는 그들의 강점이 오히려 독특하고 좁은 약점을 만들어낸다는 것을 의미합니다. 이러한 기술들이 실제 세계의 배치에 가까워짐에 따라, 이러한 표적화되고 지능적인 교란으로부터 이들을 보호할 수 있는 방어책을 구축하기 위해서는 이 '실패의 기하학'을 이해하는 것이 필수적일 것입니다. 이 연구는 인공지능의 세계에서 가장 효과적인 공격은 종종 기계가 스스로를 이해하는 것보다 기계의 마음을 더 잘 이해하는 공격이라는 점을 명확히 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →