Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation
이 논문은 파운데이션 모델 기반의 체화된 에이전트(embodied agents)에 대한 신뢰 경계 중심의 서베이를 제시하며, 보안 위험을 5개의 계층과 12개의 공격 표면으로 분류하고, 58개의 공격과 61개의 방어 기법을 분석하여 메모리 및 다중 에이전트 신뢰와 같은 분야의 연구 공백을 밝히며, 평가 및 구성적 방어 측면에서의 향후 과제를 개괄한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
단순히 경직된 명령 목록을 따르는 것이 아니라, 언어, 시각, 그리고 경험을 통해 세상을 이해하는 로봇을 상상해 보십시오. 흔히 '체화된 에이전트(embodied agents)'라고 불리는 이 기계들은 자동화에 대한 우리의 생각을 바꾸고 있습니다. 이들은 모든 가능한 상황에 대해 특정 단계를 프로그래밍하는 대신, 방대한 양의 인간 지식과 시각적 데이터로 학습된 파운데이션 모델(foundation models)—즉, 주변 환경을 인식하고, 무엇을 할지 추론하며, 자신의 몸을 어떻게 움직일지 결정할 수 있는 강력한 시스템—을 사용합니다. 로봇은 어수선한 탁자를 바라보고 컵이 떨어질 위험에 처해 있음을 이해한 뒤, 인간이 단 하나의 명령을 입력하지 않아도 컵을 구하기 위한 일련의 움직임을 계획할 수 있습니다. 이러한 고정된 프로그래밍에서 유연하고 지능적인 의사결정으로의 전환은 로봇이 우리의 가정, 병원, 그리고 공장으로 들어오는 것을 약속합니다. 그러나 이 새로운 자유는 새로운 종류의 위험을 동반합니다. 기계의 결정이 읽고, 보고, 기억하는 정보에 의해 좌우될 때, 그 정보는 잠재적인 실패 지점이 됩니다. 만약 공격자가 로봇의 세상에 대한 이해를 속일 수 있다면, 로봇의 물리적인 모터나 기어가 완벽하게 안전하더라도 기계를 위험한 방식으로 행동하게 만들 수 있습니다.
우한 대학교의 한 연구팀은 이러한 위험이 정확히 어디에 존재하는지를 밝혀냈습니다. 그들은 이 지능형 로봇에 대한 58가지의 서로 다른 공격 방식과 61가지의 서로 다른 방어 방식을 연구하여, 이 신흥 기술의 보안에 관한 포괄적인 가이드를 만들었습니다. 그들의 연구는 로봇의 안전에 대한 기존의 사고방식으로는 더 이상 충분하지 않다는 점을 보여줍니다. 과거에 로봇을 보호한다는 것은 해커로부터 로봇의 전선과 소프트웨어 코드를 보호하는 것을 의미했습니다. 오늘날 가장 취약한 부분은 로봇의 감각과 정신입니다. 연구진은 공격자가 로봇의 운영 체제에 침입하지 않고도 단순히 로봇이 보는 것을 바꾸거나 로봇에게 지시하는 내용을 바꿀 수 있다는 사실을 발견했습니다. 연구팀은 공격을 구조화함으로써, 가장 흔한 공격은 로봇의 눈과 손을 겨냥하며, 가장 흔한 방어는 로봇이 움직이기 직전에 배치된다는 것을 보여주었습니다. 이러한 불균형은 로봇의 장기 기억이나 다른 기계와의 통신와 같은 다른 많은 중요한 영역들을 대체로 무방비 상태로 남겨둡니다.
연구진은 먼저 소프트웨어가 생성되는 순간부터 물리적으로 세상과 상호작용하는 순간까지, 로봇의 삶의 다양한 층위를 정의하는 것으로 시작했습니다. 그들은 공격자가 처음으로 거짓이나 속임수를 주입할 수 있는 12가지의 구체적인 진입점을 식별했습니다. 이는 로봇이 배치되기 전 학습 데이터가 오염될 수 있는 아주 초기 단계부터, 로봇의 물리적 움직임이 직접적으로 탈취되는 아주 마지막 단계까지 다양합니다. 그들의 연구에서 얻은 핵심적인 통찰은 공격의 방법이 들어오는 위치와 같지 않다는 것입니다. 예를 들어, '백도어(backdoor)'는 로봇의 학습 데이터에 심어질 수 있는 숨겨진 함정이지만, 사용자로부터 들려오는 특정 문구나 로봇에게 보여지는 특정 이미지에 의해 나중에 트리거될 수 있습니다. 연구진은 보안 전문가들이 단순히 사용하는 기술이 아니라, 공격이 로봇의 신뢰할 수 있는 세계로 처음 넘어오는 지점에 집중해야 한다고 주장합니다. 이러한 구분은 로봇의 기억 속에 있는 작은 거짓말이 어떻게 결국 커다란 물리적 실수로 이어지는지를 이해하는 데 도움이 됩니다.
연구팀이 현재의 연구 지형을 분석했을 때, 명확한 패턴이 나타났습니다. 대부분의 공격 연구는 로봇의 멀티모달 인지(multimodal perception)와 행동 인터페이스(action interfaces)라는 두 가지 특정 영역에 집중되어 있었습니다. 쉽게 말해, 대부분의 연구자들은 로봇의 눈을 속이거나 로
로봇이 잘못된 물체를 잡도록 강요하는 방법을 연구하고 있다는 뜻입니다. 그들은 기록된 공격의 절반이 카메라나 마이크와 같은 로봇의 센서, 또는 로봇에게 어떻게 움직이라고 지시하는 신호를 겨냥하고 있다는 것을 발견했습니다. 이는 상식적인 결과인데, 이들이 디지털 정신과 물리적 신체를 잇는 직접적인 연결 고리이기 때문입니다. 만약 공격자가 카메라를 속여 정지 표지판을 진행 표지판으로 보게 하거나, 벽을 열린 공간으로 착각하게 만든다면, 그 결과는 즉각적이고 물리적일 수 있습니다. 마찬가지로, 많은 공격은 모터를 회전시키거나 무게를 들어 올리라는 명령과 같이 로봇이 구체적인 움직임을 결정하는 최종 단계만을 겨対象으로 합니다.
그러나 방어 체계는 다른 이야기를 들려줍니다. 연구진은 대부분의 보안 조치가 프로세스의 맨 마지막, 즉 로봇이 동작을 실행하기 바로 직전에 집중되어 있다는 것을 발견했습니다. 이것은 마치 원자재나 설계도를 점검하는 대신, 제품이 공장을 떠나기 직전에 최종 제품만을 검사하는 경비원을 두는 것과 같습니다. 이러한 '런타임(runtime)' 보호가 중요하기는 하지만, 이는 로봇의 사고 과정 중 초기 단계들을 노출된 상태로 둡니다. 연구는 로봇의 장기 기억, 다른 로봇과의 통신, 그리고 로봇의 내부 세계 지도에 대한 무결성을 보호하는 연구가 놀라울 정도로 드물다는 것을 보여주었습니다. 예를 들어, 로봇의 기억이 오염되는 것을 어떻게 방지할지에 대한 연구는 매우 적습니다. 만약 로봇이 악의적인 소스로부터 잘못된 사실을 배워 저장하게 된다면, 그 거짓말은 오랫동안 로봇의 결정에 영향을 미쳐 단순한 동작 체크로는 놓칠 수 있는 반복적인 오류를 일으킬 수 있습니다.
연구팀은 또한 이러한 시스템을 테스트하는 데 따르는 독특한 과제들을 강조했습니다. 텍스트 기반 챗봇이 단지 자신의 말로만 평가받으면 되는 것과 달리, 체화된 로봇은 반드시 물리적 행동에 대해 테스트받아야 합니다. 로봇이 "컵을 옮겨라"라는 악의적인 지시를 성공적으로 수행할 수는 있지만, 그 과정에서 컵을 떨어뜨리거나 꽃병을 쓰러뜨린다면, 텍스트 전용 테스트에서는 절대 잡아낼 수 없는 방식으로 공격이 성공한 것입니다. 연구진은 많은 현재 연구들이 컴퓨터 시뮬레이션에 의존하고 있다고 지적했는데, 시뮬레이션은 유용하지만 조명 변화, 카메라 각도, 혹은 실제 사물의 예측 불가능한 특성과 같은 물리적 세계의 복잡한 현실을 포착하는 데 종종 실패한다고 말했습니다. 그들은 진정한 보안을 위해서는 실수의 결과가 실질적인 영향을 미치는 실제 환경에서 로봇을 테스트해야 한다고 주장했습니다. 또한 로봇들이 그룹으로 함께 일하기 시작함에 따라 위험이 커진다는 점도 지적했습니다. 만약 팀 내의 로봇 한 대가 침해당한다면, 그것은 다른 로료봇들에게 잘못된 정보를 퍼뜨려 그룹 전체를 실패하게 만들 수 있습니다.
앞을 내다보며, 연구진은 이 분야가 단순한 해결책을 넘어 나아가야 한다고 제안합니다. 그들은 미래의 로봇이 '신뢰'에 대한 더 깊은 이해를 바탕으로 설계되어야 한다고 제나합니다. 이는 인간의 목소리, 카메라 이미지, 혹은 다른 로봇으로부터 오는 메시지 등 로봇이 받는 모든 정보가 그 출처와 권위를 나타내는 라벨을 지녀야 함을 의미합니다. 로봇은 벽에 붙은 표지판이 세상에 대한 묘사일 뿐 자신의 행동을 바꾸라는 명령이 아님을 알아야 하며, 인간 운영자의 직접적인 명령은 더 높은 우선순위로 취급되어야 합니다. 또한 그들은 로봇의 내부 상태를 검증하는 더 나은 방법이 필요함을 강조합니다. 만약 로봇이 문이 열려 있다고 믿는다면, 그 믿음이 확실한 증거에 기반한 것인지 아니면 속임수에 의한 것인지 확인할 방법이 있어야 합니다. 목표는 학습 데이터부터 로봇 팔의 최종 움직임에 이르기까지 모든 층위에 안전이 짜여 있는 시스템을 구축하는 것입니다.
리우(Liu)와 그의 동료들의 연구는 빠르게 진화하는 분야를 위한 중요한 이정표 역할을 합니다. 공격의 진입점과 방법을 분리함으로써, 그들은 지능형 기계의 취약성을 이해하는 더 명확한 방법을 제공했습니다. 그들의 연구 결과는 우리가 로봇이 마지막 순간에 잘못된 행동을 하지 못하게 막는 데는 점점 능숙해지고 있지만, 로봇이 애초에 잘못된 것을 믿도록 속이는 데는 아직 미흡하다는 점을 시사합니다. 이러한 기계들이 우리 일상생활에 더 깊이 통합됨에 따라, 과제는 그들의 학습하고 적응하는 능력이 안전을 희생하면서 이루어지지 않도록 보장하는 것이 될 것입니다. 앞으로의 길은 개별적인 구멍을 메우는 것을 넘어, 정교한 기만 앞에서도 로봇의 행동이 인간의 의도와 일치하도록 매 단계마다 신뢰를 검증하는 시스템을 구축하는 것으로 나아가야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.