MissClick: Exploiting Digit-Serialized Coordinates to Attack GUI Grounding Models
이 논문은 기존 방식보다 현저히 높은 비표적 및 표적 성공률을 달성하기 위해 자릿수 민감도(place-value sensitivity)를 활용하여 GUI 그라운딩 모델의 숫자 직렬화 좌표 생성 과정을 악용하는 화이트박스 적대적 공격인 MissClick을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터 화면이 단순한 그림이 아니라, 탭하기를 기다리는 명령의 지도인 세상을 상상해 보십시오. 이 디지털 풍경 속에서, 새로운 종류의 "스마트 비서"인 GUI 에이전트가 등장했습니다. 이 에이전트들을 믿을 수 없을 정도로 유능하지만, 약간은 글자 그대로만 받아들이는 투어 가이드라고 생각해보세요. 당신이 "신발을 사기 위해 빨간 버튼을 클릭해줘"라고 말하면, 그들은 화면을 보고 정확히 그 버튼이 어디에 있는지 파해낸 뒤 그것을 탭합니다. 이를 위해 그들은 단순히 가리키는 것이 아니라, 숫자로 이루어진 비밀 코드로 말합니다. 그들은 "814, 515"와 같은 숫자 문자열을 생성하며, 컴퓨터는 이를 당신의 화면 위 정밀한 위치로 번역합니다. 이 과정을 "시각적 접지(visual grounding)"라고 부르며, 이는 로봇과 AI가 인간의 손 없이도 우리의 앱, 웹사이트, 그리고 휴대폰을 탐색할 수 있게 해주는 마법입니다. 하지만 어떤 지도와 마찬가지로, 가이드가 숫자를 잘못 읽도록 속일 수 있다면, 그들을 완전히 엉뚱한 목적지로 보낼 수도 있습니다.
이것은 MissClick이라 불리는 새로운 발견에 대한 이야기입니다. 이 연구를 진행한 연구진은 AI 에이전트가 좌표를 기록하는 방식이 수학 시간의 "자릿수(place value)" 게임과 비슷하다는 점을 깨달았습니다. AI가 "814"라는 숫자를 쓸 때, '8'은 그냥 '8'이 아닙니다. 그것은 백의 자리에 있기 때문에 800을 나타내는 '8'입니다. '1'은 그냥 10이고, '4'는 그냥 4입니다. 연구팀은 만약 당신이 AI가 그 '8'을 '9'로 바꾸도록 속일 수 있다면, 클릭이 아주 조금 움직이는 것이 아니라 화면 전체를 가로질러 100픽셀이나 점프하게 된다는 것을 발견했습니다. 이 수학적 특성을 이용해, 그들은 AI가 "수량" 입력창 대신 "결제하기" 버튼을 누르게 하거나, 화면의 빈 공간으로 헤매게 만들 수 있는 "해커" 도구를 만들어냈습니다. 그들은 데스크톱, 웹, 모바일 화면에 걸쳐 두 가지 서로 다른 AI 모델을 대상으로 테스트했으며, 숫자의 수학적 원리를 이해함으로써 이전보다 훨씬 더 효과적으로 시스템을 무너뜨릴 수 있음을 확인했습니다.
화면의 비밀 코드
MissClick이 어떻게 작동하는지 이해하려면, 먼저 이 AI 에이전트들이 화면을 어떻게 "보는지" 살펴봐야 합니다. 당신이 "아이템 수량을 5로 조절해줘"와 같은 지시를 내리면, AI는 단순히 위치를 추측하지 않습니다. 그것은 타자기처럼 동작하여 문자를 하나씩 하나씩 내뱉습니다: (, 8, 1, 4, ,, 5, 1, 5, ). 즉, 숫자인 "814"와 "515"를 텍스트 문자열로 생성하는 것입니다. 일단 타이핑이 끝나면, 컴퓨터는 그 문자열을 실제 좌표로 변환하여 마우스가 정확한 픽셀로 이동하도록 명령합니다.
연구진은 이 과정에서 매우 흥다는 사실을 발견했습니다. AI는 모든 숫자를 개별적인 문자로 취급하지만, 컴퓨터는 그것을 수학적 값으로 취급합니다. 만약 AI가 좌표의 첫 번째 숫자를 틀리면, 결과는 엄청난 도약으로 이어집니다. 예를 들어, AI가 814를 클릭해야 하는데 914를 클릭하도록 속았을 경우, 클릭은 오른쪽으로 100픽셀 이동합니다. 반면 마지막 숫자를 틀려 814가 815로 바뀌면, 단 1픽셀만 이동합니다. 이는 "백의 자리" 숫자를 건드리는 것이 바위를 미는 것과 같다면, "일의 자리" 숫자를 건드리는 것은 조약돌을 툭 치는 것과 같다는 것을 의미합니다.
MissClick의 두 가지 얼굴
Yu Ran과 국방과학기술대학교 연구진이 이끄는 팀은 MissClick이라는 공격 도구를 구축했습니다. 그들은 이 시스템을 해킹하려면 숫자를 단순한 텍스트처럼 취급해서는 안 된다는 것을 깨달았습니다. 반드시 수학을 존중해야 합니다. 그들은 해커가 달성하고자 하는 목표에 따라 두 가지 다른 전략, 즉 "모드"를 설계했습니다.
모드 1: "Miss" (비표적 공격)
당신이 AI를 절벽 아래로 떨어뜨리고 싶다고 상상해 보세요. 그곳이 원래 있어야 할 곳이 아니기만 하면 어디에 떨어지든 상관하지 않습니다. 이것을 "비표적(untargeted)" 공격이라고 합니다. MissClick-U(U는 Untargeted를 의미)는 좌표의 "부드러운(soft)" 버전을 계산함으로써 작동합니다. AI가 단 하나의 숫자를 선택하기를 기다리는 대신, 가능한 모든 숫자의 확률을 살펴봅니다. "만약 AI가 8 대신 9를 고른다면 어떨까? 만약 7을 고른다면?"이라고 묻는 것입니다. 그런 다음 가중 평균을 계산하여 숫자들 사이에 떠 있는 "유령 좌표(ghost coordinate)"를 만듭니다. 목표는 이 유령 좌표를 올바른 지점에서 최대한 멀리 밀어내는 것입니다. 이 거리를 최대화함으로써, AI가 실제 클릭을 엉뚱한 곳으로 보내게 만드는 숫자를 선택하도록 강제합니다.
모드 2: "Hijack" (표적 공격)
이제, AI를 속여서 "저장" 버튼 대신 "계정 삭제"와 같이 위험한 특정 버튼을 클릭하게 만들고 싶다고 상상해 보세요. 이것은 "표적(targeted)" 공격입니다. 여기서 MissClick-T(T는 Targeted를 의미)는 다른 게임을 수행합니다. 단순히 클릭을 이동시키는 것이 아니라, 클릭을 특정 구역에 착륙시키고자 합니다. 연구진은 단순히 "평균" 숫자를 목표와 일치시키려고 노력하는 것만으로는 충분하지 않다는 것을 발견했습니다. 때때로 AI는 평균이 5라고 "생각"할 수도 있지만, 실제로는 가장 가능성이 높은 옵션인 1이나 9를 선택할 수도 있기 때문입니다. 따라서 MissClick-T는 "자릿수"에 집중합니다. 그것은 높은 가치의 숫자(백의 자리와 십의 자리)에 추가적인 압력을 가합니다. 즉, AI에게 "너는 백의 자리의 '8'을 반드시 맞춰야 해, 왜냐하면 그것이 클릭을 가장 많이 움직이기 때문이야"라고 말하는 것입니다. 각 숫자의 수학적 힘에 따라 중요도를 부여함으로써, 공격자의 목표물에 착륙하는 데 필요한 정확한 숫자를 AI가 선택하도록 강제합니다.
결과: 성공률의 큰 도약
연구팀은 데스크톱 컴퓨터, 웹 브라우저, 모바일 휴대폰의 세 가지 서로 다른 환경에서 두 가지 인기 있는 AI 모델인 OS-Atlas와 UGround를 대상으로 MissClick을 테스트했습니다. 그들은 수학을 무시하고 좌표를 일반 텍스트로 취급했던 기존의 해킹 기술들과 새로운 방법을 비교했습니다.
결과는 놀라웠습니다.
- "Miss" 공격의 경우: MissClick-U는 OS-Atlas에서 75.07%, UGround에서 **72.93%**의 확률로 AI가 엉뚱한 곳을 클릭하게 만드는 데 성공했습니다. 기존 방식은 각각 약 58%와 42%에 그쳤습니다. 이는 어떤 경우에는 성공률을 30퍼센트 포인트 이상 높인 엄청난 도약입니다.
- "Hijack" 공격의 경우: MissClick-T는 더욱 인상적이었습니다. 공격자가 선택한 목표로 클릭을 재지정하는 데 있어 OS-Atlas에서는 44.86%, UGround에서는 무려 **62.67%**의 성공률을 보였습니다. 기존 방식은 약 13%에서 15%의 성공률에 머물며 고전했습니다.
연구진은 또한 두 목표가 서로 다른 도구를 필요로 한다는 것을 발견했습니다. "Miss" 전략을 "Hijack"에 사용하려고 하면 잘 작동하지 않았고, 그 반대도 마찬가지였습니다. 이는 공격의 구체적인 목표를 이해하는 것이 숫자의 수학적 원리를 이해하는 것만큼 중요하다는 것을 확인시켜 주었습니다.
이것이 중요한 이유
이 논문은 단순히 AI가 속을 수 있다는 것을 보여주는 것이 아니라, 그 언어의 숨겨진 구조를 이해함으로써 어떻게 더 잘 속일 수 있는지를 보여줍니다. 저자들은 AI가 좌표를 숫자의 시퀀스로 생성하기 때문에, 그 숫자들의 "자릿수"가 취약점을 만든다고 제안합니다. 높은 가치의 숫자를 아주 조금만 바꿔도 최종 동작에는 거대한 변화를 일으킵니다.
하지만 연구진은 자신들의 작업에 한계가 있음을 주의 깊게 언급했습니다 있습니다. 그들은 좌표를 숫자로 된 텍스트로 작성하는 모델만을 테스트했습니다. 다른 방식으로 무언가를 가리키는 모델은 테스트하지 않았습니다. 또한 그들은 AI의 "두뇌"에 완전히 접근할 수 있는 상황("화이트박스" 시나리오)을 가정했는데, 이는 내부를 볼 수 없는 시스템을 해킹하는 것보다 쉬운 조건입니다. 그러나 핵심 아이디어, 즉 우리가 AI에게 숫자를 말하게 하는 방식이 보안에 중요하다는 점은 확실한 발견으로 보입니다.
결국, MissClick은 디지털 세계에서 숫자는 단순한 숫자가 아니라는 점을 상기시켜 줍니다. 숫자는 좌표이자, 명령이며, 때로는 함정입니다. 숫자의 마법 뒤에 숨겨진 수학을 이해함으로써, 연구진은 이러한 스마트한 에이전트들을 비틀거리게 하거나, 우리가 원하는 곳으로 정확히 조종할 수 있음을 보여주었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.