← 최신 논문
🤖 AI

Securing Multimodal AI through Internal Information Decomposition

본 논문은 부분 정보 분해(Partial Information Decomposition)에서 영감을 받은 플로우벡터(FlowVectors)를 이용한 내부 교차 모달 일관성 모니터링을 통해 적대적 공격을 탐지함으로써 멀티모달 AI를 보호하는 경량 추론 시점 프레임워크인 FlowGuard를 제안하며, 이는 최소한의 지연 시간 및 유틸리티 손실로 공격 성공률을 크게 감소시킨다.

원저자: Jehyeok Yeon, Hyeonjeong Ha, Qiusi Zhan, Heng Ji

게시일 2026-07-27
📖 5 분 읽기🧠 심층 분석

원저자: Jehyeok Yeon, Hyeonjeong Ha, Qiusi Zhan, Heng Ji

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 카메라를 통해 세상을 보고 마이크를 통해 당신에게 말을 거는 로봇을 만들고 있다고 상상해 보세요. 이 로봇은 이미지와 단어를 결합하여 일어나는 일을 이해하는 초스마트 AI인 '멀티모달 거대 언어 모델(Multimodal Large Language Model)'입니다. 하지만 여기 까다로운 문제가 있습니다. 로봇이 무해한 사진과 무해한 문장을 본다고 해서 그 둘의 '조합'이 반드시 안전하다는 뜻은 아닙니다. 이것은 마치 요리사에게 케이크 사진과 케이크 레시피를 건네주면서, 귀에 대고 독을 넣으라는 비밀 코드를 속삭드는 것과 같습니다. 사진도 괜찮아 보이고 레시피도 괜찮아 보이지만, 최종 요리는 위험해질 수 있습니다. 이것이 바로 연구자들이 우려하는 새로운 종류의 위험입니다: 해커들이 나쁜 의도를 이미지와 텍스트에 나누어 담아, 각각의 입력값은 의심스럽지 않게 보이면서도 결합되었을 때 AI를 속여 해로운 행동을 하게 만드는 것입니다.

이 교활한 속임수를 잡아내기 위해 과학자들은 보통 보안 요원이 가방과 신분증을 하나씩 따로 검사하듯, 사진이나 텍스트를 개별적으로 확인하려고 시도합니다. 하지만 이 논문은 더 똑똑한 방법을 제안합니다: 단순히 입력을 확인하는 대신, 로봇의 뇌가 그것들을 어떻게 '생각'하는지를 관찰해야 한다는 것입니다. 핵심 아이디어는 로봇이 정상적으로 작동할 때, 사진과 텍스트는 서로 일치하며 로봇이 명확하고 확신 있는 결정을 내리도록 도와야 한다는 것입니다. 만약 해커가 로봇을 속이려 한다면, 이 내부적인 합의가 깨집니다. 로봇의 뇌는 혼란에 빠지거나, 사진과 텍스트가 서로 반대 방향으로 끌어당기게 됩니다. 비록 최종 답변은 매끄럽게 보일지라도 말입니다. 이 논문은 FlowGuard라는 새로운 안전 시스템을 제안하는데, 이는 단순한 '생각 탐정'처럼 작동합니다. 즉, 표면적인 단어나 픽셀을 체크하는 것이 아니라, 로봇의 내부 추론 과정을 지켜보며 사진과 텍스트가 서로 싸우고 있는지, 혹은 이상하게 행동하고 있는지를 포착합니다.

FlowGuard 이야기: "사고의 균열"을 잡아내다

연제혁 교수와 동료들이 이끄는 연구진은 이러한 AI 모델이 어떻게 작동하는지에 대한 매혹적인 사실을 발견했습니다. 여러분이 모델에게 일반적인 이미지와 일반적인 질문을 주면, 이미지를 보는 뇌의 부분과 텍스트를 읽는 부분이 보통 아주 잘 어울립니다. 그들은 정보를 공유하고, 무엇이 중요한지에 대해 동의하며, 최종 답변은 안정적이고 확실하게 느껴집니다. 이것은 마치 두 친구가 함께 모래성을 쌓는 것과 같습니다. 두 사람 모두 성이 어떤 모습이어야 하는지 알고 있으며, 그들의 결합된 노력은 성을 더 튼튼하고 상세하게 만듭니다.

하지만 공격자가 모델을 '탈옥(jailbreak)'시키려 할 때—즉, 사진이나 텍스트 속에 나쁜 지시를 숨겨서 모델이 안전 규칙을 무시하도록 강제할 때—그 조화는 깨집니다. 논문에 따르면, 공격자가 사진과 텍스트를 각각 무해해 보이도록 충분히 영리하게 꾸몄더라도, 모델이 이 둘을 결합하려고 하는 순간 무언가 잘못됩니다. 내부 논리가 '균열(fractured)'됩니다. 사진은 한 가지를 외치고 있는데 텍스트는 다른 것을 속삭이거나, 혹은 그 조합이 모델의 뇌가 매끄럽게 해결할 수 없는 혼란스러운 엉망진창을 만들어낼 수 있습니다.

이를 잡기 위해 팀은 FlowGuard를 구축했습니다. FlowGuard를 문 앞의 경비원이 아니라, 로봇의 뇌 안에 앉아 있는 '번역가'라고 생각해보세요. FlowGuard는 최종 답변만을 보는 것이 아니라, 로봇의 의사 결정 과정 중 아주 첫 번째 찰나를 엿봅니다. FlowGuard는 세 가지 질문을 빠르게 던집니다:

  1. 로봇이 오직 사진만 본다면 뭐라고 할 것인가?
  2. 로봇이 오직 텍스트만 읽는다면 뭐라고 할 것인가?
  3. 로봇이 둘 다 함께 볼 때는 뭐라고 하는가?

그런 다음, 이 세 가지 답변을 비교합니다. 안전한 상황에서 '둘 다'의 답변은 빨간색과 노란색 물감을 부드럽게 섞어 오렌지색을 만드는 것처럼, 다른 두 답변의 행복한 혼합이어야 합니다. 하지만 공격이 발생하면, '둘 다'의 답변은 갑자기 이상한 색으로 변하거나, 빨간색과 노란색 물감이 서로 섞이기를 거부할 수도 있습니다. FlowGuard는 이 '혼합' 과정을 특정한 수학적 개념(부분 정보 분해, Partial Information Decomposition에서 영감을 얻음)을 사용하여 측정하고, 이를 통해 FlowVector를 생성합니다. 이것은 사진과 텍스트가 어떻게 상호작용하는지를 정확히 설명하는 네 개의 숫자로 된 작은 코드입니다.

  • 중복성 (Redundancy): 사진과 텍스트가 서로 동의하는가? (높은 중복성은 그들이 같은 생각을 하고 있음을 의미합니다).
  • 독자성 (Uniqueness): 어느 한쪽이 대화를 독점하고 있는가? (사진이 소리를 지르고 텍스트가 침묵하고 있다면, 이는 높은 시각적 독자성을 의미합니다).
  • 시너지 (Synergy): 둘을 결합하는 것이 답변을 더 명확하게 만드는가, 아니면 더 혼란스럽게 만드는가? (좋은 시너지는 전체가 부분의 합보다 크다는 것을 의미하며, 나쁜 시너지는 결합이 혼돈을 창조함을 의미합니다).

연구팀은 오직 '좋은' 예시들—로봇이 완벽하게 행동했던 수천 개의 정상적인 사진과 질문들—만을 사용하여 FlowGuard를 훈련시켰습니다. 그들은 AI 탐지기(Isolation Forest)가 '정상적인' 흐름이 무엇인지 인식하도록 가르쳤습니다. 오직 좋은 행동만을 가지고 훈련시켰기 때문에, 이 탐지기는 조금이라도 정상적인 패턴에서 벗어난 것을 발견하면 그것이 수상하다는 것을 알게 됩니다. 이것은 마치 보안 시스템에 일반적인 집의 소리를 가르치는 것과 같습니다. 침입자가 변장을 하고 있더라도, 창문이 깨지거나 바닥 판이 이상한 방식으로 삐걱거린다면 알람이 울리는 것과 같습니다.

연구 결과

결과는 놀라울 정도로 효과적이었습니다. 연구진은 ASCII 아트에 나쁜 단어를 숨기거나, 보이지 않는 픽셀 변화로 이미지를 뒤섞거나, 사진과 문장에 나쁜 지시를 나누어 담는 등 다양한 종류의 공격을 대상으로 FlowGuard를 테스트했습니다.

방어책이 없을 때, 이 모델들은 매우 취약했습니다. 가장 교활한 공격의 경우, 모델들은 90% 이상의 확률로 해로운 콘텐츠를 생성하며 기꺼이 실패했습니다. 하지만 FlowGuard를 켰을 때, 이러한 공격의 성공률을 15% 미만으로 대폭 낮추었습니다. 많은 경우, FlowGuard는 거의 모든 시도를 잡아내어 실패율을 한 자릿수(교차 모달 공격의 경우 약 6%~9%)로 떨어뜨렸습니다.

정말 멋진 점은 FlowGuard가 나쁜 놈들을 막는 것뿐만 아니라, 선한 사람들도 실수로 막지 않았다는 것입니다. 연구진은 FlowGuard가 까칠하게 굴며 정상적인 질문에 답변하기를 거부하는지 확인했습니다. 그 결과, FlowGuard는 정상적인 입력에 대해 약 2.4%의 오류만을 범했는데, 이는 안전을 위해 흔히 무해한 질문까지 차단해버리는 다른 안전 방식들에 비해 훨씬 뛰어난 수치입니다. 게ట 더, 매우 빨랐습니다. 다른 안전 점검 방식들이 복잡한 이미지 재구성을 실행하느라 몇 초의 시간이 걸리는 반면, FlowGuard는 약 1.3초 만에 임무를 수행하여 실시간 사용이 가능함을 증명했습니다.

또한 이 논문은 이 기술이 40억 개의 '뇌 세포'를 가진 작은 로봇부터 700억 개의 세포를 가진 거대한 로봇까지 다양한 유형의 로봇에서 작동함을 보여주었습니다. 심지어 API를 통해 접근하는 모델(전체 뇌를 볼 수는 없고 상위 예측값만 볼 수 있는 경우)에서도 작동했는데, 이는 '사고의 균열' 신호가 특정 설계의 글리치가 아니라 모델이 작동하는 방식의 근본적인 부분임을 입증합니다.

결론

이 논문은 멀티모달 AI를 보호하는 최선의 방법은 입력값 주변에 더 높은 벽을 쌓는 것이 아니라, AI가 어떻게 생각하는지에 귀를 기울이는 것이라고 제안합니다. 사진과 텍스트가 서로 사이좋게 지내지 못하는 순간을 감시함으로써, FlowGuard는 로봇이 문장을 완성하기도 전에 해커의 속임수를 포착할 수 있습니다. 이는 가볍고 빠르며 놀라울 정도로 강력한 보안 방식이며, 보안의 핵심은 기계의 마음속에 있는 내부적인 조화에 주목하는 것일 수도 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →