← 최신 논문
🤖 machine learning

When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems

이 논문은 유해한 페이로드가 개별적으로는 무해한 파편들로 분할될 때 멀티 에이전트 LLM 시스템 내의 로컬 런타임 모니터가 분산된 백도어를 탐지하는 데 실패함을 입증하며, 안전성이 조립된 객체를 탐지하거나 해악이 드러나는 기저 표현(underlying representation)에 접근함으로써만 보장될 수 있는 관측 가능성 경계(observability boundary)를 설정한다.

원저자: Yibo Hu, Ren Wang

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yibo Hu, Ren Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 첨단 기술이 집약된 공장의 보안 요원이라고 상상해 보십시오. 당신의 임수는 나쁜 놈들이 위험한 밀수품을 몰래 들여오는 것을 막는 것입니다. 보통 당신은 컨베이어 벨트를 타고 내려오는 모든 패키지를 하나하나 검사합니다. 상자가 수상해 보이면 멈춰 세우고, 정상적으로 보이면 통과시킵니다.

AI의 세계에서 이 "패키지"들은 서로 협력하는 서로 다른 AI 에이전트들 사이에 오가는 메시지들을 의미합니다. 표준 안전 규칙은 다음과 같습니다: 모든 메시지를 개별적으로 확인하라. 만약 모든 메시지가 안전해 보인다면, 전체 시스템도 안전하다는 것입니다.

하지만 이 논문(Yibo Hu와 Ren Wang 저술)은 이 규칙에 존재하는 무서운 허점을 밝혀냈습니다. 그들은 공격자들이 위험한 "폭탄"을 아주 작고 무해해 보이는 조각들로 나누어 여러 패키지에 숨겨두고 보안 요원을 속일 수 있다는 사실을 발견했습니다.

"프랑켄슈타인" 폭탄

여기 트릭이 있습니다. 공격자들은 하나의 커다란 나쁜 메시지를 보내는 대신, 세 개의 별도 보고서를 보냅니다.

  • 보고서 1: "데이터 검색 완료; 247개의 항목이 기록되었습니다." (완전히 정상적으로 보입니다.)
  • 보고서 2: "분석 완료; 이상 징후 없음." (이 또한 괜찮아 보입니다.)
  • 보고서 3: "요약 준비 완료; 모든 작업 완료." (완벽하게 무해합니다.)

당신의 보안 요원은 보고서 1을 검사합니다. 통과. 보고서 2를 검사합니다. 통과. 보고서 3을 검사합니다. 통과. 보안 요원은 완벽하게 임무를 수행하고 있습니다! 각각의 검사는 모두 옳습니다.

하지만, 그 후 최종 AI 에이전트가 이 세 개의 보고서를 가져와 하나로 합칩니다. 갑자기 조각들이 딱 들어맞으며 비밀스러운 실행 가능한 컴퓨터 프로그램이 형성됩니다. 이 프로그램은 비밀번호를 훔쳐 해커에게 전송합니다. "폭탄"은 오직 조각들이 조립되었을 때만 존재합니다. 위험은 개별 패키지에 있었던 것이 아니라, 그 조립(assembly) 과정에 있었습니다.

저자들은 이를 **"관측 가능성 경계(Observability Boundary)"**라고 부릅니다. 이는 모래 위에 그어진 선과 같습니다. 나쁜 조각들이 너무 잘게 쪼개져서 평범하고 지루한 트래픽처럼 보이게 되면, 당신의 보안 요원은 눈이 멀게 됩니다. 보안 요가 아무리 똑똑하더라도, 한 번에 한 조각씩만 본다면 위험을 포착할 수 없습니다.

보안 요원이 틀리는 이유

이 논문은 사람들이 희망할 법한 몇 가지 사항에 대해 명시적으로 반박합니다.

  • 쪼개는 것이 문제가 아니다: 당신은 "아, 메시지를 쪼개지 못하게 막으면 안전해지겠지"라고 생각할 수도 있습니다. 저자들은 아니오라고 말합니다. 메시지가 분할되더라도, 만약 그 조각들에 "단서"(예: 이상한 코드 단어나 기묘한 데이터 경로)가 남아 있다면, 똑똑한 보안 요는 여전히 잡아낼 수 있습니다. 문제는 조각들이 **국소적으로 무해(locally benign)**할 때, 즉 100% 평범하고 지루한 텍스트처럼 보일 때 발생합니다.
  • 더 많은 눈이 도움이 되지 않는다: 당신은 "모든 메시지를 한꺼번에 보는 보안 요원이 있다면 어떨까?"라고 생각할 수 있습니다. 논문은 이를 테스트했습니다. 설령 보안 요가 세 개의 보고서를 한꺼번에 본다 하더라도, 만약 그들이 비밀 코드를 해독하는 법을 모른 채 여전히 가공되지 않은 텍스트만을 보고 있다면, 여전히 공격을 놓치게 됩니다. 더 많이 보는 것만으로는 부족합니다. 올바른 종류의 그림을 볼 줄 알아야 합니다.
  • AI는 마법의 해독기가 아니다: 저자들은 알려진 비밀 코드를 사용하지 않고도 조각들을 어떻게 다시 합칠지 추측하는 초지능 AI를 사용해 보았습니다. 결과는 거의 작동하지 않았습니다. 50번의 공격 중 단 6번만 잡아냈는데, 이는 사실상 찍기에 불과합니다.

승리할 수 있는 유일한 방법 (현재까지)

그렇다면 어떻게 이 폭탄을 막을 수 있을까요? 논문은 당신이 무엇을 보고 있는지를 바꾸는 것만이 유일한 방법임을 보여줍니다.

만약 공격자들이 사용하는 비밀 언어를 알고 있는 "해독기(decoder)"가 있다면, 당신은 그 세 개의 무해한 보고서를 가져와서 해독할 수 있고, 그러면 숨겨진 코드가 드러나게 됩니다. 테스트에서 특정 "코드 계열"을 사용하는 해독기를 사용했을 때, 그들은 **100%**의 공격(50건 중 50건)을 차단했습니다.

하지만 함정이 있습니다. 이 해독기는 특정 자물쇠에 대한 마스터 키를 가진 것과 같습니다. 만약 공격자들이 자물쇠를 바꾼다면(다른 코드 계열을 사용한다면), 해독기는 작동하지 않을 수 있습니다. 이 논문은 매번 새로운 트릭마다 특정 해독기를 만드는 대신, 이러한 숨겨진 패턴을 포착할 수 있는 보편적인 방법을 찾는 것이 향-후 연구자들에게 남겨진 거대한 미제 과제라고 제안합니다.

마법 뒤의 숫자들

저자들은 단순히 추측한 것이 아니라, 통제된 실험실에서 일련의 테스트를 수행했습니다.

  • 공격자들이 조각들을 완벽하게 정상적으로 보이게 만들었을 때(국소적으로 무해할 때), 표준 보안 검사는 우연 수준(1.0이 완벽일 때 약 0.500)으로 떨어졌습니다. 그들은 사실상 동전 던지기를 하고 있었던 셈입니다.
  • 하지만, 조립된 객체를 바라보고 특수한 "One-class" 탐지기(정상적인 것들만 학습하여 이상함을 찾아내는 방식)를 사용했을을 때, 그들은 신호를 0.874의 점수로 회복했습니다.
  • "해독된 뷰 게이트(decoded-view gate, 마스터 키를 가진 것)"를 사용했을 때, 그들은 성공한 공격을 0건으로 줄였습니다. 공격자들은 뚫고 들어올 수 없었습니다.

핵심 요약

주요 시사점은 다소 무섭지만 매우 명확합니다: 국소적 안전이 곧 전역적 안전은 아니다. 다중 에이전트 시스템의 각 단계가 안전해 보인다고 해서 최종 결과물까지 안전하다는 뜻은 아닙니다.

저자들은 일단 유해한 페이로드가 국소적으로 무해해 보이는 조각들로 분할되면, 어떤 국소적 탐지기도 이를 잡아낼 수 없다는 것을 증명했습니다. 승리하는 유일한 방법은 "조립된 객체"를 위험이 노출되는 형태로 볼 수 있는 방법을 찾는 것입니다. 우리가 (코드뿐만 아니라 계획이나 신념 등) 모든 유형의 트릭에 대해 이를 할 수 있는 방법을 찾아내기 전까지, 이 "관측 가능성 경계"는 우리 AI 안전망의 근본적인 구멍으로 남아 있습니다.

이는 마치 프랑켄슈타인의 괴물을 막기 위해 개별 신체 부위를 검사하는 것과 같습니다. 손은 안전해 보입니다. 발도 안전해 보입니다. 하지만 그것들을 합치면 괴물이 탄생합니다. 이 논문은 우리가 부품을 검사하는 것을 멈추고, 괴물이 깨어나기 전에 그 형태를 보는 법을 배워야 한다고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →