← 최신 논문
🤖 AI

Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents

이 논문은 독립적인 LLM 에이전트들 사이에서 분산되고 비동기적인 적대적 세션들을 연결하는 문제를 해결하기 위해 비동기 귀속 지문 벡터(A2FVA^2FV) 방법과 SCD-v1 벤치마크를 소개하며, 구조적 및 문체적 잔류물이 기존의 세션별 탐지기가 실패하는 지점에서 효과적인 캠페인 귀속을 가능하게 함을 입증한다.

원저자: SangJin Park, Myungsub Choi, Jineok Kim, Minseung Kang

게시일 2026-07-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: SangJin Park, Myungsub Choi, Jineok Kim, Minseung Kang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 디지털 비서들—코드를 작성하거나, 고객 질문에 답하거나, 데이터를 분석하는 에이전트들—이 마치 독립적인 탐정 팀처럼 움직이는 세상을 상상해 보십시오. 각 탐정은 자신만의 사무실과 노트를 가지고 있으며, 업무를 수행하는 동안 서로 대화하지 않습니다. 이제, 비밀을 훔치려는 거물급 범죄자를 상상해 보십시오. 이 범죄자는 한 번에 하나의 사무실을 뚫으려 하는 대신, 서로 다른 시간대에 여러 탐정에게 작고 혼란스러운 단서들을 보냅니다. 탐정 A에게 그 단서는 무해한 오타처럼 보입니다. 탐정 B에게는 이상한 서식 오류처럼 보입니다. 탐정 C에게는 평범한 질문처럼 보입니다. 만약 각 탐정이 자신의 노트만 들여다본다면, 아무런 수상한 점도 발견하지 못할 것입니다. 그들은 "오, 그냥 단순한 글리치(오류)네"라고 생각할 것입니다. 하지만 만약 당신이 한 걸음 물러나 팀 전체의 노트를 한꺼번에 볼 수 있다면, 이 작은 글리치들이 사실 하나의 거대하고 조직적인 탈취 계획의 일부였다는 것을 깨달을 수 있을 것입니다. 이것이 바로 "크로스 에이전트(cross-agent)" 공격의 문제입니다. 악당들은 독립적인 시스템 사이의 틈새 속에 숨어듭니다.

이 논문은 컴퓨터 보안의 특정 영역인 **LLM 에이전트 방어(LLM-agent defense)**를 다룹니다. 간단히 말해, 거대 언어 모델(LLM) 에이전트는 도구(웹 검색이나 파일 읽기 등)를 사용할 수 있는 똑똑한 컴퓨터 프로그램입니다. 보통 보안 팀은 에이전트가 속임수에 넘어가는지 확인하기 위해 한 번에 한 가지 질문을 던져 테스트합니다. 하지만 현실 세계에서 공격은 며칠에 걸쳐, 여러 팀을 거쳐, 그리고 다양한 프로그램을 통해 발생할 수 있습니다. 핵심적인 질문은 이것입니다. 우리가 이 흩어져 있고 고립된 사건들을 연결하여, 설령 그 악당이 누구인지 모르더라도 이 모든 것이 동일한 악당으로부터 온 것임을 알아낼 수 있을까요? 이 논문의 저자들은 "그렇다"라고 말하며, 에이전트들이 서로 대화할 필요가 없는 매우 구체적이고 영리한 방법을 제시합니다.

Tynapse라는 회사의 연구진은 이러한 "유령" 캠페인을 잡아내기 위한 새로운 방법을 소개합니다. 그들은 이 방법을 A2FV(Asynchronous Attribution Fingerprint Vectors, 비동기 귀속 지문 벡터)라고 부릅니다. A2FV를 모든 에이전트의 사무실 밖에 앉아 그들이 보내고 받는 우편물을 지켜보는 아주 똑똑한 탐정이라고 생각해 보십시오. 이 탐정은 에이전트의 머릿속에 있는 비밀스러운 생각들을 읽을 필요가 없습니다(그것은 불가능하니까요). 대신, 그들은 우편물에 남겨진 "발자국"을 살핍니다.

이 탐정이 작동하는 방식은 다음과 같습니다:

  1. 구조적 발자국(The Structural Footprint): 에이전트가 도구(예: "검색" 또는 "파일 읽기")를 사용할 때 특정 패턴이 남습니다. 악당이 사용하는 단어를 바꾸더라도, 그들이 요청하는 도구의 순서는 대개 일정하게 유지됩니다. 이는 범죄자가 코트와 모자를 바꿔 써도 항상 특정한 종류의 신발을 신는 것과 같습니다.
  2. 스타일적 발자국(The Stylistic Footprint): 이것은 공격의 "필체"입니다. 악당이 메시지를 다시 작성하더라도, 그들은 여전히 특유의 이상한 문장 부호, 독특한 어투, 혹은 특정한 오타 방식을 유지할 수 있습니다. 이는 위조범이 서명은 흉내 낼 수 있어도, 글자의 기울기 같은 자신만의 고유한 습관은 버리지 못하는 것과 같습니다.
  3. 타이밍 발자국(The Timing Footprint): 이는 요청 사이의 시간 간격을 추적합니다. 논문에서는 이것이 특정 테스트에서 약한 단서라는 것을 발견했지만, 여전히 범죄자가 항상 정해진 시간에 문을 두드리는지 확인하는 것과 같은 탐정의 도구 상자에 포함되어 있습니다.

연구팀은 이 탐정이 실제로 사건을 해결할 수 있는지 확인하기 위해 SCD-v1이라는 특별한 테스트 환경을 구축했습니다. 그들은 정상적이고 평범한 트래픽과, "악당"이 여러 에이전트에게 시간에 걸쳐 관련된 단서들을 보내는 가짜 공격을 섞어서 만들었습니다. 그들은 에이전트들이 노트를 공유할 수 없도록 했고, 공격이 실제 세계처럼 간격을 두고 발생하도록 설계했습니다.

결과는 상당히 유망했습니다. A2FV 탐정에게 세션들을 연결하라고 요청했을 때, 약 82%(점수 0.82)의 확률로 정답을 맞혔습니다. 이를 비교해 보자면, 개별 메시지의 "안전 점수"만을 보거나 거대한 AI에게 전체를 판단하게 했던 다른 방법들은 기본적으로 무작위 추측 수준이었으며, 약 **50%**의 확률로만 정답을 맞혔습니다. 논문은 "구조적" 및 "스타일적" 발자국이 이 퍼즐을 푸는 데 가장 큰 비중을 차지한 진정한 주인공이었다고 제안합니다.

하지만 논문은 이것이 모든 것을 해결하는 마법의 탄환이라고 말하지 않도록 매우 주의를 기울였습니다. 그들은 악당이 자신의 스타일이나 타이밍을 바꾸어 숨으려고 시도할 때 어떤 일이 벌어지는지 테스트했습니다. 그 결과, 영리한 악당이 공격을 하나의 "캠페인"(단서를 흩뿌리는 것)으로 묶는 것을 어렵게 만들 수는 있지만, 개별 단서들 사이의 연결 고리를 완전히 지울 수는 없다는 것을 발견했습니다. "지문"은 악당이 자신을 변장하려고 노력하더라도 세션을 연결할 수 있을 만큼 충분히 눈에 띄게 남아 있었습니다.

저자들은 또한 이 방법이 사용된 특정 컴퓨터 프로그램의 우연한 결과인지 확인했습니다. 그들은 Qwen이나 Gemini와 같은 다른 AI 모델로 동일한 테스트를 수행했고, 결과가 유효하다는 것을 확인했습니다. 심지어 "악당"들이 시스템을 속이기 위해 동일한 주제(예: "비밀번호 훔치기")를 사용하는지도 확인했습니다. 그들은 주제가 같더라도, 이 방법이 실제 조직적인 공격과 단순히 유사한 질문을 하는 무작위 사람들 사이의 차이를 구분할 수 있다는 것을 발견했습니다.

요약하자면, 이 논문은 우리가 AI 에이전트를 위한 새로운 보안 계층이 필요함을 시사합니다. 우리는 더 이상 각 에이전트를 고립된 상태로 감시해서는 안 됩니다. 흩어진, 비동기적인 발자국을 보고 "이봐, 이 세 건의 별개 사건은 사실 동일한 거물급 인사의 소행이야"라고 말할 수 있는 "중앙 관찰자"가 필요합니다. 이것이 모든 미래의 속임수(특히 악당이 매우 똑똑해지고 실시간으로 적응할 경우)를 막아주는 완벽한 방패는 아닐지라도, 흩어진 공격들을 연결하는 것이 가능하며 측정 가능하다는 것을 증명합니다. 이는 혼란스러운 격리된 경보의 덩어리를 풀 수 있는 미스터리로 바꾸어 놓으며, 보안 팀이 악당들이 왕국의 열쇠를 훔치기 전에 그들을 잡을 수 있는 훨씬 더 나은 기회를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →