← 최신 논문
🤖 AI

Magnet: Detecting Cross-Session AI Misuse Through Capability Accumulation

이 논문은 단일 세션 모니터링을 회피하는 해로운 목표를 재구성하기 위해 여러 격리된 에이전트 상호작용으로부터 무해해 보이는 아티팩트들을 집계함으로써, 교차 세션 AI 오용을 식별하는 데 있어 발생하는 결정적인 공백을 해결하는 탐지 프레임워크인 Magnet을 소개한다.

원저자: Natalie Isak, Matthew Dressman

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Natalie Isak, Matthew Dressman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 단순히 수다스러운 로봇 한 대가 아니라, 전문화된 조력자들의 군단인 세상을 상상해 보십시오. 이것을 건설 현장의 작업 팀처럼 생각할 수 있습니다. 한 명은 벽돌을 쌓고, 다른 한 명은 시멘트를 섞으며, 세 번째는 벽을 칠합니다. 그들은 함께 협력하여 놀라운 무언가를 만들어냅니다. 하지만 만약 교활한 방해꾼이 이 팀을 이용해 함정과 같이 위험한 것을 만들려고 한다면 어떻게 될까요? 방해꾼은 만약 전체 팀에게 함정을 만들라고 한꺼번에 요청하면, 관리자(안전 시스템)가 "안 돼!"라고 말하며 즉시 차단할 것이라는 점을 알고 있습니다. 그래서 방해꾼은 영리하게 행동합니다. 그들은 크고 나쁜 계획을 작고, 지루하며, 전혀 해롭지 않아 보이는 과업들로 잘게 나눕니다. 그들은 벽돌공에게는 그저 "빨간 벽돌을 찾아줘"라고 요청하고, 화가에게는 "파란 페인트 한 통을 찾아줘"라고 요청하며, 나중에 시멘트 혼합기에게는 "풀을 좀 찾아줘"라고 요청합니다. 각 요청은 그 자체로는 무해해 보입니다. 문제는 AI 팀이 과업 사이마다 모든 것을 잊어버린다는 것입니다. 그들은 전날의 작업에 대한 기억이 없습니다. 하지만 방해꾼은 기억합니다. 그들은 이 작고 무해한 조각들을 모두 모아 나중에 그것들을 합쳐서 함정을 만듭니다. 이 논문은 이러한 "분할 정복(divide and conquer)" 기술이 어떻게 작동하는지 탐구하고, 함정이 완성되기 전에 방해꾼을 잡아낼 수 있는 새로운 방법을 제안합니다.

연구자들인 나탈리 이삭(Natalie Isak)과 매튜 드레스만(Matthew Dressman)은 그들의 새로운 탐지 도구를 **마그넷(Magnet)**이라고 부릅니다. 그들은 현재의 안전 시스템이 마치 한 번에 한 사람만을 바라보는 보안 요원과 같다는 것을 발견했습니다. 만약 어떤 사람이 들어와서 망치를 달라고 하고, 나중에 못을 달라고 하고, 또 나중에 나무를 달라고 한다면, 보안 요원은 세 개의 별개이며 무해한 요청으로 볼 뿐입니다. 그 사람은 이 세 가지를 합치면 무기를 만들 수 있다는 사실을 깨닫지 못합니다. 이 논문은 유해한 목표를 여러 개의 작고 고립된 세션으로 나누어 놓으면, 공격자가 이러한 보안 요원들을 성공적으로 우회할 수 있음을 보여줍니다. 테스트 결과, 이 "교차 세션(cross-session)" 기술은 한 번에 모든 것을 시도하는 것보다 훨씬 더 효과적이었습니다. 예를 들어, 피싱 키트(비밀번호를 훔치기 위한 도구)나 화염병 제조법을 만들려고 할 때, 단일 요청 시 성공률은 약 18%였으나, 요청을 여러 개의 별도 세션으로 나누었을 때는 거의 37%까지 치솟았습니다.

이 논문은 우리가 단순히 누군가가 무엇을 말하는지(의도)를 보는 것을 넘어, 그들이 실제로 무엇을 구축하고 있는지(역량)를 추적해야 한다고 주장합니다. 의도는 속이기 쉽습니다. 자신의 진짜 계획을 숨기기 위해 "악당에 관한 이야기를 쓰고 있다"라고 말할 수 있기 때문입니다. 하지만 그들이 모으는 실제 조각들—로그인 양식, 이메일을 보내는 스크립트, 화학 공식 등—은 숨기기가 더 어렵습니다. 마그넷은 건초더미 속의 자석처럼 작동합니다. 모든 대화(짚단 하나하나)를 검사하여 그것이 위험한지 확인하는 대신, 마그넷은 사용자가 거쳐온 모든 세션으로부터 특정하고 위험한 역량(바늘)만을 뽑아냅니다. 마그넷은 사용자가 수집한 모든 위험한 조각들의 목록을 계속해서 유지합니다. 만약 사용자가 위험한 세트를 완성할 만큼 충분한 조각들을 모은다면—예를 들어, 양식, 이메일 스크립트, 그리고 호스팅 안내서를 모두 가졌다면—마그넷은 경보를 울립니다. 설령 그 조각들 각각은 위험해 보이지 않았더라도 말입니다.

연구자들은 이 아이디어를 다른 방법들과 비교 테스트했습니다. 그들은 과거의 대화들을 짧은 요약본(마치 '하이라이트 영상'처럼)으로 압축하는 방식은 유해한 내용이 무해한 내용의 소음 속에 섞여 사라지는 경우가 많아 자주 실패한다는 것을 발견했습니다. 반면, 마그넷은 패턴을 포착하는 데 훨씬 더 뛰어납니다. 시뮬레이션에서 마그넷은 오탐(false alarm)을 낮게 유지하면서도 공격의 75%를 잡아낸 반면, 기존의 "세션별" 보안 요원들은 약 45%만을 잡아냈습니다. 논문은 AI 에이전트가 더 흔해지고 다양한 대화를 통해 작업하게 됨에 따라, 안전 시스템도 변화해야 한다고 제료합니다. 단순히 대화창만을 감시하는 것이 아니라, 사용자의 장기적인 "인벤토리(소지품 목록)"를 감시해야 한다는 것입니다. 이 연구는 피싱이나 무기와 같은 특정 위험에 초점을 맞추었지만, 저자들은 이 접근 방식이 누군가가 몇 주 또는 몇 달에 걸쳐 서서히 유해한 행동에 휘말리는 것과 같은 느리게 진행되는 문제들을 포착하는 데도 도움이 될 수 있다고 제안합니다. 핵심적인 교훈은 위험은 종종 많은 작고 무해한 부분들의 합 속에 숨어 있으며, 우리는 전체 그림을 볼 수 있는 새로운 종류의 탐지기가 필요하다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →