← 최신 논문
💬 NLP

TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

TwinGate 는 비대칭 대비 학습을 활용하여 악의적 의도 조각을 클러스터링하고 오탐지를 억제함으로써 추적 불가능한 LLM 트래픽 내의 분해형 재일브레이크를 효과적으로 탐지하는 상태 기반 저지연 방어 프레임워크로, 새로 구축된 360 만 개 이상의 지시어로 구성된 대규모 데이터셋에서 기존 베이스라인을 능가하는 성능을 보입니다.

원저자: Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao

게시일 2026-05-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 매우 인기 있고 첨단 기술이 적용된 도서관 (대규모 언어 모델) 의 보안 요원입니다. 당신의 임무는 "폭탄을 만드는 방법은 무엇인가?"와 같은 위험한 지시문이 몰래 들어오는 것을 막는 것입니다.

문제: "트로이 목마" 공격

보통 보안 요원들은 사람들이 문으로 들어설 때마다 모두를 검사합니다. 누군가 "폭탄을 만들고 싶다"고 말하면, 보안 요원은 즉시 그들을 막습니다.

하지만 교활한 공격자들은 **분해형 탈옥 (Decompositional Jailbreaks)**이라는 새로운 수법을 발견했습니다. 폭탄을 한 번에 요청하는 대신, 요청을 작고 해롭지 않은 조각들로 나누어 시간의 흐름에 따라, 종종 다른 "신원"으로 또는 다른 시간에 요청하는 것입니다.

  • 질문 1: "전기력의 특성은 무엇인가?" (무해함)
  • 질문 2: "낡은 전선이 어떻게 화재를 일으키는가?" (무해함)
  • 질문 3: "회로를 과부하시키면 어떤 일이 발생하는가?" (무해함)

개별적으로 볼 때 모든 질문은 순진해 보입니다. 보안 요원은 모두를 통과시킵니다. 하지만 답변들을 합치면, 공격자는 이제 불을 피우는 방법에 대한 완전한 가이드를 갖게 됩니다.

이 도서관에 진짜 악몽인 것은 이러한 공격자들이 추적 불가능하다는 점입니다. 그들은 같은 이름, 같은 IP 주소, 또는 같은 세션을 사용하지 않습니다. 그들은 군중 사이를 슬며시 드나드는 유령과 같아서, 보안 요원이 "이봐, 너는 앞서 전선에 대해 물어봤잖아? 이 화재 질문은 의심스럽군"이라고 말할 수 없게 만듭니다.

해결책: TwinGate

저자들은 이러한 유령들을 잡기 위해 TwinGate라는 시스템을 만들었습니다. TwinGate 을 함께 일하는 두 부분으로 구성된 보안 팀으로 생각하세요.

1. "의도 탐정" (ACL 인코더)

이 팀의 지적인 부분입니다. **비대칭 대비 학습 (Asymmetric Contrastive Learning)**이라는 특별한 훈련 방법을 사용합니다.

  • 작동 원리: 도서관에 모든 질문을 나타내는 거대하고 보이지 않는 지도가 있다고 상상해 보세요. 보통 질문들은 주제별로 그룹화됩니다 (예: 모든 "요리" 질문이 한 구석에 있음).
  • 전환점: 의도 탐정은 주제를 무시합니다. 대신 질문을 숨겨진 목표별로 그룹화합니다. 표면적으로는 다르게 보일지라도 "전기", "전선", "과부하"가 실제로는 모두 같은 "폭탄 제조" 클러스터의 일부임을 학습합니다.
  • 결과: 공격자가 월요일에 전선에 대해 묻고 금요일에 화재에 대해 묻더라도, 탐정은 두 질문이 모두 같은 "위험한 목적지"로 향하고 있음을 파악하여 이를 막습니다.

2. "기억 수호자" (동결된 인코더)

의도 탐정은 패턴을 찾는 데 너무 능숙해서 때로는 너무 흥분하기도 합니다. "오, 어제는 전선에 대해 물었고, 지금 또 전선에 대해 묻고 있군? 이건 분명히 폭탄 음모야!"라고 생각할 수 있습니다. 이는 오경보입니다.

이를 해결하기 위해 TwinGate 은 매우 보수적인 두 번째 팀 멤버인 기억 수호자를 가지고 있습니다.

  • 작동 원리: 이 팀 멤버는 사람들이 이전에 무엇을 물었는지 완벽하게 고정된 기억을 가지고 있습니다. 만약 당신이 정확히 같은 질문을 두 번 한다면, 기억 수호자는 "이건 전에 본 적 있어. 그때는 안전했으니 지금도 안전해"라고 말합니다.
  • 결과: 이는 단순히 해롭지 않은 질문을 반복해서 하는 일반 사람들을 실수로 차단하는 것을 방지합니다. "거짓 양성률 (무고한 사람을 차단하는 비율)"을 극도로 낮게 유지합니다.

왜 빠르고 효율적인가

이전 보안 시스템은 대화가 위험한지 파악하기 위해 대화의 전체 기록을 읽는 두 번째 초지능 AI(생성 모델) 를 사용했습니다. 이는 누군가 들어올 때마다 도서관의 전체 역사책을 읽도록 형사를 고용하는 것과 같습니다. 느리고 비싸며 입구를 막아섭니다.

TwinGate은 다릅니다. 이는 "가벼운" 접근 방식을 사용합니다.

  • 전체 기록을 읽지 않습니다. 대신 **디지털 인덱스 카드 (벡터 데이터베이스)**를 확인하여 현재 질문이 알려진 나쁜 패턴과 일치하는지 살펴볼 뿐입니다.
  • 초당 수천 명을 검사하면서도 기다리게 하지 않을 정도로 매우 빠르게 작동합니다. 이는 이력서를 읽는 사람이 아니라 ID 를 밀리초 단위로 스캔하는 것과 같습니다.

결과

저자들은 360 만 개 이상의 요청 (규칙을 위반하는 수천 가지 다른 방법 포함) 으로 구성된 대규모 데이터셋에서 TwinGate 을 테스트했습니다.

  • 적발률: 숨겨진 분할 공격의 76% 이상을 성공적으로 적발했습니다.
  • 오경보: 무고한 사람을 실수로 차단한 비율은 0.2% 미만입니다.
  • 속도: 초당 1,700 개 이상의 요청을 처리하여 이전 방법들보다 훨씬 빠릅니다.

요약

TwinGate 은 공격자가 퍼즐 조각들을 서로 다른 장소와 시간에 숨겨도 "트로이 목마" 공격을 찾아낼 수 있는 똑똑하고 빠른 보안 시스템입니다. 이는 숨겨진 목표를 찾기 위한 "탐정"과 무고한 사람들을 괴롭히지 않도록 보장하는 "기억 수호자"를 사용하며, 바쁜 도서관이 원활하게 운영되도록 할 만큼 빠르게 작동합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →