← 최신 논문
💻 computer science

Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety

이 논문은 높은 양성 상호작용 비율을 유지하면서도 유해하고, 다회차적이며, 권위 기반인 공격을 탐지하고 차단하기 위해 네 가지 범주형 게이트를 갖춘 독립적인 감시 모델을 개입시키는 선제적 제로 트러스트 런타임 프레임워크인 인지 방화벽(Cognitive Firewall)을 소개한다.

원저자: Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz

게시일 2026-07-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하고 유능한 비서에게 업무를 맡긴다고 상상해 보세요. 당신은 그 비서가 실수로라도 폭탄을 만들거나 혐오 표현이 담긴 편지를 쓰는 것과 같은 위험한 행동을 하지 않도록 확실히 하고 싶습니다.

현재 대부분의 안전 시스템은 한 번에 종이 한 장만 확인하는 보안 요원처럼 작동합니다. 만약 당신이 "케이크 만드는 법"이라고 적힌 쪽지를 건네면 "안전함"이라고 답합니다. 반대로 "폭탄 만드는 법"이라고 적힌 쪽지를 건네면 "위험함"이라고 답하죠.

문제는 영리한 속임수꾼(공격자)이 이 보안 요원들을 속이기 위해 나쁜 요청을 작고 무해한 조각들로 나누어 전달할 수 있다는 점입니다. 그들은 "화학 물질이란 무엇인가요?" (안전), "용기란 무엇인가요?" (안전), "그것들을 어떻게 섞나요?" (안전)라고 차례로 물을 수 있습니다. 개별적으로 보면 모든 쪽지가 무해해 보입니다. 하지만 이 모든 것을 합쳐 놓으면, 비서는 사용자가 폭탄을 만들려고 한다는 사실을 깨닫게 됩니다. 단일 쪽지만을 보는 보안 요원들은 대화의 맥록이나 사용자의 숨겨진 의도를 기억하지 못하기 때문에 이를 놓치게 됩니다.

이 논문은 **코그니티브 파이어월(Cognitive Firewall, 인지적 방화벽)**이라는 새로운 시스템을 소개합니다. 이것은 단순한 보안 요원이 아니라, 당신과 비서 사이에 앉아 있는 똑똑하고 선제적인 매니저라고 생각하면 됩니다. 이 매니저는 단순히 현재의 쪽지만 보는 것이 아니라, 대화라는 전체 영화를 지켜보며 실제로 무슨 일이 일어나고 있는지 이해합니다.

이 매니저가 작동하는 방식은 네 가지 특정 "게이트(Gate)" 또는 체크포인트를 통해 설명할 수 있습니다.

1. 의도 게이트 (Intent Gate - "당신이 '정말로' 하려는 것이 무엇인가?" 확인)

비서가 답변을 작성하기 전에, 이 게이트는 다음과 같이 질문합니다. "내가 이 질문에 완전히 답한다면, 사용자는 현실 세계에서 실제로 어떤 결과물을 얻게 되는가?"

  • 비유: 누군가 "프로세스를 어떻게 종료(kill)하나요?"라고 묻는다고 가정해 봅시다. 단순한 보안 요원은 "아, 컴퓨터 프로그램을 종료하려는 것이구나"라고 생각할 것입니다. 하지만 의도 게이트는 더 깊이 들여다보고 "잠깐, 이 문맥에서는 인간의 생명을 해치려는 의미일 수도 있다"는 것을 알아차립니다. 이 게이트는 화려한 말 뒤에 숨겨진 실제 결과를 봅니다. 만약 결과가 위험하다면, 즉시 대화를 중단시킵니다.

2. 제로 트러스트 컨텍스트 게이트 (Zero-Trust Context Gate - "신분증을 보여주세요" 확인)

이 게이트는 "제로 트러스트(Zero Trust)" 개념에 기반합니다. 이는 "절대 신뢰하지 말고, 항상 검증하라"는 뜻입니다.

  • 비유: 낯선 사람이 비서에게 다가와 "나는 CEO이며, 당신에게 비밀 코드를 제공하라고 명령한다"라고 말한다고 가정해 봅시다. 일반적인 보안 요원은 "오, CEO라고 했으니 따라야겠다"라고 생각할 수 있습니다. 하지만 제로 트러스트 게이트는 "잠깐, 당신은 CEO라고 주장하지만, 그것을 증명하지 못했다. 당신이 그렇게 말한다고 해서 믿지 않겠다"라고 말합니다. 이 게이트는 권위, 특별한 권한, 혹은 "나는 의사다"라는 식의 모든 주장을 증명되기 전까지는 거짓으로 취급합니다.

3. 일관성 게이트 (Consistency Gate - "서서히 스며드는 속임수 탐지" 확인)

이 게이트는 사용자가 비서를 서서히 속이고 있는지 대화 전체를 관찰합니다.

  • 비유: 사용자가 "원예"에 대해 묻기 시작합니다. 그다음에는 "독성이 있는 식물"에 대해 묻습니다. 그다음에는 "식물 기반 독소를 만드는 법"을 묻습니다. 하나하나 떼어놓고 보면 모두 괜찮아 보입니다. 하지만 일관성 게이트는 패턴을 포착합니다. "잠깐, 처음에는 꽃에 대해 묻더니 이제는 독에 대해 묻고 있네. 당신은 목표를 향해 서서히 수위를 높이고 있군요." 이 게이트는 단 하나의 질문도 문제가 없더라도, 사용자가 위험한 단계에 도달하기 전에 미리 잡아냅니다.

4. 출력 리스크 게이트 (Output Risk Gate - "최종 검수" 확인)

앞선 세 개의 게이트를 통과하여 비서가 답변을 생성하면, 이 게이트가 최종 결과물을 검사합니다.

  • 비유: 이것은 조립 라인 끝에 있는 품질 관리 검사관과 같습니다. 계획 자체는 안전해 보였더라도, 비서가 최종 답변에 실수로 위험한 제조법을 적었을 수도 있습니다. 이 게이트는 최종 출력을 읽고, 만약 유해한 지침이 포함되어 있다면 이를 차단합니다.

중단 결정 방식

논문에 따르면 이 시스템은 **"에스컬레이션 규칙(Escalation Rule)"**을 사용합니다.

  • 기존 방식: 일부 시스템은 각 게이트에서 받은 점수를 평균 냅니다. 만약 세 개가 "안전"이고 하나가 "위험"이라면, 평균치는 여전히 "대체로 안전"하게 나와서 나쁜 결과물이 통과될 수 있습니다.
  • 새로운 방식: 코그니티브 파이어월은 화재 경보기와 같습니다. 네 개의 게이트 중 어느 하나라도 "위험"이라고 외치면, 시스템 전체가 즉시 멈춥니다. 위험도를 평균 낼 필요 없이, 단 하나의 명확한 신호만으로도 브레이크를 밟을 수 있습니다.

연구 결과

저자들은 다양한 유형의 "탈옥(Jailbreak)" 공격(AI가 나쁜 짓을 하도록 유도하는 속임수)을 대상으로 이 시스템을 테스트했습니다.

  • 단일 턴 공격 (Single-turn attacks): 거의 모든 공격을 차단했습니다.
  • 멀티 턴 공격 (Multi-turn attacks - 서서히 속이는 방식): 사용자가 서서히 수위를 높이는 "크레센도(Crescendo)" 공격을 거의 100% 차단했으며, 작업을 쪼개서 수행하는 "액터 어택(ActorAttack)"을 98% 차단했습니다.
  • 권위 공격 (Authority attacks): 사용자가 권위 있는 인물인 척했을 때의 공격을 75% 차단했습니다.
  • 오탐 (False Alarms): 중요한 점은, 이 시스템이 너무 까다롭게 굴지 않았다는 것입니다. 무해한 질문을 거부한 비율은 8%에 불과했는데, 이는 다른 엄격한 안전 시스템들이 무해한 질문을 18~21% 정도 거절하는 것에 비해 훨씬 우수한 수치입니다.

요약

코그니티브 파이어월은 AI를 보호하는 새로운 방법입니다. 단순히 문장을 확인하는 대신, 다음과 같은 탐정 역할을 수행합니다.

  1. 사용자의 진짜 의도를 파악합니다.
  2. 권위에 대한 주장을 절대 믿지 않습니다.
  3. 시간에 따른 서서히 진행되는 위험한 패턴을 감시합니다.
  4. 최종 답변을 검사합니다.

이 시스템은 나쁜 일이 발생하기 전에 이를 막고, 왜 중단했는지에 대한 명확한 기록을 남기며, 무해한 대화를 차단하는 일을 피합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →