← 최신 논문
💬 NLP

SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning

SingGuard는 유연한 fast-to-slow 추론 스펙트럼과 fast-slow 분리형 강화 학습을 사용하여 자연어 안전 규칙에 따라 콘텐츠를 동적으로 평가하는 정책 적응형 멀티모달 가드레일 모델로, 새롭게 도입된 SingGuard-Bench에서 다양한 위험 유형과 동적 정책 변화에 대해 최첨단 성능을 달성합니다.

원저자: SingGuard Team

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: SingGuard Team

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 거대하고 북적이는 국제공항의 보안 팀장이라고 상상해 보십시오. 당신의 임리는 모든 승객(AI의 입력값)과 그들이 소지한 모든 수하물(이미지, 텍텍스트 또는 둘 다)을 검사하여 위험한 것이 통과되지 않도록 하는 것입니다.

과거에 보안 요원들은 고정된 규칙서를 가지고 있었습니다. 그들은 "칼"이 어떻게 생겼는지 정확히 알고 있었기에, 그것을 발견하면 승객을 제지했습니다. 하지만 만약 승객이 무해해 보이는 숟가락을 가져왔는데, 이것이 특정 종류의 수프와 결합했을 때 무기가 된다면 어떻게 될까요? 혹은 새로운 국가의 안전 법규가 달라져서 하룻밤 사이에 규칙이 바뀐다면 어떨까요? 기존의 보안 시스템은 혼란에 빠져, 위험한 것을 통과시키거나 무해한 사람을 불필요하게 막게 될 것입니다.

SingGuard는 이러한 문제들을 해결하기 위해 설계된 새롭고 매우 스마트한 보안 시스템입니다. 작동 방식은 다음과 같이 간단한 개념으로 나뉩니다.

1. "살아있는 규칙서" (정책 적응형)

대부분의 보안 요원은 금지 품목의 고정된 목록을 암기합니다. 하지만 SingGuard는 다릅니다. 고정된 목록을 암기하는 대신, 즉각적으로 업데이트 가능한 역동적이고 살아있는 규칙서를 지니고 있습니다.

  • 작동 방식: 당신은 평문(Plain English)으로 작성된 새로운 규칙 세트를 SingGuard에게 전달할 수 있습니다 (예: "이 특정 앱에서는 의료 주제에 대한 논의를 허용하지만, 저 다른 앱에서는 허용하지 않는다").
  • 마법 같은 기능: SingGuard는 이 새로운 규칙들을 읽고, 바로 그 규칙들에 따라 모든 승객을 검사합니다. 단순히 학교에서 배운 것을 바탕으로 추측하는 것이 아니라, 지금 당신이 주는 지침을 따르는 것입니다. 이는 모델이 새로운 것을 배우기 위해 다시 "학교(재학습)"에 갈 필요 없이, 서로 다른 국가, 서로 다른 앱, 또는 새로운 안전 우려 사항에 적응할 수 있음을 의미합니다.

2. "세 가지 속도의 뇌" (빠름, 하이브리드, 느림)

보안 검사는 까다로울 수 있습니다. 때로는 위협이 명백할 때도 있고(예: 총), 때로는 복잡한 퍼즐 같을 때도 있습니다(예: 무해한 사진이 특정 캡션과 결組み合わせ되었을 때 위험해지는 경우). SingGuard는 시간과 에너지를 절약하기 위해 이를 처리하는 세 가지 모드를 가지고 있습니다.

  • 빠른 모드 (반사 신경): 승객이 명백하고 확실한 위반 사항을 가지고 들어오면, SingGuard는 즉시 그들을 멈춰 세웁니다. 마치 경보를 보고 "멈춰!"라고 즉각 외치는 보안 요원과 같습니다. 이는 저지연, 고속 검사를 위한 것입니다.
  • 느린 모드 (탐정): 상황이 혼란스럽거나 규칙이 복잡하면, SingGuard는 속도를 늦춥니다. 마치 탐정처럼 새로운 규칙서를 한 줄 한 줄 읽으며, 승객의 수하물을 모든 규칙과 대조하고, 왜 안전한지 혹은 안전하지 않은지에 대한 상세한 보고서를 작성합니다.
  • 하이브리드 모드 (스마트 라우터): 이것은 두 세계의 장점을 모두 갖춘 방식입니다. SingGuard는 먼저 빠르게 살펴봅니다. 확신이 서면 거기서 멈춥니다 (빠른 모드). 만약 확신이 없다면, 자동으로 "탐정 모드(느린 모드)"로 전환하여 깊이 생각합니다. 실제로 필요할 때만 에너지 소모가 큰 깊은 사고를 사용합니다.

3. "교차 모달" 함정 (전체 그림 보기)

때때로 위협은 한 가지 요소가 아니라, 두 가지 요소의 결합 속에 존재합니다.

  • 비유: 햇살 가득한 해변 사진(무해함)과 "여기서 폭탄을 만들자"라는 메시지(유해함)를 상상해 보십시오. 사진만 본다면 안전합니다. 텍스트만 본다면 나쁩니다. 하지만 둘이 합쳐지면 위험한 계획이 됩니다.
  • SingGuard의 기술: SingGuard는 사진과 텍스트를 함께 보도록 훈련되었습니다. 그것은 두 요소의 결합이 각각의 요소가 단독으로 가졌던 위험과는 다른 위험을 생성한다는 것을 이해합니다. 또한 텍스트와 이미지가 개별적으로는 무해해 보이지만 결합했을 때 위험을 암시하는 "숨겨진" 위험도 잡아냅니다.

4. "훈련 캠프" (학습 방법)

이 정도로 능숙해지기 위해, 팀은 단순히 SingGuard에게 나쁜 것들의 예시를 보여주는 데 그치지 않았습니다. 56,000개 이상의 테스트 케이스를 포함하는 SingGuard-Bench라는 거대한 훈련 캠프를 만들었습니다.

  • 그들은 "탈옥(Jailbreak, AI를 속여 규칙을 어기게 만드는 행위)"을 처리하는 법을 가르쳤습니다.
  • 그들은 "정책 변화(이전에 안전했던 항목이 갑자기 위험해지는 상황)"를 처리하는 법을 가르쳤습니다.
  • 그들은 Fast-Slow Decoupled Reinforcement Learning이라는 특별한 훈련 기법을 사용했습니다. 이것은 학생에게 빠른 추측을 하도록 훈련시킨 다음, 최종 답변을 내놓기 전에 규칙에 비추어 그 추측을 반드시 재평가하도록 강제하는 것과 같습니다. 이는 규칙이 다르게 설정되어 있음에도 불구하고 AI가 첫 번째 본능에 "갇혀" 버리는 것을 방지합니다.

5. 결과

35개의 데이터셋(텍스트, 이미지, 혼합 미디어를 다루는 일련의 기말고사와 같은)을 대상으로 테스트했을 때, SingGuard는 다른 모든 오픈 소스 보안 시스템보다 높은 점수를 기록했습니다.

  • 위험한 콘텐츠를 더 잘 포착했습니다.
  • 무해한 콘텐츠를 잘못 차단하는 일(오탐)이 적었습니다.
  • 가장 중요한 것은, 테스트 도중 규칙이 바뀌었을 때 SingGuard는 다른 시스템들보다 훨씬 더 잘 적응했다는 점입니다. 이는 SingGuard가 단순히 정답을 암기하는 것이 아니라 실제로 규칙을 읽고 있다는 것을 증명합니다.

요약하자면: SingGuard는 단순히 금지 품목 목록을 암기하는 보안 요원이 아닙니다. 현재의 규칙서를 읽고, 복잡한 상황을 생각하며, 규칙이 어떻게 변하든 당신의 디지털 세계를 안전하게 지키기 위해 빠른 반사와 깊은 사고 사이를 즉각적으로 오가는 보안 요원입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →