Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs
이 논문은 입력 측 필터에서 흔히 발생하는 과잉 거부 문제를 완화하기 위해 모델의 은닉 상태 공간(hidden state space) 내에서 잠재적인 유해 생성을 예측하는 출력 인지형 안전 가드레일을 제안하며, 이를 통해 멀티모달 거대 언어 모델의 안전성과 유용성을 모두 보존한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 사진을 보고 대화할 수 있는 아주 똑똑한 로봇 친구가 있다고 상상해 보세요. 이 로봇은 질문에 답하는 데 능숙하지만, 가끔 사람들이 로봇이 못된 말을 하거나 위험한 지침을 주거나 거짓 정보를 퍼뜨리도록 유도하려고 속임수를 쓰기도 합니다. 이를 막기 위해, 우리는 보통 로봇 앞에 '보안 요원'을 세워둡니다.
문제점: 과잉 보호하는 문지기
현재 대부분의 보안 요원은 클럽 입구에서 당신의 신분증(당신이 던진 질문)만 확인하는 엄격한 문지기처럼 작동합니다. 만약 신분증에 무서운 단어가 적혀 있다면, 문지기는 그 질문이 사실은 아주 무해한 질문일지라도 즉시 문을 쾅 닫아버립니다.
예를 들어, 당신이 "파이썬 프로세스를 어떻게 죽여요(kill a Python process)?"라고 묻는다면(이는 단순히 컴퓨터 코드에 관한 것입니다), 문지기는 '죽이다(kill)'라는 단어를 보고 차단합니다. 또한 "어디서 멋진 사진을 찍을(shoot) 수 있을까요?"라고 묻는다면(이는 사진 촬영에 관한 것입니다), 문지기는 '찍다(shoot)'라는 단어를 보고 "안 돼!"라고 말합니다. 로봇은 자신이 얼마나 안전하고 도움이 되는 답변을 할 수 있는지 보여줄 기회조차 얻지 못합니다. 논문에서는 이를 **과잉 거절(over-refusal)**이라고 부릅니다. 이는 마치 경비원이 문제를 너무 두려워한 나머지 선량한 고객들까지 실수로 쫓아내는 것과 같습니다.
옛날 방식 vs 새로운 방식
연구자들은 기존의 보안 요원들이 전적으로 입력(당신이 묻는 것)에 기반하여 결정을 내린다는 것을 발견했습니다. 그들은 로봇이 실제로 무엇을 말할지는 기다려주지 않습니다.
이 논문은 이러한 "입력 중심" 접근 방식에 반대합니다. 연구자들은 로봇 자체가 스스로 안전하게 행동하는 능력이 꽤 뛰어나다고 주장합니다. 까다로운 질문을 받더라도, 로봇은 종종 스스로 경고를 주거나 "그것은 할 수 없습니다"라고 말하는 법을 알고 있습니다. 하지만 기존의 보안 요원은 로봇이 자신의 좋은 모습을 보여주기도 전에 가로막아 버립니다!
해결책: OutGuard (수정구슬 보안 요원)
저자들은 OutGuard라고 불리는 새로운 시스템을 제안합니다. 단순히 신분증을 들여다보는 대신, OutGuard는 로봇이 생각하는 동안, 즉 말을 내뱉기 직전에 로봇의 뇌 속을 엿보는 '수정구슬'처럼 행동합니다.
작동 방식은 다음과 같습니다:
- 엿보기(The Peek): 로봇이 답변을 형성하기 시작하면, OutGuard는 로봇의 뇌 층 내부에서 소용돌이치는 "숨겨진 생각들"(숨겨진 상태, hidden states)을 들여다봅니다.
- 예측(The Prediction): OutGuard는 다음과 같이 추측합니다. "로봇이 정말로 위험한 것을 말하려는 것인가, 아니면 위험한 주제에 대해 생각하고 있지만 안전한 답변을 할 계획인가?"
- 결정(The Decision):
- 만약 로봇이 정말로 해로운 것(예: 폭탄 만드는 법)을 말하려 한다면, OutGuard가 개입하여 이를 차단합니다.
- 만약 로봇이 안전한 것(예: "프로세스를 죽이는 것"이 코딩에 관한 것임을 설명하는 것)을 말하려 한다면, OutGuard는 통과시킵니다!
마법 같은 기술: "생각의 주머니"로부터 배우기
OutGuard에게 이 방법을 가르치기 위해, 연구자들은 영리한 학습 방법인 **다중 인스턴스 대조 학습(Multi-Instance Contrastive Learning, MICL)**을 사용했습니다.
로봇의 답변을 구슬 주머니라고 생각해 보세요. 어떤 구슬은 위험하고(나쁜 단어들), 대부분은 안전합니다. 옛날 방식의 보안 요원들은 그 주머니를 보고 "위험한 구슬이 들어있으니 버려!"라고 말합니다.
OutGuard는 주머니 내부를 들여다봅니다. 특수한 어텐션 메커니즘(attention mechanism)을 사용하여 특정 위험한 구슬을 찾아냅니다. 이는 안전한 구슬은 무시하고, 전체 답변을 해롭게 만드는 실제 위험한 요소에만 집중하도록 학습합니다. 이는 마치 하나의 나쁜 사과를 찾는다고 해서 전체 바구니가 썩었다고 판단하지 않고, 그 나쁜 사과가 정말로 즙을 망칠 정도인지 파악하는 탐정과 같습니다.
숫자가 말해주는 것
연구자들은 이 시스템을 두 가지 인기 있는 로봇 모델인 LLaVA 1.6과 Qwen 3.5에서 테스트했습니다. 그들은 OutGuard를 HiddenDetector, QGuard, LoD와 같은 다른 최고 수준의 보안 요원들과 비교했습니다.
- 안전성(Safety): OutGuard는 거의 모든 진짜 나쁜 요청을 잡아냈습니다. 표준 테스트 세트에서 LLaVA는 AUPRC 0.9725, Qwen은 0.9937을 기록했습니다 (1.0이 완벽함). 이는 OutGuard가 다른 방식들만큼 나쁜 놈들을 잘 잡아낸다는 것을 의미합니다.
- "과잉 거절" 해결: 이 부분이 바로 OutGuard가 빛나는 지점입니다. 기존의 보안 요원들은 안전한 질문을 너무 자주 차단했습니다.
- QGuard는 안전한 질문의 **100%**를 차단했습니다 (ARSP = 1.0000). 너무 겁이 많아서 아무도 못 들어오게 한 것입니다.
- OutGuard는 LLaVA의 경우 안전한 질문의 5.5%, Qwen의 경우 **1.15%**만을 차단했습니다.
- 위험해 보이지만 실제로는 안전한 질문(예: "공항에서 시간을 때우는(kill time) 방법은?")에 대해, OutGuard는 차세대 방식들보다 41.6% 더 많은 안전한 질문을 통과시켰습니다.
속도와 비용
로봇의 뇌를 엿보는 것이 속도를 늦출까 걱정될 수도 있습니다. 논문은 OutGuard가 매우 빠르다는 것을 보여줍니다. 질문당 평균 약 0.208초가 걸리며, 이는 3초 이상 걸리는 다른 방식들보다 훨씬 빠릅니다. 또한 추가적인 메모리도 많이 필요하지 않으며, 시스템에 약 1.37 GB만을 추가합니다.
핵-심 요약
이 논문은 "입력 인지형"(질문을 확인하는 것)에서 "출력 인지형"(답변이 완성되기 전에 확인하는 것)으로 전환함으로써, 로봇을 번거롭게 만들지 않으면서도 안전하게 유지할 수 있다고 제안합니다. OutGuard는 로봇이 도움이 되는 것을 막는 것이 아니라, 단지 위험해지는 것을 막는 것입니다. 이는 인터넷을 안전하게 유지하면서도 우리가 질문을 던질 수 있게 하는, 더 똑똑하고 정밀한 방법입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.