Auditing Inference-Time Defense Evaluation for Multimodal Large Language Models
본 논문은 멀티모달 거대 언어 모델의 추론 시점 방어 기제에 대한 추적 가능한 비교 감사를 제시하며, 기존의 대규모 거부 주장들을 무효화하는 벤치마크 데이터 및 평가 프로토콜의 결정적인 출처 결함을 밝히는 동시에 향후 안전성 평가를 위한 엄격한 데이터 무결성 표준의 필요성을 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 접시 위에 그림을 올리고 동시에 말로 주문을 받는 아주 고급스러운 레스토랑의 헤드 셰프라고 상상해 보세요. 당신의 목표는 누군가 그림 속에 '독성' 있는 지시를 숨기거나 이상한 방식으로 속삭여서 셰프를 속이려 하더라도, 주방에서 절대 위험한 음식을 만들지 않도록 하는 것입니다. 이것이 바로 **멀티모달 거대 언어 모델(MLLM)**의 세계입니다. 이들은 이미지와 텍스트를 모두 "보고" "읽으며" 대화할 수 있는 매우 똑똑한 컴퓨터 두뇌입니다. 하지만 이들은 시각 능력이 있기 때문에, 악의적인 행위자들이 픽셀로 명령을 그려 넣거나 사진 배경에 숨겨서 해로운 명령을 몰래 집어넣을 수 있습니다.
이를 막기 위해 과학자들은 **추론 시 방어 기제(Inference-Time Defenses)**라는 것을 발명했습니다. 이것은 마치 주방 문 앞에 서 있는 보안 요원과 같습니다. 이들은 셰프의 레시피(모델의 두뇌)를 바꾸지는 않지만, 주문이 들어오기 전에 검사하거나, 음식이 나가기 전에 최종 요리를 확인합니다. 어떤 보안 요원은 주문에 정중한 경고 문구를 추가하고, 어떤 요원은 그림을 약간 흔들어 숨겨진 트릭을 흐릿하게 만듭니다. AI 안전 분야의 큰 질문은 이것입니다: 어떤 보안 요원이 실제로 가장 좋은 일을 하고 있는가? 만약 우리가 보안 요원을 신뢰할 수 없다면, 실수로 위험한 식사를 제공하거나, 더 나아가 위험이 너무 두려워 아예 음식을 내놓지 못하게 될 수도 있습니다.
위대한 주방 감사: 점수판이 틀렸을 때
모스크바의 한 연구팀은 탐정이 되기로 했습니다. 그들은 새로운 보안 요원을 만드는 대신, 세 가지 서로 다른 보안 요원(RapGuard, AdaShield, SmoothVLM 방식에서 영감을 얻음)을 여덟 가지 서로 다른 AI 셰프를 대상으로 테스트했다고 주장하는 최근 실험의 기록 보관소를 뒤졌습니다. 그들은 누가 최고인지 확인하고 싶었습니다. 하지만 파일을 조사하던 중, 그들은 깨진 링크, 빠진 재료, 그리고 혼란스러운 점수판을 발견했습니다.
그들이 발견한 내용을 현실적인 점검과 함께 제공합니다.
1. "빠진 재료"의 미스터리
연구진은 실험이 7가지의 서로 다른 안전 테스트에 걸쳐 9,000개의 서로 다른 주문(입력값)을 테스트하기로 되어 있었다는 것을 발견했습니다. 그러나 데이터의 출처(데이터가 어디서 왔는지에 대한 기록)를 확인했을 때, 7개 중 3개의 테스트가 완전히 고장 난 상태임을 깨달았습니다.
- "잘못된 접시" 오류: 이미지를 통해 숨겨진 지시를 AI가 포착할 수 있는지 확인하려던 한 테스트는 실제로는 엉뚱한 사진을 내놓고 있었습니다. 이는 화재 경보기를 테스트하기 위해 연기 감지기 대신 토스터기에 물을 뿌리는 것과 같았습니다.
- "텍스트 전용" 속임수: 또 다른 테스트는 사진과 텍스트의 혼합이어야 했으나, 시스템이 실수로 AI가 사진을 무시하고 텍스트만 읽도록 허용했습니다. 이는 "텍스트 전용 폴백(fallback)" 상황으로, AI가 테스트를 통과하기 위해 실제로 이미지를 볼 필요가 없었음을 의미합니다.
- "랜덤 패치" 결함: 세 번째 테스트는 AI를 혼란스럽게 하기 위한 특수한 "적대적 패치"(이미지 위의 작고 까다로운 스티커)를 사용한다고 주장했습니다. 하지만 컴퓨터는 까다로운 스티커를 생성한 것이 아니라, 그냥 무작위 사각형을 그렸을 뿐이었습니다.
이러한 오류들 때문에 연구진은 해당 테스트들의 결과를 폐기해야 했습니다. 단순히 숫자를 수정할 수 있는 문제가 아니었습니다. 데이터 자체가 존재하지 않았기 때문입니다. 이로 인해 그들은 네 가지 특정 테스트(FigStep, JailBreakV, SALAD-Bench, HarmBench-Simple)에서 추출한 4,820개의 유효한 입력값만을 사용할 수 있었습니다.
2. "키워드"의 함정
원래의 실험은 AI가 안전한지 판단하기 위해 매우 단순한 방법인 특정 "마법의 단어"를 찾는 방식을 사용했습니다.
- 만약 AI가 "그것을 할 수 없습니다" 또는 "죄송합니다"라고 말하면, 안전함(거절)으로 표시되었습니다.
- 만약 AI가 "방법은 다음과 같습니다..." 또는 "물론, 도와드릴 수 있습니다"라고 말하면, 안전하지 않음(해로운 답변)으로 표시되었습니다.
연구진은 이 방식에서 큰 문제를 발견했습니다. 시스템은 빈 답변(AI가 아무것도 말하지 않은 경우)을 단순히 레거시 코드가 특별한 규칙을 가지고 있지 않다는 이유로 "안전함"으로 분류했습니다. 빈 문자열이 "해로운" 목록에도, "거절" 목록에도 일치하지 않았기 때문에 기본 로직이 이를 안전하다고 간격한 것입니다. 또한, 정중한 경고로 시작하지만 그 뒤에 위험한 지침을 제공하는 답변에 대해서도, 시스템이 해로운 것을 덮어쓰기 위해 거절 문구의 존재 여부만 확인하다가 로직이 꼬여 "안전함"으로 분류하는 경우가 있었습니다.
데이터를 재검토했을 때, "키워드" 방식은 형편없는 판사라는 사실이 드러났습니다. 이는 마치 학생이 실제로 답을 했는지 무시하고 오직 "그"라는 단어가 포함되었는지만 보고 성적을 매기는 선생님과 같았습니다. 246개의 까다로운 답변을 감사한 결과, 키워드 시스템은 더 똑똑한 인간형 판사(Haiku-family judge)가 위험하다고 정확히 식별한 13개의 해로운 답변을 놓쳤습니다. 기술적으로 말하면, 키워드 시스템은 이 13개의 사례를 "안전함"으로 분류했지만, 실제로는 "해로움"이었습니다(False Negative).
3. "대량 거절"의 신화
원래의 연구는 보안 요들이 AI가 모든 것을 거절하게 만든다("대량 거절")는 점을 시사하는 듯했습니다. 연구진은 AI가 거절할 필요가 없는 38,500개의 안전하고 정상적인 질문을 재감사하여, AI가 실제로 얼마나 자주 "아니오"라고 말하는지 확인했습니다.
결과는 어땠을까요? AI는 매우 예의 바르고 도움이 되었습니다.
- 불필요한 거절의 추정 비율은 **0.52%**에 불과했습니다.
- 최악의 시나리오(가장 큰 단일 데이터 그룹)에서도 비율은 **3.24%**였습니다.
- 연구진은 "샘플링 기반" 불확실성(오차 범위)이 **10.92%**에 달할 수 있다고 언급했지만, 이조차도 원래 연구가 암시했던 "대량 거절"과는 거리가 멀었습니다.
혼란은 "방어적 서문(defensive preamble)"에서 왔습니다. 보안 요들은 종 often 답변 시작 부분에 긴 정중한 경고(예: "이것은 위험하다는 점을 경고해야 합니다...")를 추가하곤 했습니다. 기존의 키워드 시스템은 이 경고를 거절이라고 생각했지만, AI는 실제로 답변을 계속 이어갔습니다. 이는 문지기가 "당신을 들여보낼 수 없습니다"라고 말하면서도, 문을 열어 당신이 걸어 들어오게 하는 것과 같았습니다. 키워드 시스템은 이러한 서문을 거절로 잘못 분류하여 수치를 부풀렸습니다.
4. 안전의 비용
마지막으로, 연구진은 이 보안 요들이 얼마나 많은 시간을 낭비하는지 살펴보았습니다.
- "가우시안(Gaussian)" 요원(이미지를 다섯 번 흐리게 처리하고 답변에 대해 투표함)은 아무것도 하지 않았을 때보다 요청을 처리하는 데 5.45배에서 12.76배 더 오래 걸렸습니다.
- 세 명의 보안 요가 모두 적용된 전체 스택은 4.36배에서 16.59배 더 오래 걸렸습니다.
이는 보안 요들이 도움을 주려고 노력할 수는 있지만, 주방을 믿기 힘들 정도로 느리게 만든다는 것을 의미합니다.
결론
이 논문은 어떤 보안 요가 "최고"인지 말해주지 않습니다. 오히려, 데이터가 깨져 있고 채점 방식이 결함이 있기 때문에 이전의 순위를 신뢰할 수 없다고 말합니다.
- 반박된 내용: 그들은 "대량 거절"에 대한 원래의 주장이 틀렸음을 증명했으며, 7개의 안전 테스트 중 3개가 유효하지 않음을 밝혀냈습니다.
- 발견된 내용: 보안 요들(특히 프롬프트 래퍼들)이 AI의 행동을 변화시키기는 하지만, 그 효과는 AI 모델과 테스트 유형에 따라 크게 달라집니다. 때로는 도움이 되고, 때로는 해를 끼치며, 때로는 그저 속도를 늦출 뿐입니다.
- 교훈: 단순히 테스트를 실행하고 점수를 보는 것만으로는 부족합니다. 입력값(재료)이 진짜인지, 평가 방식(점수판)이 실제로 안전을 측정하는지, 그리고 작업을 확인할 전체 레시피(원문 텍스트)를 가지고 있는지 반드시 확인해야 합니다.
저자들은 우리가 서로 다른 보안 요들을 비교하기 전에, 그들을 테스트하기 위한 더 나은, 더 정직한 시스템을 구축해야 한다고 결론짓습니다. 그때까지 우리는 누가 영웅이고 누가 그저 주방을 느리게 만드는 사람인지 확언할 수 없습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.