← 최신 논문
🤖 AI

ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models

ReFrame은 대상 모델을 수정하지 않고도 유용성 지배(utility dominance)와 추론 관성(reasoning inertia)을 효과적으로 극복하기 위해, 위험/유용성 증거를 생성하고 입력을 안전한 대리물로 재구성하는 두 개의 경량 에이전트를 채택함으로써 멀티모달 거대 언어 모델의 안전 정렬을 향상시키는 훈련이 필요 없는 증거 기반 테스트 시간 프레임워크이다.

원저자: Wenzheng Jiang, Xuankun Rong, Yuanzhao Zhai, Dawei Feng, Huaimin Wang

게시일 2026-08-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wenzheng Jiang, Xuankun Rong, Yuanzhao Zhai, Dawei Feng, Huaimin Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급격히 진화하는 인공지능의 세계에서, 보고 동시에 말할 수 있는 새로운 세대의 모델들이 등장했습니다. 멀티모달 거대 언어 모델(multimodal large language models)로 알려진 이 시스템들은 단순히 텍래스트를 처리하는 것에 그치지 않고, 시각적 세부 사항을 문자로 된 단어와 연결하여 질문에 답하고, 문제를 해결하며, 창의적인 콘텐츠를 생성함으로써 이미지를 이해합니다. 그러나 이러한 시각 및 추론 능력의 확장은 복잡하고 새로운 과제를 안겨주었습니다. 바로 '안전성'입니다. 이 모델들은 도움을 주도록 설계되었지만, 때때로 안전 규칙을 무시하도록 속임을 당할 수 있습니다. 공격자는 이미지 안에 해로운 요청을 숨기거나, 위험한 지시 사항을 이미지와 문장 사이에 나누어 배치하여 모델이 해당 요청을 무해한 것으로 오해하도록 혼란을 줄 수 있습니다. 이는 개발자들에게 어려운 상황을 만듭니다. 가장 강력한 모델 중 상당수는 '블랙박스'와 같아서, 내부 작동 방식이 숨겨져 있고 외부 사용자가 이를 변경하거나 재학습시킬 수 없습니다. 모델이 이미 배포되어 수정할 수 없는 상태일 때, 모델의 유용성을 해치지 않으면서 안전하게 유지하는 방법을 찾는 것은 매우 중요한 난제가 됩니다.

연구자들은 이를 해결하기 위한 방법들을 탐구해 왔으나, 기존의 많은 솔루션은 모델의 내부 코드에 접근해야 하거나 비용이 많이 드는 재학습을 필요로 하며, 이는 폐쇄형 시스템에서는 불가능한 일입니다. 이에 한 과학자 팀은 ReFrame이라 불리는 다른 접근 방식을 제안했습니다. 이 방식은 사용자의 요청이 모델에 도달하기 전 단계에서 작동하는 스마트 필터 역할을 합니다. 모델 자체를 바꾸려고 시도하는 대신, ReFrame은 들어오는 이미지와 텍스트를 가로채서 분석한 뒤, 이를 더 안전한 버전으로 다시 작성합니다. 이 과정은 모델의 내부 설정에 손을 대거나 새로운 데이터로 재학습할 필요 없이, 사용되는 순간에 전적으로 이루어집니다. 이 시스템은 표준적인 방어 체계를 뚫고 지나갈 수 있는 숨겨진 위험을 포착하는 동시에, 모델이 정당한 질문에 여전히 효과적으로 답할 수 있도록 설계되었습니다.

연구진이 파악한 핵심 문제는 이러한 모델들이 종종 안전함보다 유용함을 우선시한다는 점입니다. 사용자가 질문을 던지면, 모델의 주된 동기는 과업을 완수하는 것이며, 이 과정에서 이미지 속에 숨겨진 미묘한 위험이나 까다로운 문장 구조를 간과하는 경우가 발생할 수 있습니다. 더욱이, 모델이 일단 특정 추론 경로를 따르기 시작하면 그 흐름에 갇혀, 나중에 위험을 인지하더라도 계속해서 부적절한 콘텐츠를 생성할 수 있습니다. 이를 해결하기 위해 연구진은 더 작은 규모의 로컬 AI 모델을 게이트키퍼(문지기)로 사용하는 2단계 시스템을 구축했습니다. 이 게이트키퍼는 사용자의 질문에 직접 답하지 않습니다. 대신, 요청을 검토하고 상황을 설명하는 두 가지 특정한 요약본, 즉 '카드'를 생성합니다.

첫 번째 카드인 '리스크 카드(risk card)'는 숨겨진 위험을 찾습니다. 이 카드는 "이미지나 텍스트에 숨겨진 해로운 의도가 있는가?"라고 묻습니다. 만약 그렇다면, 무엇이 위험한지를 식별하고 위협을 제거하기 위해 요청을 어떻게 다시 작성할지 계획합니다. 두 번째 카드인 '유틸리티 카드(utility card)'는 보존해야 할 부분에 집중합니다. 이 카드는 "요청 중 해롭지 않고 유용한 부분은 무엇인가?"라고 묻습니다. 이는 위험한 부분을 제거했을 때 모델이 질문 전체를 버리거나 실제로 안전한 주제에 대해 도움을 거부하는 일이 없도록 보장합니다. 위험과 유용성을 분리함으로써, 시스템은 어떻게 진행할지에 대해 정밀한 결정을 내릴 수 있습니다.

이 두 카드가 생성되면, 두 번째 단계가 이어집니다. 이 부분은 두 카드의 정보를 결합하여 원래의 요청을 다시 작성합니다. 만약 요청이 처음부터 안전했다면, 약간의 조정만 거쳐 그대로 통과시킵로 합니다. 만약 요청에 숨겨진 함정이 있었다면, 시스템은 모델이 안전하고 도움이 되는 답변을 내놓도록 프롬프트를 다시 작성합니다. 예를 들어, 어떤 사용자가 범죄를 저지르는 방법에 대한 지침을 게임 시나리오처럼 꾸며서 요청한다면, 시스템은 게임이라는 외피가 변장임을 인식합니다. 시스템은 게임 지침을 제거하고, 대신 안전하거나 법적인 대안에 대해 묻도록 프롬프트를 다시 작성합니다. 결정적으로, 시스템은 원래의 이미지를 함께 보낼지 여부도 결정합니다. 때로는 이미지 자체가 위험한 단서를 포함하고 있으므로 이미지를 차단합니다. 반면, 이미지가 무해하고 답변에 필요한 경우에는 이미지를 통과시킵니다.

연구진은 이 방법을 현재 이용 가능한 가장 진보된 상용 시스템들을 포함한 여러 가지 다양한 대규모 모델들에 대해 테스트했습니다. 모델이 안전 규칙을 어기도록 유도하는 데 설계된 광범위한 테스트뿐만 아니라, 수학, 과학, 일상적인 사물에 관한 일반적인 질문에 모델이 여전히 제대로 답할 수 있는지 확인하는 테스트도 수행했습니다. 결과에 따르면, 이 새로운 방식은 다른 방어 체계가 놓친 해로운 요청을 막아내는 데 매우 효과적이었습니다. 이미지가 반전되었거나 텍스트가 나쁜 의도를 숨기기 위해 뒤섞인 경우의 공격을 성공적으로 차단했습니다. 동시에, 모델이 지나치게 조심스럽게 반응하게 만들지도 않았습니다. 의료나 화학 같은 민감한 주제에 대해 사용자가 안전한 질문을 던졌을 때, 시스템은 모델이 답변을 거부하는 대신 도움이 되는 답변을 제공할 수 있도록 허용했습니다.

연구 또한 이 과정이 얼마나 많은 추가 시간을 소요하는지 조사했습니다. 메인 모델이 답하기 전에 로컬 모델을 사용하여 요청을 다시 작성하기 때문에 약간의 지연 시간이 발생하지만, 연구진은 이 비용이 관리 가능한 수준임을 발견했습니다. 이 방식은 유연하여, 서로 다른 유형의 모델과 서로 다른 크기의 로컬 게이트키퍼와도 잘 작동하는 것으로 증명되었습니다. 이는 이 접근 방식이 특정 기술에 국한되지 않고 폭넓게 적용될 수 있음을 시사합니다. 연구 결과는 이미지와 텍스트 쌍의 의도를 면밀히 분석하고 모델에 도달하기 전에 요청을 다시 작성함으로써, 모델의 유용성을 희생하지 않으면서도 안전성을 크게 향arly 높일 수 있다는 것을 보여줍니다. 이는 강력한 AI 시스템의 내부 작동 방식을 변경할 수 없는 상황에서도, 시스템을 안전하게 유지할 수 있는 실질적인 경로를 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →