← 최신 논문
💻 computer science

SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs

이 논문은 유용성을 보존하면서 다양한 교차 모달 위협으로부터 멀티모달 거대 언어 모델을 강력하게 방어하기 위해, 표적화된 억제 및 활성화 증폭을 통해 모달리티 범용 안전 뉴런을 식별하고 조종하는 교차 모달 안전 정렬 프레임워크인 SafeNexus를 소개한다.

원저자: Jian Yu, Fei Shen, Cong Wang, Jian Wang, Lu Jin. Xiaoyu Du, Jinhui Tang, Tat-Seng Chua

게시일 2026-08-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jian Yu, Fei Shen, Cong Wang, Jian Wang, Lu Jin. Xiaoyu Du, Jinhui Tang, Tat-Seng Chua

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 책들이 말을 걸어올 수 있는 거대하고 북적이는 도서관이라고 상상해 보세요. 오랫동안 이 말하는 책들은 아주 똑똑한 챗봇처럼 텍스트 형태에 불과했습니다. 하지만 최근, 이들은 "멀티모달 거대 언어 모델(MLLM)"로 진화했습니다. 이들을 텍스트를 읽고, 사진을 보고, 오디오를 동시에 들을 수 있는 슈퍼 사서라고 생각하면 됩니다. 이들은 믿을 수 없을 정도로 유능하지만, 이 새로운 초능력에는 대가가 따릅니다. 바로 악당들이 이들을 속일 수 있는 새로운 방법들을 열어준다는 점입니다. 마치 박물관의 보안 요원이 가짜 그림은 알아챌 수 있어도 가짜 녹음 파일은 알아채지 못할 수도 있는 것과 같습니다. 이 AI 모델들은 종로는 입력 방식에 따라 안전 가드(safety guard)가 작동하지 않을 수 있습니다. 만약 당신이 문장 대신 사진으로, 혹은 문장 대신 오디오 클립으로 속이려 한다면, 가드들은 위험을 완전히 놓칠 수 있습니다. 큰 질문은 연구자들이 던지고 있습니다: 어떻게 하면 악당이 어떤 방식으로 침입하든 상관없이 작동하는 안전 시스템을 구축할 수 있을까?

여기서 SafeNexus라는 새로운 연구가 등장합니다. 중국과 싱가포르의 대학 팀으로 구성된 연구진은 AI의 안전성을 외부에서 바라보는 것을 멈추고, 대신 AI의 "두뇌" 내부에서 보물 찾기를 하기로 했습니다. 그들은 AI가 나쁜 요청에 대해 "안 돼"라고 말하는 능력이 무작위로 흩어져 있는 것이 아니라, 뉴런이라 불리는 작고 특별한 내부 스위치 그룹에 의해 제어된다는 사실을 발견했습니다.

재미있는 점은, 연구진이 서로 다른 유형의 입력(텍스트, 이미지, 오디오 등)이 정보를 처리하기 위해 뇌의 서로 다른 부분을 사용하지만, 모든 것에 대해 궁극적인 "위험 탐지기" 역할을 하는 비밀스럽고 공유된 뉴런 클럽이 존재한다는 것을 발견했다는 것입니다. 그들은 이를 US-뉴런(Modality-Universal Safety Neurons, 모달리티 범용 안전 뉴런)이라고 부릅니다. 이는 마치 당신이 칼이나 폭탄, 혹은 가짜 신분증을 가지고 보안 검사를 통과하려 하더라도, 복도에 있는 특정한 작은 CCTV 하나가 이 모든 것을 포착해 내는 것과 같습니다. 만약 그 카메라를 꺼버린다면, 침입자가 무엇을 들고 있든 건물 전체가 위험해집니다.

이 논문은 이전의 방법들이 AI 전체를 다시 학습시키거나 외부 필터를 추가함으로써 안전 구멍을 메우려 했던 것이, 마치 모든 문마다 새로운 보안 요원을 고용하는 것과 같았다고 시사합니다. SafeNexus는 다른 접근 방식을 취합니다. 이들은 몇 개의 핵심적인 "위험 탐지" 뉴런을 찾아내어 그들에게 초능력을 부여합니다. 연구팀은 두 가지 방법을 테스트했습니다:

  1. 앰플리파이어(The Amplifier, 증폭기): AI가 사고하는 과정 동안, 그들은 단순히 해당 뉴런들의 볼륨을 높여서 "위험!"이라고 더 크고 빠르게 외치도록 만들었습니다.
  2. 캘리브레이터(The Calibrator, 교정기): 그들은 해당 뉴런들에게 (LoRA라고 불리는 방법을 사용하여) 작고 정밀한 튜닝을 해주어, 전체 AI를 다시 학습시킬 필요 없이 자연스럽게 문제를 더 잘 포착할 수 있도록 만들었습니다.

결과는 인상적이었습니다. Qwen과 VITA 같은 모델들에 대해 테스트했을 때, 이 몇 개의 뉴런을 강화하는 것이 AI가 텍스트, 사진, 혹은 소리로 들어오는 유해한 요청을 거절하는 능력을 훨씬 더 향상시킨다는 것을 발견했습니다. 결정적으로, 이 방법이 AI를 "멍청하게" 만들거나 과도하게 조심스럽게 만들지 않는다는 것을 확인했습니다. 즉, AI가 "케이크를 어떻게 굽나요?"와 같은 무해한 질문을 거절하기 시작하거나, 다른 작업 수행 능력을 잊어버리지 않았습니다. 실제로 일부 테스트에서, 이 새로운 방법은 현재의 가장 뛰어난 방법들보다 공격을 차단하는 데 훨씬 더 뛰어났으며, 이 모든 과정에서 AI 전체 뇌 용량의 0.05% 미만만을 변경했습니다.

연구진은 또한 이 기술이 자신들이 명시적으로 학습시키지 않은 대상, 즉 비디오에도 작동한다는 것을 보여주었습니다. 비록 "튜닝" 단계에서 AI에게 비디오 클립을 보여준 적이 없음에도 불구하고, 강화된 뉴런들은 비디오 공격에서의 위험을 포착하는 데 효과적이었습니다. 이는 그들이 단순히 특정 사례를 암기한 것이 아니라, 핵심적이고 보편적인 안전 메커니즘을 찾아냈음을 시사합니다.

요약하자면, SafeNexus는 모든 형식에 걸쳐 안전하게 만들기 위해 AI의 전체 안전 시스템을 재구축할 필요가 없음을 시사합니다. 대신, 우리는 기계 내부의 몇 가지 작고 보편적인 "브레이크"를 찾아내어 그것들이 온전한 힘으로 작동하도록 만들기만 하면 됩니다. 이는 자동차의 속도를 줄이기 위해 엔진 전체를 교체할 필요 없이, 브레이크 페달이 바퀴에 단단히 연결되어 있는지 확인하기만 하면 되는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →