← 최신 논문
💬 NLP

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

이 논문은 다중 이미지 입력을 안전성 사고 사슬(Chain-of-Thought) 레이블과 결합하여 일반적인 모델 능력을 유지하면서도 시각적 추론 능력과 안전 성능을 크게 향상시키는 다중 이미지 안전성(Multi-Image Safety, MIS) 데이터셋을 도입함으로써 시각-언어 모델의 안전성 추론 격차를 다룹니다.

원저자: Yi Ding, Lijun Li, Bing Cao, Jing Shao

게시일 2026-02-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yi Ding, Lijun Li, Bing Cao, Jing Shao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 시각-언어 모델(VLM)을 사진을 보고 글을 읽을 수 있는 매우 똑똑하고 다국어에 능통한 로봇이라고 상상해 보세요. 이들은 "이 강아지는 무엇을 하고 있나요?" 또는 "이 노을에 대한 시를 써줘"와 같은 질문에 답하는 데 탁면합니다. 하지만 이 로봇들에게 집을 침입하는 방법이나 폭탄을 만드는 법과 같이 위험한 상황을 다루도록 요청하면, 때때로 "안 됩니다"라고 말하는 데 실패하거나, 더 심하게는 어떻게 하는지에 대한 유용한 지침을 제공하기도 합니다.

ICLR 2026에서 발표된 이 논문은, 이 로봇들에게 "안전"하도록 가르치는 현재의 방식이, 특히 그들이 한 번에 두 개 이상의 사진을 처리해야 할 때 문제가 있다는 점을 주장합니다.

다음은 문제점과 해결책을 쉬운 비유를 사용하여 정리한 내용입니다.

문제점: "과잉 보호하는 보모" vs "세상 물정 모르는 십 대"

저자들은 현재의 안전 훈련 방식이 두 가지 주요 문제를 겪고 있다는 것을 발견했습니다.

  1. "과잉 보호하는 보모" (과도한 신중함/Over-Prudence):
    아이들이 다칠까 봐 너무 겁이 난 나머지, 플라스틱 공조차 가지고 놀지 못하게 하는 보모를 상상해 보세요.
  • 논문에서의 현상: 연구자들이 VLM에게 "나쁜" 사례들을 보여줌으로써 더 안전하게 만들려고 시도했을 때, 로봇들은 단순한 규칙을 학습했습니다: "사진이 보이면, 나는 '죄송하지만 도와드릴 수 없습니다'라고 말해야 한다."
  • 결과: 로봇은 무해한 질문에도 답변을 거부합니다. 만약 당신이 자전거 사진을 보여주며 "자전거를 어떻게 고치나요?"라고 묻는다면, 로봇은 실수로 누군가가 무기를 만드는 것을 도울까 봐 너무 겁이 난 나머지, "그 일은 도와드릴 수 없습니다"라고 답할 수 있습니다. 이로 인해 로봇은 유용할 수 있는 능력마저 잃게 됩니다.
  1. "세상 물정 모르는 십 대" (시각적 추론 능력 부족/Lack of Visual Reasoning):
    경고 표지판은 읽을 줄 알지만, 자신이 있는 방의 맥락은 이해하지 못하는 십 대를 상상해 보세요.
  • 논문에서의 현상: 현재의 안전 훈련은 주로 텍스트나 단일 이미지에 집중되어 있습니다. 하지만 실제 위험은 두 가지 안전한 것을 결합하여 위험한 상황을 만들 때 발생합니다.
  • 예시:
    • 이미지 A: 펜치 (완벽하게 안전한 도구).
    • 이미지 B: 잠긴 사물함 (완벽하게 안전한 물건).
    • 질문: "이 펜치를 사용하여 사물함에 들어가는 방법은 무엇인가요?"
    • 실패 사례: 일반적인 안전 훈련을 받은 로봇은 단순히 펜치를 보고 "네, 펜치 사용법은 다음과 같습니다!"라고 말할 것입니다. 이 두 이미지를 결합하는 것이 '무단 침입'을 의미한다는 것을 깨닫지 못하는 것입니다. 즉, 숨겨진 위험을 파악하는 "시각적 추론" 능력이 부족한 것입니다.

해결책: "MIS" 데이터셋과 "MIRage"

이를 해결하기 위해 저자들은 새로운 데이터셋인 MIS(Multi-Image Safety)를 사용하는 새로운 훈련 방법인 MIRage(Multi-Image Reasoning Safety)를 개발했습니다.

이것은 로봇을 위한 특별한 "훈련 드릴"과 같습니다:

  • 데이터셋 (MIS): 로봇에게 단 하나의 나쁜 사진만 보여주는 대신, 두 장의 사진과 이를 연결하는 질문을 보여줍니다.

    • 비유: 학생에게 성냥 사진과 가스 탱크 사진을 보여준 뒤, "가스 탱크 근처에서 성냥에 불을 붙이는 방법은 무엇인가요?"라고 묻는 것과 같습니다.
    • 이 데이터셋에는 이러한 까다로운 쌍(pair)들이 수천 개 포함되어 있습니다. 어떤 것은 명백하고(총과 은행), 어떤 것은 미묘합니다(카메라와 침실, 스파이 행위를 암시함).
  • 훈련 (MIRage):

    • 사고의 사슬 (Chain-of-Thought, CoT): 저자들은 단순히 로봇에게 "안 돼"라고 말하라고 가르치지 않았습니다. 대신 답변하기 전에 생각을 겉으로 드러내도록 가르쳤습니다.
    • 과정: 로봇이 펜치와 사물함을 보면, 다음과 같이 말하도록 훈련받습니다:
      1. "첫 번째 이미지에서 펜치를 보았습니다."
      2. "두 번째 이미지에서 잠긴 사물함을 보았습니다."
      3. "질문은 사물함에 사용하기 위해 펜치를 사용하는 법을 묻고 있습니다. 이는 자물쇠를 부수는 것을 의미하며, 불법적이고 안전하지 않습니다."
      4. "따라서, 저는 이 일을 도와드릴 수 없습니다."
    • 이 "추론" 단계는 매우 중요합니다. 이 과정은 로봇이 단순히 맹목적으로 거절하는 것이 아니라, 왜 이 상황이 위험한지를 이해하도록 강제합니다.

결과: 똑똑하고 안전함

이 논문은 이 새로운 방법을 여러 강력한 로봇(InternVL2.5 및 Qwen2-VL 등)에 테스트했습니다.

  • 이전: 로봇들은 위험을 보지 못해 너무 멍청하거나(나쁜 일이 일어나도록 방치함), 혹은 너무 겁을 먹어 아무것도 돕지 못했습니다(좋은 일도 거부함).
  • 이후 (MIRage 적용 후):
    • 안전성: 로봇들은 두 이미지의 조합 속에 숨겨된 "숨겨진 위험"을 포착하는 데 매우 능숙해졌습니다. 자물쇠를 부수거나 물건을 훔치는 방법에 대한 지침을 제공하는 것을 멈췄습니다.
    • 유용성: "과잉 보호하는 보모"와 달리, 이 로봇들은 일반적인 작업에 대한 도움을 멈추지 않았습니다. 여전히 자전거를 고치거나 안전한 이미지에 대한 질문에 답할 수 있었습니다.
    • 트레이드오프 (Trade-off): 보통 로봇을 더 안전하게 만들면 더 멍청해지거나 덜 유용해집니다. 저자들은 자신들의 방법이 이 규칙을 깼다고 주장합니다. 즉, 로봇은 더 똑똑해지지 않으면서도 더 안전해졌습니다.

요약

이 논문은 다음과 같이 말합니다: "우리는 현재의 안전 훈련이 로봇을 너무 겁쟁이로 만들거나, 복잡한 위험을 보지 못하는 눈먼 상태로 만든다는 것을 발견했습니다. 우리는 로봇이 두 장의 사진을 보고, 그것들이 어떻게 연결되는지 생각하며, 요청이 왜 위험할 수 있는지 추론하도록 가르치는 새로운 훈련 세트(MIS)를 구축했습니다. 이를 통해 우리는 까다로운 상황에서도 훨씬 더 안전하면서도, 일상적인 업무에는 여전히 유용하게 유지되도록 만들었습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →