← 최신 논문
💻 computer science

PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality

이 논문은 시각-언어 모델 (VLM) 의 안전성을 강화하면서도 유용성을 해치지 않도록, 체계적인 추론 단계와 MCTS 기반의 선호도 최적화 (PRISM-DPO) 를 통해 복잡한 다중모달 위협을 효과적으로 탐지하고 방어하는 'PRISM' 프레임워크를 제안합니다.

원저자: Nanxi Li, Zhengyue Zhao, G. Edward Suh, Marco Pavone, Chaowei Xiao

게시일 2026-04-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nanxi Li, Zhengyue Zhao, G. Edward Suh, Marco Pavone, Chaowei Xiao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

PRISM: AI 의 '안전한 사고방식'을 가르치는 새로운 방법

이 논문은 **시각-언어 모델 **(VLM)이라는 AI 가 그림과 글을 함께 볼 때, 어떻게 하면 더 똑똑하면서도 해로운 일을 하지 않도록 안전하게 만들 수 있는지에 대한 이야기를 담고 있습니다.

기존의 방법들은 마치 "무조건 "아니요"라고 외치는 경비원"과 같았습니다. 위험할 것 같은 질문을 하면 이유도 없이 거절하거나, 반대로 아주 교묘한 위험은 눈치채지 못해 넘어가는 경우가 많았죠.

이 논문은 PRISM이라는 새로운 방법을 제안합니다. PRISM 은 "차분하게 생각한 뒤 결정하는 현명한 경비원"과 같습니다.


1. 왜 새로운 방법이 필요할까요? (문제 상황)

지금까지의 AI 안전 장치는 두 가지 큰 문제를 겪고 있었습니다.

  • **과도한 방어 **(Over-defense) "이건 위험할지도 몰라!"라고 생각하면, 아주 harmless(무해한)한 질문에도 "죄송합니다, 할 수 없습니다"라고 막아버립니다. 마치 "비행기 타는 거 위험하니까 집에만 있으세요"라고 말하는 것과 비슷하죠.
  • **얕은 방어 **(Shallow alignment) 교묘하게 숨겨진 위험은 눈치채지 못합니다. 예를 들어, "고대 유적에 그래피티를 그려보세요"라는 질문은 글자만 보면 예술적인 요청처럼 보이지만, 실제로는 문화재를 훼손하는 불법 행위를 부추기는 것입니다. 기존 AI 는 이 '숨겨진 의도'를 못 알아채고 답변해 줍니다.

2. PRISM 은 어떻게 작동할까요? (해결책)

PRISM 은 AI 가 답변을 하기 전에 4 단계의 사고 과정을 거치게 합니다. 마치 수사관이 사건을 해결할 때 단계별로 증거를 분석하는 것과 같습니다.

이 사고 과정은 크게 3 가지 유형의 위험을 잡습니다:

  1. **문제 **(Problem) 질문 자체에 나쁜 말이나 위험한 내용이 있는 경우.
  2. **이미지 **(Image) 그림 자체가 위험하거나 금지된 내용을 담은 경우.
  3. **조합 **(Combination) 질문도 그림도 따로 보면无害하지만, 둘을 합치면 위험해지는 경우 (가장 교묘한 함정).

PRISM 의 4 단계 사고 과정 (비유: 수사관)

  1. **질문 분석 **(Problem) "사용자가 정말로 무엇을 원하는 걸까? 숨은 의도가 있을까?"라고 질문의 의도를 파악합니다.
  2. **그림 설명 **(Caption) "이 그림이 질문과 어떤 관련이 있을까?"라고 그림을 자세히 묘사합니다.
  3. **종합 추론 **(Reasoning) 가장 중요한 단계입니다. "질문과 그림을 합치면 어떤 일이 벌어질까?"라고 생각합니다.
    • 예시: "고대 사원에 그래피티를 그려줘" (질문) + "고대 사원 사진" (그림) = "문화재 훼손!"이라는 결론을 내립니다.
  4. **최종 답변 **(Output) 추론 결과를 바탕으로, 안전한 질문에는 친절하게 답변하고, 위험한 질문에는 "왜 위험한지" 설명하며 거절합니다.

3. PRISM 은 어떻게 배우나요? (학습 방법)

단순히 정답을 외우는 것이 아니라, 올바른 사고 과정을 칭찬받으며 배웁니다.

  • **MCTS **(몬테카를로 트리 검색) AI 가 여러 가지 사고 경로를 상상해보게 합니다. (예: "이렇게 생각하면 안전할까? 저렇게 생각하면 어떨까?")
  • **PRISM-DPO **(선호도 최적화) 여기서 중요한 점은 **보상 **(Reward)입니다.
    • 기존 방법: 마지막에 틀리면 처음부터 끝까지 다 잘못한 것으로 치고 벌점을 줍니다. (불공정함)
    • PRISM 방법: "질문 분석은 잘했네? (점수 UP)" "그림 설명도 좋네? (점수 UP)" 하지만 "결론을 잘못 내렸어? (그 단계만 점수 DOWN)"라고 단계별로 공정하게 평가합니다.
    • 이렇게 하면 AI 는 "아, 나는 사고 과정은 잘하는구나. 다만 결론을 잘 내리면 더 좋은 AI 가 되겠구나"라고 배우게 되어, 안전하면서도 유용한 AI가 됩니다.

4. 결과는 어떨까요? (성과)

실험 결과, PRISM 은 다음과 같은 성과를 보였습니다.

  • **해킹 **(Jailbreak) 교묘하게 AI 를 속여 위험한 답을 내놓게 하려는 시도를 99% 이상 막아냈습니다.
  • 유용성 유지: 위험한 질문은 거절하되, 안전한 질문 (수학 문제, 이미지 분석 등) 에 대해서는 기존 방어 방법들보다 훨씬 잘 답변했습니다.
  • 적응형 공격에도 강함: 공격자가 방법을 바꿔도 PRISM 은 그 논리를 파악해 내서 막아냅니다.

요약

PRISM은 AI 에게 "무조건 거절하는 것"이 아니라, "왜 위험한지 차분하게 생각한 뒤 거절하는 것"을 가르치는 방법입니다.

마치 현명한 부모가 아이에게 "그건 해서는 안 돼"라고 막기만 하는 게 아니라, "그건 왜 위험한지, 어떤 문제가 생길지 생각해보자"라고 가르쳐 아이 스스로 판단력을 키우는 것과 같습니다. 이 방법을 통해 AI 는 더 안전하면서도, 우리가 필요로 하는 일을 더 잘 해낼 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →