← 최신 논문
🤖 AI

Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability

이 논문은 시각-언어 모델(Vision-Language Model)의 설명에서 발생하는 의미론적 환각을 수학적으로 설명하고 완화하기 위해, 쿼리 벡터를 방해 개념(distractor concepts)에 대해 직교화하여 견고한 해석 가능성을 보장하는 통합적 이론 프레임워크와 직교 의미 투영(Orthogonal Semantic Projection, OSP)이라 불리는 기하학적 개입을 소개한다.

원저자: Emirhan Bilgiç, Baptiste Caramiaux, Zhi Yan, Gianni Franchi

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Emirhan Bilgiç, Baptiste Caramiaux, Zhi Yan, Gianni Franchi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "혼란스러운 스포트라이트"

당신에게 사진을 보고 그 안에 무엇이 있는지 말할 수 있는 스마트 카메라 시스템(시각-언어 모델)이 있다고 상상해 보세요. 이 카메라를 신뢰할 수 있도록 만들기 위해, 우리는 **XAI (설명 가능한 AI)**라는 특별한 도구를 사용합니다. 이 도구는 마치 손전등이나 **히트맵(열지도)**처럼 작동하여, 카메라가 결정을 내릴 때 이미지의 어느 부분을 "보고 있는지"를 비춥니다.

문제는 다음과 같습니다: 가끔 이 손전등이 혼란에 빠집니다.
만약 당신이 카메라에게 "고양이가 어디 있어?"라고 물었는데, 실제 사진에는 가 들어있다면, 손전등은 여전히 개를 향해 밝게 빛날 수 있습니다. 이는 마치 손전등이 "음, 개와 고양이는 둘 다 털이 많고 다리가 네 개인 동물이니까, 당신이 고양이를 물었더라도 나는 개를 비출게"라고 생각하는 것과 같습니다.

논문에서는 이를 **"시맨틱 환각(Semantic Hallucination)"**이라고 부릅니다. 설명은 그럴싸해 보이지만, 사실 거짓말을 하고 있는 것입니다. 컴퓨터의 뇌 속에서 개념들이 너무 "끈적하게" 서로 엉겨 붙어 있기 때문에, 엉뚱한 물체를 강조하고 있는 것입니다.

원인: 아이디어들의 "북적이는 방"

왜 이런 일이 발생할까요? 논문에 따르면 컴퓨터의 뇌 내부에서 모든 단어와 이미지는 거대한 고차원 공간의 방 안에 살고 있습니다.

  • 이 방 안에서 "고양이"라는 개념과 "개"라는 개념은 서로 떨어진 격리된 구석에 있지 않습니다.
  • 대신, 그들은 "털"이나 "발" 같은 특징을 공유하기 때문에 매우 가까이 서서 공간을 함께 나누고 있습니다.

컴퓨터가 "고양이"를 찾으려고 할 때, 컴퓨터는 "고양이다움"이라는 클러스터 전체를 움켜쥐려 합니다. 하지만 "개"가 바로 옆에 서서 그 공간의 일부를 공유하고 있기 때문에, 컴퓨터는 실수로 "개" 부분까지 함께 잡아버리게 됩니다. 이를 **선형 시맨틱 누수(Linear Semantic Leakage)**라고 부릅니다. 아이디어들이 완벽하게 분리되지 않아 서로에게 "새어 나가고" 있는 것입니다.

해결책: "노이즈 캔슬링" 필터

저자들은 **직교 시맨틱 투영(Orthogonal Semantic Projection, OSP)**이라는 새로운 방법을 제안합니다. 이것을 컴퓨터의 생각에 적용하는 스마트 노이즈 캔슬링 필터라고 생각하면 됩니다.

작동 방식은 다음과 같습니다 (단계별 설명):

  1. 방해 요소의 사전(Dictionary of Distractions): 컴퓨터가 이미지를 보기 전에, OSP는 "방해 요소" 목록을 만듭니다. 만약 당신이 "고양이"를 찾고 있다면, 시스템은 "개", "사자", "호랑이"가 가까운 친척 관계라는 것을 알고 있습니다. 시스템은 이러한 방해 요소들의 수학적 "지표(signature)"를 수집합니다.
  2. 기하학적 정화(Geometric Cleanup): OSP는 컴퓨터의 "고양이" 아이디어를 가져와서 수학적으로 "개", "사자", "호랑이"의 아이디어로부터 멀리 밀어냅니다.
    • 비유: 북적이는 방 안에서 사람들이 비슷한 노래를 부르고 있을 때, 당신이 특정 노래(예: "고양이")를 들으려고 노력한다고 상상해 보세요. OSP는 개나 사자에 대해 노래하는 사람들의 목소리를 능동적으로 차단하는 헤드폰을 쓰는 것과 같습니다.
  3. 순수한 신호(The Pure Signal): 남는 것은 "정제된" 버전의 "고양이" 아이디어입니다. 다른 동물들과 공유했던 모든 특징이 제거되었습니다. 이제 이 아이디어는 방해 요소들과 **직교(orthogonal, 90도 각도)**를 이룹니다.
  4. 결과: 컴퓨터가 이 정제된 "고양이" 아이디어를 사용하여 손전등을 비출 때, 개는 완전히 무시됩니다. 히트맵은 이제 실제 고양이만을 밝게 비추거나, 고양이가 없다면 아무것도 비추지 않습니다.

이것이 왜 중요한가

이 논문은 이것이 단순히 특정 유형의 카메라를 위한 트릭이 아님을 증명합니다. 이 방법은 많은 다양한 AI 모델(CLIP, SigLIP, Stable Diffusion 등)과 다양한 히트맵 생성 방식에 두루 적용될 수 있습니다.

  • 거짓말을 막습니다: 컴퓨터는 비슷하게 생겼다는 이유만으로 존재하지 않는 물체를 강조하는 일을 멈춥니다.
  • 진실을 유지합니다: 이 방법이 올바른 물체를 찾는 능력을 떨어뜨리지 않습니다. 오히려 "올바른" 강조점을 더 날카롭게 만듭니다.
  • 플러그 앤 플레이 도구입니다: AI 전체를 다시 학습시킬 필요가 없습니다. 설명을 생성하기 전 단계에 이 "필터" 단계만 추가하면 됩니다.

증거

연구진은 수천 장의 이미지를 대상으로 테스트를 진행했습니다.

  • 정량적 증거: 연구진은 AI가 올바른 물체를 얼마나 잘 식별하고 잘못된 물체를 무시하는지 측정했습니다. 그 결과, 이 "필터"(OSP)는 이러한 점수들을 크게 향상시켰습니다.
  • 인간적 증거: 연구진은 200명의 실제 사람들에게 히트맵을 보여주었습니다. 기존 방식으로 생성된 맵을 볼 때 사람들은 종종 엉뚱한 강조점에 의해 혼란을 느끼거나 속기도 했습니다. 하지만 새로운 OSP 방식으로 생성된 맵을 보았을 때, 사람들은 AI가 무엇을 보고 있는지 훨씬 더 잘 추측할 수 있었고 답변에 대해 더 높은 확신을 가졌습니다.

요약

요약하자면, 이 논문은 AI가 스스로를 설명하려고 하기 전에 AI의 어휘를 깨끗하게 정리하는 방법을 소개합니다. 수학적으로 유사한 개념들(고양이와 개처럼)을 분리함으로써, 서로에게 새어 나가지 않도록 함으로써, AI는 드디어 당신이 요청한 정확한 대상을 향해 손전등을 비출 수 있게 되며, 옆에 있는 엉뚱한 물체를 실수로 비추는 일도 방지할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →