← 최신 논문
💬 NLP

From Out-of-Distribution Detection to Hallucination Detection: A Geometric View

본 논문은 거대 언어 모델의 환각 탐지를 이상치 탐지(out-of-distribution detection) 문제로 재구성할 것을 제안하며, 이러한 기하학적 관점이 추론 작업에서 환각을 효과적으로 식별하는 학습이 필요 없는 단일 샘플 탐지기를 가능하게 함을 입증한다.

원저자: Litian Liu, Reza Pourreza, Yubing Jian, Yao Qin, Roland Memisevic

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Litian Liu, Reza Pourreza, Yubing Jian, Yao Qin, Roland Memisevic

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 문제: AI가 지어내는 이야기

매우 똑똑한 학생(거대 언어 모델, LLM)이 시험을 보고 있다고 상상해 보세요. 때때로 이 학생은 정답을 알고 있어서 제대로 맞힙니다. 하지만 가끔은 답을 모르면서도, 그럴듯하게 들리지만 실제로는 완전히 지어낸 내용을 자신 있게 적어 내려가기도 합니다. AI의 세계에서는 이를 **환각(Hallucination)**이라고 부릅니다.

AI가 거짓말을 하는지 감지하는 것은 어렵습니다. 기존 방식들은 학생의 답안지를 채점하기 위해 별도의 선생님을 고용하거나(비용이 많이 들고 느림), 혹은 학생에게 같은 시험을 열 번 정도 반복해서 보게 한 뒤 답변이 달라지는지 확인하는 방식(복잡한 추론 작업에서는 계산량이 많고 혼란스러움)과 같습니다.

새로운 아이디어: "분포 외(Out-of-Distribution)"에서 빌려오기

이 논문의 저자들은 영리한 아이디어를 냈습니다: 환각을 마치 파티에 온 낯선 사람처럼 취급해 보자는 것입니다.

컴퓨터 과학에는 분포 외(Out-of-Distribution, OOD) 탐지라는 잘 알려진 문제가 있습니다. 클럽의 보안 요원이 정규 회원들의 생김새를 정확히 알고 있다고 상상해 보세요. 만약 이상한 코스튬을 입은 낯선 사람이 들어온다면, 보안 요원은 "어, 이 사람은 여기 속한 사람이 아니네"라고 알 수 있습니다.

  • 과거의 세계: 보안 요원(AI)은 특정 얼굴들(훈련 데이터)을 인식하도록 훈련되었습니다. 새로운 얼굴이 나타나면 보안 요원은 여전히 그 사람이 누구인지 추측하려 들지만, 사실 그것은 무모한 추측일 뿐입니다. 이것이 분류기(Classifier)의 "환각"입니다.
  • 논문의 통찰: 저자들은 AI가 환각을 일으킬 때 본질적으로 이와 동일한 일을 하고 있다는 점을 깨달았습니다. 즉, 자신이 실제로 훈련받지 않은 질문에 답하려고 하거나, 자신의 지식이라는 "편안한 구역(Comfort Zone)" 밖으로 발을 내딛는 것입니다.

그래서 새로운 탐지기를 처음부터 만드는 대신, 저자들은 이렇게 물었습니다. 보안 요원의 도구를 사용하여 AI의 거짓말을 잡아낼 수 있을까?

해결책: 기하학적 관점 ("지도" 비유)

이 논문은 AI의 내부적인 생각을 텍스트가 아니라 거대한 지도 위의 점으로 바라볼 것을 제안합니다.

  1. 지도: AI의 뇌는 거대하고 다차원적인 방이라고 상상해 보세요. AI가 할 수 있는 모든 단어는 이 방 안에 심어진 특정 "가중치 벡터(깃발)"를 가지고 있습니다.

  2. 여정: AI가 문장을 써 내려갈 때, 점 하나(현재의 생각을 나타냄)가 이 방을 통과하며 움직입니다.

  3. 두 가지 탐지기: 저자들은 이 점을 감시하기 위해 두 가지 "보안 요원" 도구를 변형하여 적용했습니다.

    • 도구 A: "포옹" 탐지기 (NCI)

      • 비유: AI가 방금 선택한 단어를 나타내는 깃발을 향해 포옹하려고 한다고 상상해 보세요. AI가 확신이 있다면, 점은 깃발 바로 옆에 위치하며 "포옹"은 꽉 끼게 됩니다.
      • 환각: AI가 환각을 일으키고 있다면, 점은 깃발에서 멀리 떨어져 있습니다. 이때 "포옹"은 약하거나 존재하지 않습니다. 논문에서는 이를 **특징 근접성(Feature Proximity)**이라 부릅니다. 점이 깃발에서 너무 멀다면, 그것은 거짓말입니다.
    • 도구 B: "벽" 탐지기 (fDBD)

      • 비유: 이 방은 보이지 않는 벽들에 의해 구역이 나뉘어 있습니다. 각 구역은 특정 단어에 속합니다. 만약 당신이 "고양이" 구역에 있다면, AI는 "고양이"라고 생각합니다.
      • 환각: AI가 환각을 일으키고 있다면, 점은 벽 근처에서 비틀거리며 "개" 구역이나 "새" 구역 근처에 머물게 됩니다. 자신이 어느 쪽 벽에 있는지 확신하지 못하는 상태입니다. 논문에서는 이를 **결정 경계까지의 거리(Distance to Decision Boundary)**라고 부릅니다. 점이 벽에 너무 가깝다면, 그것은 거짓말입니다.

과제와 해결 방법

저자들은 다른 분야의 도구들을 단순히 복사해서 붙여넣을 수 없다는 것을 알고 있었습니다. AI는 매우 거대하고 복잡하기 때문입니다. 그들은 세 가지 큰 문제를 해결해야 했습니다.

1. "누락된 지도" 문제 (훈련 통계)

  • 문제: 어떤 점이 깃발로부터 "멀리" 있는지 알기 위해서는, 보안 요원이 보통 '좋은' 점들이 어디에 모여 있는지 보여주는 지도를 가지고 있어야 합니다. 하지만 AI 훈련 데이터는 방대하고 비밀스러우며, 지도로 만들기에는 너무 큽니다.
  • 해결책: 저자들은 데이터로부터 지도를 그리는 대신, 수학적 마법을 사용했습니다. 그들은 AI 자체의 내부 구조를 바탕으로 "중립적인 지점"을 계산했습니다. 이는 보안 요원이 "클럽의 지도는 필요 없다. 사람들이 확신이 없을 때는 댄스 플로어 중앙에 모인다는 것만 알면 된다"라고 깨닫는 것과 같습니다. 이를 통해 원래의 훈련 데이터 없이도 거짓말을 탐지할 수 있었습니다.

2. "너무 많은 깃발" 문제 (방대한 어휘)

  • 문제: AI는 수십만 개의 가능한 단어(깃별)를 가지고 있습니다. 매 단어마다 방 안의 모든 벽까지의 거리를 확인하는 것은 너무 느립니다.
  • 해 해결책: 그들은 가장 가능성이 높은 상위 1,000개의 단어의 벽만을 확인하기로 결정했습니다. 이는 보안 요원이 방 뒤쪽에 있는 사람들은 나갈 확률이 낮으므로 무시하고, 출구 근처에 서 있는 사람들만 신경 쓰는 것과 같습니다. 이 방식 덕분에 탐지기는 빠르고 정확해졌습니다.

3. "무작위성" 문제 (확률적 디코딩)

  • 문제: 때때로 AI는 절대적으로 최선의 단어를 고르는 대신 무작위로(주사위를 던지듯) 단어를 선택합니다. 이로 인해 "점"이 이리저리 튀게 되며, 이는 보안 요원을 혼란스럽게 할 수 있습니다.
  • 해결책: 저자들은 AI가 조금씩 움직이더라도, 문장 전체에 걸친 점의 평균 위치는 진실을 말한다는 것을 발견했습니다. AI가 환각을 일으키고 있다면, 설령 점이 이리저리 튄다 하더라도 벽 근처에서 머무는 시간이 많아질 것입니다. 따라서 이 탐지기는 이러한 무작위성 속에서도 완벽하게 작동합니다.

결과

이 논문은 수학 및 논리 퍼즐과 같은 어려운 추론 작업에서 이 새로운 "보안 요원" 도구들을 테스트했습니다.

  • 추가 훈련 불필요: AI에게 새로운 것을 가르칠 필요가 없었습니다.
  • 단일 실행 (Single Shot): 질문을 10번 반복할 필요 없이, 단 한 번의 답변만 보고도 판단할 수 있었습니다.
  • 더 높은 정확도: 이 기하학적 도구들은 AI가 창의적이거나 무작위적인 행동을 할 때도 기존 방식보다 훨씬 더 잘 환각을 잡아냈습니다.

요약

이 논문은 다음과 같이 말합니다: 새로운 거짓말 탐지기를 만들려고 애쓰지 마세요. 대신, AI의 내부 기하학을 살펴보세요. 만약 AI의 생각이 선택한 단어의 "깃발"에서 멀리 떨어져 있거나, 다른 단어의 "벽" 근처에서 비틀거리고 있다면, 그것은 아마도 거짓말을 하고 있는 것입니다. 이러한 단순한 기하학적 규칙을 사용함으로써, 우리는 AI의 환각을 빠르고, 저렴하며, 정확하게 잡아낼 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →