← 최신 논문
💬 NLP

HALT: Hallucination Assessment via Log-probs as Time series

이 논문은 토큰 로그 확률(log-probabilities)을 시계열로 분석하여 기존 방식보다 우수한 성능과 속도를 달성한 가볍고 효율적인 환각 탐지기인 HALT를 소개하며, 이와 함께 대규모 언어 모델의 환각 탐지를 평가하기 위해 10가지의 다양한 역량을 통합한 포괄적인 벤치마크인 HUB를 소개한다.

원저자: Ahmad Shapiro, Karan Taneja, Ashok Goel

게시일 2026-02-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ahmad Shapiro, Karan Taneja, Ashok Goel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 이야기꾼의 이야기를 듣고 있다고 상상해 보세요. 때때로 그들은 아주 확신에 찬 목 {목소리로, 안정적이고 명확하게 말합니다. 또 어떤 때는 말을 더듬거나, 주저하거나, 사실이 아닌 세부 사항을 지어내기 직전에 목소리가 떨리기도 합니다.

오랫동안 거대 언어 모델(LLM)이 거짓말을 하는 것(또는 "환각" 현상)을 잡아내려 노력해 온 연구자들은 두 가지 주요 접근 방식을 시도해 왔습니다:

  1. "화이트박스(White-Box)" 접근 방식: 이야기꾼에게 비밀 노트와 뇌파를 보여달라고 요청하는 것입니다. 이는 당신이 그 이야기꾼을 소유하고 있다면 훌륭한 방법이지만, 공용 API(예: 챗봇)를 사용하는 중이라면 불가능한 일입니다.
  2. "블랙박스(Black-Box)" 접근 방식: 이야기꾼에게 이야기를 다시 반복하게 하거나, 두 번째 이야기꾼에게 사실 확인을 요청하는 것입니다. 이는 느리고 비용이 많이 들며, 때로는 두 번째 이야기꾼 역시 거짓말을 할 수도 있습니다.

HALT(로그 확률을 이용한 시계열 기반 환각 평가)는 이 두 가지 모두를 필요로 하지 않는 영리한 탐정입니다. 비밀 노트도 필요 없고, 두 번째 이야기꾼도 필요 없습니다. HALT는 오직 이야기꾼의 자신감의 리듬에 귀를 기울일 뿐입니다.

핵심 아이디어: 자신감의 "심장 박동"에 귀 기울이기

AI가 텍스트를 생성할 때, 단순히 단어를 고르는 것이 아니라 다음에 올 수 있는 모든 가능한 단어의 확률을 계산합니다. 이 계산들을 **로그 확률(log-probabilities)**이라고 부릅니다. 이것들을 AI의 개별 단어에 대한 내부적인 "자신감 측정기"라고 생각하세요.

이 논문의 저자들은 이 자신감 측정기가 그냥 가만히 있는 것이 아니라, 시계열(심장 박동이나 주식 시장 차트처럼) 형태로 움직인다는 사실을 깨달았습니다.

  • AI가 진실을 말할 때, 그 자신감 측정기는 보통 매끄럽고 안정적인 리듬을 따릅니다.
  • AI가 환각(무언가를 지어냄)을 시작하면, 그 리듬은 이상해집니다. AI가 매우 자신감 있게 들릴지라도, 특정 패턴으로 급증하거나, 갑자기 떨어지거나, 혹은 흔들릴 수 있습니다.

HALT는 이 자신감의 리듬을 관찰하도록 훈련된 작고 가벼운 컴퓨터 프로그램("GRU" 모델)입니다. HALT는 AI가 말하는 단어를 읽지 않습니다. 오직 AI가 말하는 동안 나타나는 자신감의 그래프만을 관찰합니다.

탐정의 도구 상자: HALT

HALT는 특수 청진기와 같습니다. HALT는 AI가 고려하고 있는 상위 20개의 가장 가능성 높은 단어들을 살펴봅니다. HALT가 측정하는 것은 다음과 같습니다:

  • 선택의 불안정성: AI가 두 단어 사이에서 갈등하고 있는가? (높은 불확실성).
  • 변화의 급격함: AI가 99% 확신에서 50% 확신으로 갑자기 떨어졌는가?
  • 시간에 따른 패턴: 자신감 곡선이 매끄러운 언덕 모양인가, 아니면 들쭉날쭉한 산맥 모양인가?

이 "자신감 심장 박동"을 뇌에 입력함으로써, HALT는 AI가 거짓말을 하기 시작할 때 발생하는 특유의 "부정맥"을 포착하는 법을 배웁니다.

새로운 경기장: HUB

HALT가 실제로 작동하는지 테스트하기 위해, 저자들은 HUB(환각 탐지 통합 벤치마크)라는 거대하고 새로운 테스트 경기장을 구축했습니다.

이전의 테스트들이 작은 조용한 도서관에서만 경기를 치르는 것(단순한 사실이나 채팅에만 집중하는 것)이었다면, HUB는 10가지의 다른 스포츠가 있는 거대하고 혼란스러운 경기장입니다:

  • 추론 스포츠: 수학, 코딩, 논리 퍼즐, 알고리즘.
  • 일반 스포츠: 채팅, 뉴스 요약, 상식 퀴즈.

저자들은 "환각"이 단순히 사실을 잘못 말하는 것(예: 달이 치즈로 만들어졌다고 말하는 것)만이 아니라는 점을 깨달았습니다. 그것은 또한 논리적 환각이기도 합니다. 즉, 사실은 맞게 말하지만 그곳에 도달하기 위한 수학적 계산이나 논리적 단계를 틀리는 경우를 말합니다. HUB는 이 모든 것을 테스트합니다.

결과: 작지만 강력함

이 논문은 HALT를 다른 탐지기들과 비교합니다:

  • Lettuce: 실제 텍스트를 읽는 매우 크고 무거운 탐지기(거대한 탱크와 같은)입니다.
  • 화이트박스 방식: AI의 내부 뇌를 볼 수 있어야 하는 탐지기(대부분의 상용 AI에서는 불가능한 일)입니다.

놀라운 점: HALT는 무거운 탱크(Lettuce)보다 30배 더 작으며, 60배 더 빠릅니다. 그런데도 더 자주 승리합니다!

  • HALT는 10가지 스포츠 중 7가지에서 무거운 탱크를 이겼습니다.
  • HALT는 텍스트를 읽거나 AI의 뇌를 볼 필요 없이, 오직 자신감의 리듬에 귀를 기울이는 것만으로도 거대한 탱크만큼 잘 작동합니다.

중요한 한계점 (논문에서 언급된 내용)

  • 모델 종속적임: HALT는 특정 선수의 심장 박동을 완벽하게 알고 있는 코치와 같습니다. 만약 HALT를 "Llama"라는 AI에 맞춰 훈련시킨다면, HALT는 Llama의 거짓말을 찾아내는 전문가가 됩니다. 하지만 동일한 HALT를 "Qwen"이라는 다른 AI에 사용하려고 하면, HALT는 혼란에 빠집니다. "심장 박동" 패턴은 모델마다 다릅니다.
  • "자신감 숫자"에 대한 접근 권한이 필요함: AI의 뇌를 볼 필요는 없지만, API가 모든 단어에 대해 상위 20개의 자신감 숫자를 제공해야 합니다. 만약 API가 이 숫자들을 완전히 숨겨버린다면, HALT는 작동할 수 없습니다.
  • 탐지할 뿐, 수정하지는 못함: HALT는 연기 감지기입니다. HALT는 AI가 언제 환각을 일으키는지 알려주지만, 왜 그런 일이 일어났는지 또는 이야기를 어떻게 수정해야 하는지는 알려주지 않습니다.

요약 비유

AI를 마술을 선보이는 마술사라고 생각해 보세요.

  • 기존의 탐지기들은 마술사의 모자 밑을 훔쳐보려 하거나(화이트박스), 관객들에게 마술이 진짜인지 투표하게 하려 했습니다(블랙박스 텍스트 분석).
  • HALT는 그저 마술사의 손을 지켜봅니다. HALT는 마술사가 모자에서 가짜 토끼를 꺼내려 할 때, 비록 미소를 짓고 있더라도 손동작이 약간 끊기고 예측 불가능해진다는 것을 알고 있습니다. HALT는 AI의 자신감 숫자에서 나타나는 그 특유의 "끊기는 손동작" 패턴을 포착하도록 훈련되었으며, 이를 통해 트릭을 보거나 다른 사람에게 물어볼 필요 없이 즉각적으로 거짓말을 잡아냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →