← 최신 논문
🤖 machine learning

Integrating Local and Global Entropy for Uncertainty Quantification in LLMs

이 논문은 토큰 수준의 엔트로피와 은닉 상태 기하학적 엔트로피를 결사하여, 국소적 신호만으로는 놓치기 쉬운 '확신에 찬 오답(confident-but-wrong)' 형태의 환각을 효과적으로 포착하는 비지도 학습 기반의 단일 패스 방식인 전역-국소 불확실성(Global-Local Uncertainty, GLU)을 제안한다.

원저자: Johanne Medina, Tianyi Zhou, Keivin Isufaj, Aristides Gionis, Sanjay Chawla

게시일 2026-06-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Johanne Medina, Tianyi Zhou, Keivin Isufaj, Aristides Gionis, Sanjay Chawla

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 문제: 자신감 넘치는 거짓말쟁이

매우 자신감 있고 말솜씨가 좋은 친구에게 질문을 한다고 상상해 보세요. 그 친구는 완벽한 문법과 차분한 목소리로 즉시 대답합니다. 하지만 그 내용은 완전히 틀렸습니다.

이것이 오늘날 거대 언어 모델(LLM)이 가진 가장 큰 문제입니다. LLM은 100% 확신에 찬 어조로 "환각(hallucination)"(지어낸 이야기)을 일으키곤 합니다. 현재의 도구들은 모델이 다음에 올 단어에 대해 확신이 없는지를 살핌으로써 이를 감지하려고 시도합니다. 만약 모델이 다음 단어에 대해 불확실해 보인다면, 도구는 이를 위험 신호로 표시합니다.

결함: 때때로 모델은 자신이 내뱉는 모든 단어 하나하나에 대해서는 매우 확신을 갖지만, 그가 들려주는 '이야기 전체'는 거짓말일 때가 있습니다. 현재의 도구들은 이러한 "자신감 넘치는 거짓말쟁이"를 놓칩니다.

새로운 해결책: GLU (Global-Local Uncertainty, 전역-지역 불확실성)

이 논문의 저자들은 AI가 진실을 말하고 있는지 확인하는 새로운 방법을 제안합니다. 그들은 이 방법을 GLU라고 부릅니다.

AI의 뇌를 두 개의 서로 다른 부서가 있는 공장이라고 생각해 보세요:

  1. "단어 선택기" (Local/지역): 이 부서는 다음에 올 단어가 무엇인지 결정합니다.
  2. "스토리 설계자" (Global/전역): 이 부서는 구축되고 있는 이야기의 전체적인 지도를 보유합니다.

저자들은 AI가 거짓말을 하는지 잡아내려면, 단순히 '단어 선택기'만 보는 것이 아니라 두 부서 모두를 확인해야 한다고 주장합니다.

1. 지역 체크 (단어 선택기)

  • 작동 방식: 이는 각 개별 단어에 대한 모델의 확신도를 살펴봅니다. 만약 모델이 "고양이"와 "강아지" 사이에서 망설이고 있다면, 이는 국소적으로(locally) 불확실한 상태입니다.
  • 비유: 요리사가 수프 맛을 보는 상황을 상상해 보세요. 만약 소금을 충분히 넣었는지 확신이 없다면, 요리사는 잠시 멈칫할 것입니다. 이것이 "지역적" 불확실성입니다.
  • 문제점: 자신감 넘치는 거짓말쟁이는 모든 재료에 대해 "완벽해요!"라고 말하면서도, 정작 요리 전체에는 독을 넣은 요리사와 같습니다. 지역 체크는 모든 개별 단어가 멀쩡해 보이기 때문에 이 문제를 놓칩니다.

2. 전역 체크 (스토리 설계자)

  • 작동 방식: 이는 모델의 "숨겨진 상태(hidden states)"를 살펴봅니다. 이것은 모델이 개념을 이해하기 위해 사용하는 내부적인 수학적 지도입니다. 저자들은 이 지도의 "기하학적 복잡성"을 측정합니다.
  • 비유: 요리사가 주방을 돌아다니는 상황을 상상해 보세요.
    • 일관됨 (진실): 만약 요리사가 진짜 수프를 만들고 있다면, 냉장고에서 가스레인지, 그리고 냄비까지 직선의 짧고 효율적인 경로로 이동할 것입니다. 그들의 경로는 효율적이고 집중되어 있습니다.
    • 비일관됨 (환각): 만약 요리사가 가짜 레시피를 지어내고 있다면, 그들은 목적 없이 배회할 수 있습니다. 냉장고에 갔다가, 정원에 갔다가, 차고에 갔다가, 다시 냉장고로 돌아오는 식입니다. 그들은 한 번에 너무 많은 방향으로 움직이고 있습니다.
  • 통찰: 설령 요리사가 매 단계마다 "완벽해요!"라고 말할지라도(Local), 만약 그들이 주방을 이리저리 헤매고 있다면(Global), 무언가 잘못된 것입니다. 논문에서는 이를 "기하학적 표류(geometric drift)"라고 부릅니다.

GLU의 작동 원리: "곱셈 게이트(Multiplicative Gate)"

이 논문의 핵심 혁신은 이 두 가지 체크를 결합하는 방식에 있습니다.

  • 기존 방식 (덧셈): 점수를 더하는 보안 요지를 상상해 보세요. "단어 확신도: 9/10. 주방 배회 정도: 2/10. 총합: 11/20." 만약 단어 확신도가 충분히 높다면, 보안 요원은 배회하는 움직임을 무시하고 통과시켜 버립니다.
  • GLU 방식 (곱셈): 저자들은 점수를 곱하는 "게이트"를 사용합니다.
    • 만약 주방을 헤매는 정도(Global)가 높다면, 이는 단어 확신도에 대한 알람을 울리는 볼륨 조절 노브처럼 작동하여 경보를 키웁니다.
    • 결과: 설령 모델이 모든 단어에 대해 확신을 갖더라도, 내부적인 "경로"가 헤매고 있다면 GLU 점수가 급증하여 답변이 신뢰할 수 없음을 표시합니다.

연구 결과

연구진은 세 가지 서로 다른 AI 모델과 여섯 가지 유형의 질문(상식, 수학, 아랍어 과제 등)을 대상으로 테스트를 진행했습니다.

  1. "자신감 있지만 틀린 경우" 포착: 표준적인 방법들(Local만 확인하는 방식)은 틀린 답변 중 상당수를 놓쳤는데, 그 이유는 해당 답변들이 매우 자신감 있게 들렸기 때문입니다. GLU는 모델의 뇌 속에서 일어나는 "헤매는 경로"를 포착함으로써 이를 잡아냈습니다.
  2. 다른 방식보다 우수함: GLU는 다른 모든 "비지도 학습(unsupervised)" 방식(데이터에 인간의 라벨을 먼저 붙일 필요가 없는 방식)보다 뛰어난 성능을 보였습니다. GLU는 오류를 더 잘 찾아냈으며, AI가 나쁜 답변을 내놓기 전에 "멈춰서 생각하도록" 유도하는 데 더 효과적이었습니다.
  3. 효율성: 이 방식은 AI가 답변을 여러 번 생성하게 하거나 추가적인 컴퓨팅 파워를 요구하지 않습니다. 단 한 번의 답변 생성 과정에서 단어와 내부 경로를 모두 확인합니다.

요약

이 논문은 AI를 신뢰하기 위해서는 단순히 그들의 말을 듣는 것뿐만 아니라, 그들이 어떻게 생각하는지를 관찰해야 한다고 주장합니다. 단어 수준의 확신개념 수준의 헤맴을 결합함으로써, GLU는 AI가 자신감 있게 거짓말을 하는 특정 유형의 오류를 잡아내는 안전망을 만듭니다. 또한 추가적인 학습 데이터나 AI의 속도를 늦추지 않고도 이 일을 수행합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →