← 최신 논문
🤖 machine learning

Reading Calibrated Uncertainty from Language Model Trajectories

본 논문은 계층별 MLP 업데이트 궤적에서 스케일 불변 기하학적 특징을 추출하여 희소 선형 프로브에 입력함으로써 언어 모델의 불확실성 정량화를 개선하는 방법을 제안하며, 이는 표준 최대 소프트맥스 확률 접근법보다 우수한 성능을 보이면서도 모델의 깊이에 걸쳐 오류가 어떻게 그리고 어디서 발생하는지에 대한 해석 가능한 통찰을 제공합니다.

원저자: Aliai Eusebi, Alexander Herzog, Xiaoyu Liang, Marie Vasek, Enrico Mariconti, Lorenzo Cavallaro

게시일 2026-05-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Aliai Eusebi, Alexander Herzog, Xiaoyu Liang, Marie Vasek, Enrico Mariconti, Lorenzo Cavallaro

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델 (LLM) 을 매우 똑똑하지만 때로는 지나치게 자신감 있는 학생이 객관식 시험을 치르는 상황으로 상상해 보세요. 학생이 문제를 풀면 보통 "이것이 정답일 확률이 95% 입니다"라고 말하듯 '신뢰도 점수'를 제시합니다. 이것이 모델이 맞는지 틀리는지 확인하는 표준적인 방법입니다.

하지만 이 논문은 그 신뢰도 점수가 종종 거짓말이라고 주장합니다. 모델이 완전히 틀렸음에도 "95% 확신"이라고 말할 수 있습니다. 이는 무작위로 추측하더라도 그 추측에 대해 매우 자신감을 느끼는 학생과 같습니다.

문제: 목적지만 보고 여정을 보지 않음

AI 가 얼마나 자신 있는지를 확인하는 대부분의 방법은 최종 답변(목적지) 만을 봅니다. 그들은 모델의 사고 과정을 마지막 순간에 찍은 단일 스냅샷으로 취급합니다.

이 논문의 저자들은 이렇게 말합니다. "잠깐만요! 누군가가 진정으로 확신하는지 이해하려면 최종 답변만 보면 안 됩니다. 어떻게 그곳에 도달했는지를 지켜봐야 합니다."

그들은 모델의 내부 사고를 산을 오르는 등산객에 비유합니다.

  • 표준 방법 (MSP): 등산객이 정상에 도달했을 때만 봅니다. 정상에서 행복해 보이면 우리는 그들이 쉽고 곧은 길을 올랐다고 가정합니다.
  • 새로운 방법 (궤적): 등산객의 전체 경로를 지켜봅니다. 그들은 곧은 길을 걸었나요? 절벽으로 빠져나갔다가 다시 되돌아왔나요? 정상에 비틀거리며 도착하기 전에 wildly하게 지그재그로 움직였나요?

이 논문은 두 등산객이 같은 정상에 같은 행복한 표정으로 도달하더라도, 그들의 경로가 매우 다른 이야기를 들려줄 수 있다고 주장합니다. 한 명은 매끄럽고 자신감 있는 등반을 했을 수 있어 (아마도 정답일 것) 반면, 다른 한 명은 길을 잃고 혼란스러우며 내내 바람과 싸웠을 수 있어 (아마도 오답일 것) 정상에서 웃고 있더라도 말입니다.

해결책: "모션 감지기"

연구자들은 모델의 내부 사고를 위한 모션 감지기 역할을 하는 도구를 개발했습니다.

  1. 단계 추적: 모델이 질문을 처리하는 동안, 그것은 '뉴런'(건물의 층과 같음) 의 많은 계층을 거칩니다. 각 층에서 모델은 답변에 작은 조정을 가합니다.
  2. 지도 그리기: 최종 결과만 보는 대신, 이 도구는 모델이 이러한 층들을 통과하며 취한 경로의 지도를 그립니다.
  3. 형태 측정: 이 도구는 이 경로에 대해 다음을 포함한 11 가지 구체적인 사항을 측정합니다.
    • 매끄러움: 모델이 갑자기 마음을 바꿨나요?
    • 방향: 모델이 같은 방향으로 계속 밀어붙였나요, 아니면 이전의 생각과 싸웠나요?
    • 효율성: 모델이 직접적인 경로를 택했나요, 아니면 빙글빙글 돌며 헤맸나요?

결과: 더 똑똑한 "정지" 버튼

이 "모션 지도"를 사용하여 연구자들은 오류를 예측하는 단순하고 투명한 시스템 ('희소 선형 프로브') 을 훈련시켰습니다.

  • 표준 방법보다 우수함: 이 새로운 시스템은 모델이 자신의 신뢰도에 대해 거짓말할 때를 포착하는 데 훨씬 뛰어납니다. 테스트에서 표준 방법보다 '높은 신뢰도의 실수'를 크게 줄였습니다.
  • "선택적 포기" 트릭: 이 시스템이 문제를 포착하는 데 매우 뛰어나기 때문에 모델에게 이렇게 말할 수 있습니다. "야, 너는 95% 확신한다고 생각하지만, 내부 경로는 엉망이야. 너에게 멈추라고 하고 답변을 내지 말라고 할 거야." 이는 모델이 자신 있게 잘못된 답변을 내놓는 것을 방지합니다.
  • "왜" 요인: 가장 멋진 점은 이 도구가 간단한 기하학적 측정 (예: "경로가 얼마나 굽었는가?") 을 사용하기 때문에, 실제로 오류를 표시한 이유를 볼 수 있다는 것입니다. 이는 모델이 처음에는 자신 있었으나 중간 계층에서 갑자기 마음을 바꾸고, 다시 원래 아이디어로 답변을 강제로 되돌리려 했다고 알려줄 수 있습니다. 마치 의사가 단순히 "환자가 아파요"라고 말하는 대신, "환자는 단순히 아픈 것이 아닙니다. 오후 2 시에 심박수가 급증했고 오후 3 시에 체온이 떨어졌습니다"라고 말할 수 있는 것과 같습니다.

요약

간단히 말해, 이 논문은 모델의 최종 "나는 확신해!"라는 진술을 신뢰하는 것을 멈추라고 가르칩니다. 대신 모델이 문제를 어떻게 생각했는지에 대한 영화를 지켜봐야 합니다. 내부 단계의 "운동"과 "형태"를 살펴봄으로써, 그렇지 않으면 틈새로 빠져버렸을 자신감 있는 오류들을 잡아낼 수 있으며, 이는 비싸거나 복잡한 새로운 시스템이 필요 없이 AI 를 더 안전하고 신뢰할 수 있게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →