← 최신 논문
📊 statistics

LLMs as Implicit Imputers: Uncertainty Should Scale with Missing Information

본 논문은 암묵적 결측치 추정자로 작용하는 대규모 언어 모델이 결측 정보에 비례하는 불확실성을 나타내야 한다고 주장하며, 샘플링 기반 신뢰도는 컨텍스트 열화가 심화됨에 따라 이를 반영하지 못하지만 응답 엔트로피는 결측 상태를 효과적으로 추적하고 정확도를 더 잘 예측한다는 사실을 발견했습니다.

원저자: Stef van Buuren

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Stef van Buuren

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마치 미스터리를 해결하려는 형사가 되어 상상해 보세요. 보통은 범인을 찾아내는 데 도움이 되는 증거 파일 (즉, '맥락') 이 가득 차 있습니다. 하지만 때로는 그 파일이 찢겨져서 몇 장의 조각만 남게 됩니다.

이 논문은 간단하지만 결정적인 질문을 던집니다: 당신의 형사 (AI 언어 모델) 가 누락된 증거로 작업할 때, 얼마나 불확실해야 하는지 알고 있을까요?

저자들은 AI 가 "증거가 충분하지 않아서 추측 중입니다"라고 인정하는 '통계적 형사'처럼 행동해야 한다고 주장합니다. 대신 그들은 현재의 AI 들이 wildly 추측하면서도 100% 확신한다고 주장하는, 지나치게 자신감 넘치는 형사처럼 행동한다는 사실을 발견했습니다.

다음은 간단한 비유를 사용한 그들의 발견 사항 요약입니다:

1. 핵심 아이디어: '누락된 단서' 테스트

연구자들은 AI 를 **다중 대체자 (Multiple Imputer)**처럼 취급했습니다. 통계학에서 데이터가 누락되었을 때 전문가들은 단순히 하나의 답을 추측하지 않고, 답이 얼마나 달라질 수 있는지 보기 위해 여러 가지 가능한 시나리오를 생성합니다.

  • 테스트: 그들은 질문을 가지고 배경 정보 (맥락) 를 천천히 찢어 AI 가 읽을 수 있는 것이 질문 자체뿐이 될 때까지 진행했습니다.
  • 규칙: 단서가 사라질수록 AI 의 '불확실성'은 상승해야 합니다. 단서가 없다면 매우 불확실해야 하고, 모든 단서가 있다면 매우 확신해야 합니다.

2. '불확실성'을 측정하는 두 가지 방법

연구자들은 동일한 질문을 10 번 연속으로 물었을 때 AI 가 얼마나 불확실한지 측정하는 두 가지 방법을 살펴보았습니다:

  • '큰 목소리' (신뢰도): 이는 AI 가 매번 동일한 답을 주는 빈도를 측정합니다. 10 번 중 10 번 '덴버 브롱코스'라고 말한다면, 매우 자신감 있게 들립니다.
  • '군중의 수다' (엔트로피): 이는 답들이 얼마나 다르다를 측정합니다. AI 가 '덴버 브롱코스'를 한 번, '뉴잉글랜드'를 한 번, '패트리어츠'를 한 번, 그리고 '모르겠습니다'를 일곱 번 말한다면, 많은 '수다'나 다양성이 존재합니다. 이것이 높은 엔트로피입니다.

3. 큰 발견: '큰 목소리'는 거짓말쟁이다

이 연구는 '큰 목소리' (신뢰도) 에 중대한 문제가 있음을 발견했습니다:

  • 일어난 일: AI 가 완전한 맥락 (단서) 없이도 10 번 연속으로 동일한 잘못된 답을 주는 경우가 많았습니다. 완전히 훈련 데이터에서 암기한 내용을 바탕으로 추측하고 있었음에도 불구하고, 놀라울 정도로 자신감 있게 들렸습니다.
  • 비유: 교과서를 잊어버린 학생이 시험을 치는 상황을 상상해 보세요. 그들은 모든 질문에 'C'라고 추측합니다. 그들은 100% 일관성 (높은 신뢰도) 을 보이지만, 100% 틀립니다. AI 는 정확히 이런 행동을 하고 있었습니다.

4. 승리자: '군중의 수다' (엔트로피)

'군중의 수다' (엔트로피) 는 훨씬 더 잘 작동했습니다:

  • 일어난 일: 연구자들이 맥락을 제거하자 AI 의 답들이 흩어지기 시작했습니다. '덴버 브롱코스'를 10 번 말하던 대신 '덴버', '브롱코스', '그 팀', '모르겠습니다' 등으로 말하기 시작했습니다.
  • 비유: 이는 방 안에 있는 형사들의 무리와 같습니다. 모든 증거가 있을 때 그들은 모두 같은 용의자를 가리킵니다. 증거를 빼앗으면 서로 다른 방향을 가리기 시작합니다. 그들이 더 혼란스러워질수록 서로 다른 방향을 가리킵니다.
  • 결과: '군중의 수다' 측정치는 AI 의 정확도가 떨어질수록 정확히 상승했습니다. 이는 혼란의 진정한 신호였습니다.

5. '해상도 비율' (단서가 얼마나 도움이 되었나?)

저자들은 **해상도 비율 (Resolution Ratio)**이라는 간단한 점수를 만들었습니다.

  • 전구용 디머 스위치라고 생각하세요.
  • 맥락 없음 (끄기): 방은 어둡습니다 (높은 불확실성).
  • 완전한 맥락 (켜기): 방은 밝습니다 (낮은 불확실성).
  • 점수: 이는 '빛' (맥락) 이 '어둠' (불확실성) 을 얼마나 꺼뜨렸는지 측정합니다. 그들은 완전한 맥락이 약 80% 의 불확실성을 해결했다는 사실을 발견했는데, 이는 타당합니다.

논문의 주장 요약

  • 문제: 현재의 AI 모델들은 종종 '부적절한 대체자'입니다. 정보가 부족할 때 불확실성을 억누르고 단일하지만 종종 잘못된 확신에 찬 답을 줍니다.
  • 해결책: 우리는 AI 가 같은 답을 반복하는 빈도 (신뢰도) 가 아니라, 답이 얼마나 다르다 (엔트로피) 에 주목해야 합니다.
  • 증거: 맥락이 제거되었을 때 AI 의 정확도는 떨어졌지만, 그 '신뢰도'는 높게 유지되었습니다 (우리를 속임). 반면 그 '엔트로피' (답의 다양성) 는 상승하여 자신이 길을 잃었음을 올바르게 신호했습니다.
  • 교훈: AI 가 정보 부족으로 추측하고 있는지 알고 싶다면, 얼마나 확신하는지 묻지 마세요. 대신 이렇게 물어보세요: "내가 10 번 물어보면 10 개의 서로 다른 답을 줄까요?" 만약 그렇다면, 자신이 불확실하다는 것을 알고 있는 것입니다. 만약 10 번 같은 잘못된 답을 준다면, 그것은 지나치게 자신감 있는 것입니다.

이 논문은 우리가 일반적으로 보는 표준 '신뢰도' 점수보다 엔트로피가 AI 가 맹비행 중일 때를 알려주는 훨씬 더 나은 '블랙박스' 도구라고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →