← 최신 논문
💬 NLP

Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification

이 논문은 LLM의 언어화된 신뢰도 추정치의 극심한 희소성이 보간법에 따라 AUARC와 같은 평가 지표를 결정적으로 왜곡한다는 점을 밝히고, 이러한 희소성을 완화하여 더 우수하고 공정한 성능 순위를 달을 수 있는 비용이 들지 않는 "언어화 로그 확률(verbalization logprobs)" 접근 방식을 제안한다.

원저자: Elena Merdjanovska, Omar Zaidan, Andreas Rücklé

게시일 2026-08-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Elena Merdjanovska, Omar Zaidan, Andreas Rücklé

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 산더미처럼 쌓인 우편물을 '좋음'과 '나쁨'으로 분류하기 위해 아주 똑똑하고 수다스러운 로봇 팀을 고용한다고 상상해 보세요. 당신은 단순히 로봇들이 우편물을 분류하기만을 원하는 게 아니라, 각 우편물에 대해 얼마나 확신하는지도 말해주길 원합니다. 만약 로봇이 50% 정도만 확신한다면, 그 편지는 따로 빼두어 사람이 직접 재확인하게 할 수도 있겠죠. 이것이 바로 **거대 언어 모델(LLM)**이 분류기 역할을 하는 세상입니다. 이 AI 시스템들은 천재적이지만 때로는 지나치게 자신만만한 학생들과 같습니다. 에세이를 쓰고 수수께끼를 풀 수는 있지만, 무언가를 분류하라는 요청을 받았을 때는 "꽤 확신해요" 또는 "그냥 추측이에요"라고 말할 수 있어야 합니다.

과학자들이 던지는 핵심 질문은 이것입니다: 우리는 이 로봇들이 자신의 확신에 대해 정말로 진실을 말하고 있는지 어떻게 알 수 있을까요? 만약 로봇이 "95% 확신합니다"라고 말한다면, 그것은 실제 계산된 느낌일까요, 아니면 그저 운 좋은 추측일까요? 이를 테스트하기 위해 연구자들은 **정확도-기각 곡선(Accuracy-Rejection Curve)**이라는 특별한 점수판을 사용합니다. 슬라이딩 스케일을 상상해 보세요. 로봇에게 더 엄격해지라고 지시할수록(예: 99% 확신할 때만 답변을 수락하도록), 수락된 편지의 더미는 작아지지만, 그 더미 안에 남은 것들은 거의 항상 정확합니다. 목표는 가장 많은 편물을 유지하면서도 여전히 매우 정확한 '최적의 지점(sweet spot)'을 찾는 것입니다. 문제는 로봇의 답변이 뭉쳐 있거나 반복적일 경우 이 점수판을 측정하는 것이 까다롭다는 점입니다.


로봇의 "95%" 습관

이 논문에서 저자인 엘레나 메르자노브스카(Elena Merdjanovska)와 그녀의 팀은 이 AI 로봇들이 확신을 표현하는 방식에서 기묘한 특성을 발견했습니다. 로봇에게 숫자(예: "95% 확신합니다")를 입 밖으로 내뱉으라고 요청하면, 로봇은 인간이 주사위를 던지는 것처럼 숫자를 무작위로 고르지 않습니다. 대신, 특정 패턴에 갇혀 버립니다.

이는 마치 객관식 시험을 치르는 학생이 생각하는 대신, 모든 답안지에 그냥 "95"라고 적는 것과 같습니다. 왜냐하면 그 숫자가 안전하고 딱 떨어지는 숫자라고 느끼기 때문이죠. 연구진은 인기 있는 AI 모델인 Qwen3-32B가 수천 개의 질문에 걸쳐 자신의 확신을 설명할 때 단 8개의 고유한 숫자(0.6, 0.65, 0.7, 0.75, 0.85, 0.9, 0.95, 0.98)만을 사용했다는 사실을 발견했습니다. 더 놀라운 것은, 절반 이상의 경우 로봇이 그냥 **95%**라고 말했다는 점입니다.

이것은 문제가 됩니다. 왜냐하면 라디오를 튜닝하려고 하는데 다이얼이 오직 8개의 특정 위치에서만 '딸깍' 소리가 나며 걸리는 것과 같기 때문입니다. 만약 당신이 98%의 정확도를 얻기 위해 '나쁜' 편지를 걸러내고 싶다면, 우편물의 40%를 버려야 할 수도 있습니다. 하지만 만약 로봇이 96.3%처럼 더 정밀한 숫자를 줄 수 있었다면, 우편물을 28%만 버려도 되었을 것입니다. 로봇이 너무 "희소(sparse)"하기 때문에(몇 개의 숫자에 갇혀 있기 때문에), 많은 양질의 데이터를 낭비하게 됩니다.

"매끄러운 선"의 함정

여기서 이야기는 더욱 흥미로워집니다. 연구진은 과학자들이 로봇의 성능를 측정하는 방식이 사실은 로봇을 속이고 있다는 것을 발견했습니다.

점수판(AUARC)을 계산할 때, 연구자들은 보통 그래프 위의 점들을 연결하는 선을 그립니다. 대부분의 사람들은 **선형 보간법(linear interpolation)**을 사용하는데, 이는 로봇의 확신이 점진적으로 변한다고 가정하며 점들 사이를 매끄러운 직선으로 연결합니다. 하지만 로봇이 8개의 숫자만 가지고 있다면, 점들 사이에는 거대한 간격이 존재합니다! 점들 사이의 간격을 매끄러운 선으로 잇는 것은 톱날 같은 산맥의 점들을 자를 대고 직선으로 긋는 것과 같습니다. 이는 존재하지 않는 가짜의 매끄러운 언덕을 만들어냅니다.

저자들은 이 "매끄러운 선" 방식이 로봇을 실제보다 훨씬 더 뛰어나 보이게 만든다는 것을 보여주었습니다. 실제로, 그들이 올바른 방법인 단계적 보간법(stepwise interpolation)—즉, 다음 실제 숫자가 나타날 때까지 평평한 선을 그리는 방식—으로 전환했을 때, 순위가 완전히 뒤바뀌었습니다. 매끄러운 선을 사용했을 때 "챔피언"처럼 보였던 방법은 단계적 보간법을 사용하자 꼴찌로 떨어졌습니다. 결국, 매끄러운 선은 로봇이 실제보다 더 유연한 것처럼 보이게 만든 시각적 착각이었던 것입니다.

마법 같은 "로그 확률(Logprobs)" 기술

그렇다면 숫자 8개로만 말하는 로봇을 어떻게 고칠 수 있을까요? 팀은 Verbalization Logprobs라는 영리한 해킹 방법을 제안했습니다.

보통 로봇이 "95%"라고 말할 때, 로봇은 단순히 "9"와 "5"라는 글자를 내뱉습니다. 이 방식을 사용하는 표준적인 방법은 그냥 숫자 95를 취하는 것입니다. 하지만 로봇은 사실 다른 것도 알고 있습니다. 로봇은 "9"를 선택할 확률이 "8"일 때보다 얼마나 높았는지, 그리고 "5"를 선택할 확률이 "6"일 때보다 얼마나 높았는지에 대한 확률을 알고 있습니다. 이러한 숨겨진 확률을 **로그 확률(logprobs)**이라고 부릅니다.

저자들의 새로운 방법은 로봇에게 단순히 숫자만을 묻는 것이 아니라, 그 숫자 뒤에 숨은 느낌을 묻는 것과 같습니다. 단순히 "95"를 취하는 대신, 그들은 로봇이 각 자릿수에 대해 얼마나 확신했는지를 바탕으로 가중 평균을 계산합니다. 이 방식은 로봇의 뭉쳐 있는 8개 숫자의 답변을 매끄럽고 연속적인 확신의 흐름으로 바꿔 놓습니다.

결과는 인상적이었습니다. 이 기술을 사용하자 로봇의 확신 점수는 훨씬 더 세밀해졌습니다(단 8개의 고유 값에서 600개가 넘는 고유 값으로 증가!). 이 과정에서 추가적인 컴퓨터 연산 능력이나 시간이 들지 않았습니다. 로봇이 이미 가지고 있던 정보를 활용했을 뿐입니다. 이 새로운 방법을 통해 로봇은 훨씬 더 잘 '최적의 지점'을 찾을 수 있었고, 기존 방식보다 성능 점수가 2.3포인트 향상되었습니다. 이는 로봇에게 고장 난 딸깍이 다이얼 대신 고해상도 다이얼을 준 것과 같았으며, 덕분에 훨씬 적은 낭비로 우편물을 분류할 수 있게 되었습니다.

요약

이 논문은 우리가 이 로봇들이 실제로는 매우 경직되어 있음에도 불구하고, 마치 매끄럽게 작동하는 것처럼 간주하는 것을 멈춰야 한다고 결론짓습니다. 만약 우리가 계속해서 "매끄러운 선" 방식으로 그들을 판단한다면, 우리는 잘못된 안도감을 갖게 될 것입니다. "단계적" 측정 방식을 사용하고, 더 상세한 답변을 얻기 위해 "로그 확률" 기술을 사용함으로써, 우리는 비로소 이 AI 분류기들이 언제 진정으로 확신하는지, 그리고 언제 그저 추측하고 있는지를 신뢰할 수 있게 됩니다. 이것은 우리가 듣는 방식을 바꾸는 작은 변화이지만, 이 디지털 조력자들을 얼마나 잘 활용할 수 있는지에 있어서는 엄청난 차이를 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →