← 최신 논문
🤖 machine learning

From token probabilities to calibrated confidence: An empirical study of mathematical question answering

이 실증적 연구는 수학적 질의응답을 위한 대규모 언어 모델의 신뢰도를 교정하는 방법들을 조사하며, 단일 패스 토큰 확률은 제한적인 신호만을 제공하지만, 이를 집계하고 자기 검증(self-verification) 또는 몬테카를로 드롭아웃(Monte Carlo Dropout)과 같은 다중 패스 전략을 적용한 후 사후 교정 기법을 사용하는 것이 추정된 신뢰도와 실제 정확도 사이의 정렬을 유의미하게 향상시킬 수 있다는 점을 밝혀냈다.

원저자: Avery Ma, Lorne Schell, Vin Bhaskara, Leila Pishdad

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Avery Ma, Lorne Schell, Vin Bhaskara, Leila Pishdad

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 로봇 친구와 고난도의 퀴즈 게임을 하고 있다고 상상해 보세요. 당신이 까다로운 질문을 던지면, 로봇은 정답을 내놓으며 징 소리를 냅니다. 하지만 여기 함정이 있습니다. 로봇은 너무나도 잘 보이고 싶은 나머지, 완전히 틀렸을 때조차 100% 확신에 찬 것처럼 들리곤 합니다. 인공지능의 세계에서 이것을 '과잉 확신(overconfidence)'이라고 부릅니다. 과학자들은 이 로봇들에게 "꽤 확신해요" 또는 "잘 모르겠어요"라고 말하는 법을 가르치려 노력하고 있습니다. 그래야 우리가 로봇을 언제 믿어야 할지 알 수 있기 때문입니다. 이것이 바로 **신뢰도 추정(confidence estimation)**의 과제입니다. 즉, 로봇의 답변이 정답일 확률이 얼마나 되는지 알아내는 것입니다. 이를 위해 연구자들은 로봇의 내부적인 '속삭임'인 **토큰 확률(token probabilities)**에 주목합니다. 이는 문장에서 다음 단어를 선택할 확률을 보여주는 아주 작은 숫자들입니다. 큰 질문은 이것입니다. 우리는 이 노이즈 섞인 속삭임을 로봇을 얼마나 믿을 수 있는지 정확히 알려주는 신뢰할 수 있는 '진실 측정기'로 바꿀 수 있을까요?

한 연구팀은 이 아이디어를 특히 수학 문제에 적용하여 테스트해 보기로 했습니다. 그들은 AI를 시험을 치르는 학생처럼 취급하며 이렇게 물었습니다. "만약 우리가 학생의 사고 과정을 면밀히 관찰한다면, 학생이 답안 작성을 마치기도 전에 정답을 맞혔는지 알 수 있을까?" 그들은 두 가지 주요한 경청 방식을 비교했습니다. 첫 번째는 '단일 패스(single-pass)' 방식인데, 이는 수학 문제와 로봇이 낸 최종 답안을 한 번에 분석하는 것입니다. 두 번째는 '멀티 패스(multi-pass)' 방식인데, 이는 로봇에게 자신의 풀이를 재검토하게 하거나, 약간의 변화를 주어 같은 문제를 로봇의 뇌에 여러 번 실행시켜 결과가 동일한지 확인하는 방식입니다.

그들이 발견한 사실은 다음과 같습니다. 우선, 만약 당신이 답변의 맨 마지막 단어(최종 숫자)만 듣는다면, 로봇은 설령 틀렸을 때조차 엄청나게 자신만만해 보인다는 것을 발견했습니다. 이는 마치 학생이 시험지에 "42"라고 적었지만, 사실은 찍어서 맞힌 상황과 같습니다. 하지만 만약 당신이 전체적인 추론 과정, 즉 로봇이 정답에 도ul기까지 거친 단계별 수학 풀이 전체를 듣는다면, 정답과 오답 사이의 미세하고 일관된 차이를 포착할 수 있습니다. 이 전체 사고 과정에 걸쳐 이러한 미세한 신호들을 평균 내는 방식을 통해, 그들은 추가적인 작업을 요구하지 않고도 훨씬 더 나은 '진실 측정기'를 얻는 방법을 찾아냈습니다.

연구자들은 또한 더 나은 신호를 얻기 위해 몇 가지 정교한 기술들을 시도했습니다. 한 가지 방법은 로봇에게 "이것이 맞다고 확신하나요?"라고 묻는 것이었습니다(자기 검증 방식). 그들은 로봇에게 처음부터 다시 읽어보라고 요청하는 방식은 정확하지만, 마치 학생에게 단 한 줄을 확인하기 위해 에세이 전체를 다시 쓰게 하는 것처럼 매우 느리고 비용이 많이 든다는 것을 발견했습니다. 그러나 그들은 영리한 지름길을 찾아냈습니다. 전체를 다시 쓰는 대신, 원래의 답변 끝에 "이것이 맞습니까?"라는 질문을 덧붙이는 것만으로 충분했습니다. 이 '인시투(in-situ, 현장)' 방식은 정확도는 동일하면서도 컴퓨터의 연산 노력을 88%나 절감해주었기에, 효율성 측면에서 큰 승리였습니다.

또 다른 기술은 '스토캐스틱 패스(stochastic passes)'로, 이는 로봇에게 약간의 무작위성(예를 들어 주사위를 던지는 것과 같은)을 주어 같은 문제를 여러 번 풀게 하여 마음을 바꾸는지 확인하는 것입니다. 'MC 드롭아웃(MC Dropout)'이라 불리는 이 방식은 불확실성을 잡아내는 데는 좋았지만, 로봇이 작업을 여러 번 수행해야 하므로 계산량이 매우 많았습니다. 연구자들은 이 방식이 효과적이긴 하지만, 더 단순한 '전체 이야기를 듣는' 방식과 비교했을 때 추가적인 비용을 들일 만큼의 가치가 있는지 의문이라는 점을 발견했습니다.

마지막으로, 그들은 로봇의 신뢰도 다이얼을 조정하는 법을 배우는 '캘리브레이션(calibration, 교정)' 단계를 테스트했습니다. 그들은 로봇의 신뢰도 점수가 현실과 더 잘 일치하도록 조정하기 위해 두 가지 고전적인 수학 도구(플랫 스케일링과 아이소토닉 회귀)를 사용했습니다. 그들은 이 도구들이 놀라운 효과를 발휘하며, 특히 아주 적은 양의 연습 문제(50개 정도의 예시)만으로도 학습이 가능하다는 것을 발견했습니다. 하지만 쉬운 수학 문제로 학습된 캘리브레이션은 어려운 문제에서는 항상 잘 작동하지 않으며, 한 종류의 로봇에 대해 학습된 캘리브레이션이 다른 종류의 로봇으로 잘 전이되지 않는다는 점도 관찰했습니다.

요약하자면, 이 논문은 로봇이 맞는지 확인하기 위해 두 배로 힘들게 일할 필요가 없다는 점을 시사합니다. 단순히 최종 답변만이 아니라 추론의 '전체 경로'에 더 세심한 주의를 기울이고, 로봇에게 스스로 재확인하도록 하는 영리하고 저비용인 방법을 사용함으로써, 우리는 훨씬 더 신뢰할 수 있는 신뢰도 측정기를 구축할 수 있습니다. 이러한 발견은 적절한 튜닝이 뒷받침된다면, AI 시스템이 자신이 무엇을 알고 무엇을 모르는지에 대해 훨씬 더 정직해질 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →