← 최신 논문
🤖 machine learning

Improved Confidence Estimates for Black-Box Large Language Models

이 논문은 기존의 신뢰도 점수와 대상 데이터셋 내 유사한 쿼리의 정답 여부를 사용하여 응답의 정확성을 예측하도록 단순한 분류기를 학습시킴으로써, 블랙박스 대규모 언어 모델의 불확실성 정량화를 개선하는 저비용 방법을 제안한다.

원저자: Sokhna Diarra Mbacke, Mouloud Belbahri, Gabriel Loaiza-Ganem

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sokhna Diarra Mbacke, Mouloud Belbahri, Gabriel Loaiza-Ganem

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 글쓰기, 코딩, 질문 답변에 있어 강력한 도구가 되었지만, 때때로 절대적인 확신을 가지고 사실을 지어내는 숨겨진 위험을 안고 있습니다. 흔히 '환각(hallucination)'이라 불리는 이 현상은 잘못된 답변이 심각한 결과를 초래할 수 있는 의료나 과학 연구와 같은 고위험 분야에서 이 시스템들을 사용하는 데 큰 장벽이 됩니다. 이를 해결하기 위해 연구자들은 시스템이 특정 답변을 얼마나 신뢰할 수 있는지 알려줄 수 있는 방법을 구축하려고 오랫동안 노력해 왔습니다. 목표는 모든 응답에 대해 그 신뢰도를 나타내는 점수를 부여하는 것입니다. 현재 모델에게 스스로의 확신도를 평가하게 하거나, 동일한 질문을 다양한 방식으로 물었을 때 답변이 얼마나 변하는지 분석하는 것 등 이 점수를 생성하는 많은 방법이 존재합니다. 그러나 기존의 이러한 점수들은 모델이 과거에 유사한 질문에 어떻게 답했는지 살펴보지 않고, 모든 새로운 질문을 마치 모델이 처음 보는 것처럼 취급하며 고립된 상태에서 작동한다는 한계가 있습니다.

Layer 6 AI와 TD Insurance의 연구진은 신뢰도를 모델의 고정된 속성이 아니라 학습 가능한 패턴으로 취급하는 다른 접근 방식을 제안했습니다. 그들은 기존 방식들이 사전 데이터 없이도 원시 불확실성 점수를 생성하지만, 실제 응용 사례에서는 거의 항상 정답 여부가 이미 확인된 질문과 답변의 데이터셋이 포함된다고 주장합니다. 연구진은 이 라벨링된 데이터가 거대하고 아직 활용되지 않은 자원이라는 점에 주목했습니다. 새로운 불확실성 측정법을 처음부터 발명하려 하는 대신, 그들은 기존의 점수를 가져와 이를 모델이 과거에 유사한 질문에 어떻게 답했는지에 대한 정보와 결합하는 간단한 시스템을 구축했습니다. 표준 컴퓨터 프로그램이 이러한 입력값들과 실제 정답 사이의 관계를 인식하도록 훈련함으로써, 그들은 기존 점수 단독 사용 시보다 일관되게 더 우수한 성능을 보이는 새로운 방법을 만들어냈습니다.

그들 작업의 핵심은 인간 전문가가 새로운 주장을 검증하는 방식을 모방한 2단계 프로세스를 포함합니다. 먼저, 시스템은 새로운 질문과 대규모 언어 모델이 제공한 답변을 가져옵니다. 그런 다음, 시스템은 모델이나 다른 도구들이 통상적으로 생성하는 표준 불확실성 점수를 계산합니다. 다음으로, 시스템은 이전에 답변했던 질문들의 참조 라이브러리를 살펴보고 새로운 질문과 가장 유사한 질문들을 찾아냅니다. 그리고 모델이 과거에 그 유사한 질문들을 맞혔는지 틀렸는지 확인하고, 현재 질문과 얼마나 유사한지를 측정합니다. 이러한 세부 사항들, 즉 표준 점수, 유사 질문의 이력, 그리고 그들에 대한 모델의 과거 성과가 단순한 분류기(classifier)에 입력됩니다. 이 분류기는 새로운 답변이 정답인지 여부를 예측하도록 학습되며, 결과적으로 원시 불확실성 신호를 보정된 진실 확률로 변환합니다.

연구진은 다양한 크기의 언어 모델을 사용하여 상식적 추론, 과학적 사실, 일반 지식 질문을 포함한 여러 가지 데이터셋을 통해 이 방법을 테스트했습니다. 그들은 모델에게 자신의 확신을 말하게 하거나 답변의 여러 변형을 생성하여 일관성을 확인하는 방식 등 기존의 가장 우수한 방법들과 비교했습니다. 결과에 따르면, 그들의 접근 방식이 일관되게 더 정확한 정답 예측을 제공했습니다. 거의 모든 테스트에서 새로운 방법은 기존 점수 단독일 때보다 정답과 오답을 구별하는 데 더 뛰어난 성능을 보였습니다. 나아가, 이 시스템은 잘 보정된 확률을 생성했는데, 이는 시스템이 어떤 답변이 정답일 확률이 80%라고 예측했을 때 실제로 약 80%의 확률로 정답이었다는 것을 의미합니다. 이러한 보정은 의사결정에 있어 매우 중요한데, 이는 사용자가 시스템이 제공하는 수치를 신뢰할 수 있게 해주기 때문입니다.

가장 중요한 발견 중 하나는 이 방법이 매우 적은 추가 정보에 의존할 때도 잘 작동했다는 점입니다. 일부 테스트에서 시스템은 모델로부터 단 하나의 답변만을 가져오고 유사한 질문의 이력을 사용했으며, 답변의 여러 변형을 생성할 필요가 없었습니다. 이는 계산 비용을 낮게 유지하여 속도와 효율성이 중요한 실제 환경에서의 실용성을 높였습니다. 또한 연구진은 이러한 신호들을 결합하는 최선의 방법이 특정 과업에 따라 달라진다는 것을 발견했으며, 이는 일률적인 해결책보다 다양한 유형의 질문에 적응할 수 있는 유연한 접근 방식이 더 우월함을 시사합니다. 신뢰도 추정을 고정된 계산이 아닌 학습 문제로 다룸으로써, 연구팀은 모델의 내부 작동 방식에 접근하거나 값비싼 재학습을 거치지 않고도 기존 데이터를 활용해 대규모 언어 모델의 안전성과 신뢰성을 크게 향상시킬 수 있음을 입증했습니다.

본 연구는 현재의 도구들이 생성하는 초기 불확실성 점수가 유용하기는 하지만, 그것이 신뢰도의 최종 결론은 아니라고 결론짓습니다. 모델이 유사한 유형의 질문에 대해 일관되게 수행하는 경향을 활용함으로써, 지도 학습 프레임워크는 이러한 점수들을 훨씬 더 신뢰할 수 있는 추정치로 정교화할 수 있습니다. 이는 좋은 불확실성 지표의 필요성을 대체하는 것이 아니라 오히려 이를 강화하여, 원시 데이터를 실행 가능한 통찰력으로 바꾸는 것입니다. 이 연구는 더 안전한 인공지능으로 가는 길이 단순히 더 나은 모델을 만드는 것뿐만 아니라, 그 모델들이 내놓는 답변을 이해하고 해석하는 더 나은 방법을 구축하는 데 있다는 것을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →