← 최신 논문
💬 NLP

Claim-Level Confidence Calibration for Reliable Decision Making with Large Language Models

이 논문은 LLM의 응답을 원자적 주장(atomic claims)으로 분해하고 추론 시그널을 이용한 사후 교정(post-hoc calibration)을 적용하여 신뢰할 수 있는 주장 수준의 신뢰 점수를 생성함으로써, 고위험 영역에서 더욱 실행 가능한 의사 결정과 표적화된 검증을 가능하게 하는 폐쇄형 박스(closed-box) 프레임워크를 제안한다.

원저자: Toghrul Abbasli, Kentaroh Toyoda, Yuan Wang, Li Chen

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Toghrul Abbasli, Kentaroh Toyoda, Yuan Wang, Li Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 급격히 진화하는 환경 속에서, 거대 언어 모델은 텍스트를 생성하고, 질문에 답하며, 복잡한 업무를 보조하는 강력한 도구가 되었습니다. 그러나 지속적인 과제가 남아 있습니다. 이러한 시스템은 때때로 사실과 다른 답변을 매우 확신에 찬 어조로 내놓곤 하는데, 이를 '환각(hallucionation)' 현상이라고 합니다. 이러한 모델에 의존하여 중요한 결정을 내려야 하는 사용자들에게 위험한 점은 단순히 틀리는 것이 아니라, 절대적인 확신을 가지고 틀린다는 점입니다. 이를 해결하기 위해 연구자들은 모델의 불확실성을 측정하는 방법, 즉 시스템에 스스로의 출력물에 대해 얼마나 확신하는지를 묻는 방법을 오랫동안 모색해 왔습니다. 전통적인 방식은 기상 예보가 하루 전체에 대해 하나의 확률을 제공하는 것과 마찬가지로, 전체 응답에 대해 단일한 신뢰도 점수를 제공합니다. 하지만 하나의 답변에는 정확한 사실과 미세한 오류가 뒤섞여 있을 수 있으며, 이로 인해 단일한 종합 점수는 구체적인 세부 사항을 검증한 후 행동해야 하는 사람들에게 너무 투박하고 유용하지 못한 도구가 됩니다.

칭화대학교와 다른 기관의 아바스리 토그룰(Toghrul Abbasli) 및 동료들이 수행한 새로운 연구는 이 문제에 대해 더 세밀한 접근 방식을 제안합니다. 연구진은 응답을 하나의 덩어리로 취급하는 대신, 모든 답변을 그들이 '원자적 주장(atomic claims)'이라 부르는 가장 작고 독립적인 정보 단위로 분해하는 방법을 개발했습니다. 그런 다음 각 개별 주장에 대해 특정 신뢰도 점수를 할당합니다. 연구팀은 주요 개발사들의 시스템을 포함한 여러 현대적 언어 모델을 대상으로 이 기술을 테스트했으며, 일반적인 사실 지식에 초점을 맞춘 질문 세트와 모델이 거짓 전제를 수용하도록 유도하는 질문 세트라는 두 가지 뚜렷한 유형의 질문 세트를 사용했습니다. 이들의 연구 결과는 신뢰도를 주장 수준에서 격리하고 보정함으로써, 의사 결정자들에게 훨씬 더 신뢰할 수 있는 신호를 생성할 수 있음을 시사합니다. 이 접근 방식은 사용자가 높은 확률로 사실일 가능성이 높은 부분은 수용하면서, 특정 문장은 추가 검토나 거부를 위해 표시해 둘 수 있게 함으로써, 고위험 환경에서 더 안전하고 신뢰할 수 있는 인공지능을 향한 실질적인 경로를 제공합니다.

연구진 작업의 핵심은 언어 모델의 내부 작동 방식을 수정할 필요 없이 작동하는 다단계 파이프라인을 포함합니다. 먼저, 시스템은 사용자의 질문에 대한 답변을 생성합니다. 다음으로, 보조 도구가 이 답변을 "아인슈타인은 상대성 이론을 제안했다" 또는 "이것은 1905년에 발생했다"와 같이 짧고 자기 완결적인 진술로 분해합니다. 답변이 분해되면, 시스템은 각 진술을 개별적으로 평가합니다. 시스템은 모델이 각 주장에 대해 얼마나 확신해야 하는지를 결정하기 위해 두 가지 주요 신호를 사용합니다. 첫 번째 신호는 모델 자체의 자기 평가 또는 구두로 표현된 확신에서 오는데, 여기서 모델은 자신이 얼마나 확신하는지를 진술하도록 유도됩니다. 두 번째 신호는 일관성에 의존합니다. 시스템은 답변의 여러 변형을 생성하고 동일한 주장이 그중 모두에 나타나는지 확인합니다. 만약 어떤 주장이 여러 시도에서 반복된다면, 그 주장은 더 신뢰할 수 있는 것으로 간주됩니다. 이 두 가지 신호는 결합되어 각 특정 주장에 대한 최종 신뢰도 점수를 산출합니다.

이 점수들이 의미를 갖도록 하기 위해, 연구진은 '사후 보정(post-hoc calibration)'이라 불리는 통계적 과정을 적용했습니다. 이 단계는 원시 신뢰도 수치를 실제 상황과 일치하도록 조정합니다. 예를 들어, 시스템이 일련의 주장들에 대해 90퍼센트의 확신을 부여한다면, 보정 과정을 통해 약 90퍼센트의 주장이 실제로 정확하도록 보장합니다. 연구는 이 프레임워크를 오픈 소스 시스템부터 독점적인 상용 모델에 이르는 6가지 서로 다른 언어 모델을 대상으로 수천 개의 질문에 걸쳐 테스트했습니다. 결과에 따르면, 이 주장 수준의 접근 방식은 응답 전체만을 고려하는 방식에 비해 신뢰도 추정의 오류율을 유의미하게 감소시켰습니다. 사실 관계 질문에 있어 보정된 점수는 훨씬 더 정확해졌으며, 이는 시스템이 90퍼센트 확신한다고 말했을 때 실제로 90퍼센트의 확률로 정확했다는 것을 의미합니다. 이러한 정밀도는 인간 사용자가 구체적인 결정을 내릴 수 있게 해줍니다. 즉, 높은 신뢰도의 주장은 즉시 신뢰하고, 낮은 신뢰도의 주장은 검증을 위해 주의를 기울일 수 있습니다.

그러나 연구는 이 방법이 한계에 직면하는 명확한 경계를 식별했습니다. 질문이 거짓 전제(무언가 틀린 것을 사실이라고 가정하는 함정)를 포함하도록 설계되었을 때, 모델은 유창하고 확신에 차 있지만 완전히 틀린 주장을 생성하는 경우가 많았습니다. 이러한 적대적 시나리오에서, 주장 수준의 신뢰도 점수는 모델이 자신의 실수에 대해 내부적으로 일관성을 유지하고 있었기 때문에 오류를 감지하지 못하는 경우가 있었습니다. 연구진은 이 방법이 정답과 오답이 섞인 답변을 분류하는 데는 탁고하지만, 근본적인 사실에 대해 확신을 가지고 틀린 모델을 항상 극복할 수는 없다는 것을 발견했습니다. 이러한 경우, 연구는 신뢰도 점수만으로는 불충분하며, 증거 검색이나 다른 시스템에 의한 교차 검증과 같은 외부적인 확인이 필수적이라고 제안합니다.

이 연구의 실질적인 함의는 우리가 전문적인 환경에서 인공지능과 상호작용하는 방식의 변화입니다. 모호한 신뢰감에 기반해 전체 응답을 수용하거나 거부하는 대신, 의사 결정자들은 이제 상세한 신뢰도 지도를 신뢰할 수 있습니다. 예를 들어, AI가 생성한 의료 보고서의 경우, 일반적인 구조는 수용하되 특정 약물 용량이나 환자 이력 등의 세부 사항은 개별 신뢰도 점수에 따라 인간의 검토를 받도록 표시할 수 있습니다. 연구진은 이 기술이 내부 메커니즘이 숨겨진 '폐쇄형(closed-box)' 모델에서도 작동하며, 따라서 현재 사용 중인 가장 진보된 상업용 시스템에도 적용 가능하다는 점을 강조합니다. 이 방법이 특히 모델이 잘못된 가정에 속았을 때 발생하는 환각 문제를 완전히 해결하지는 못하지만, 불확실성을 관리하는 데 있어 강력한 도구를 제공합니다. 언어 모델의 출력이라는 블랙박스를 검증 가능한 조각들로 분해함으로써, 이 연구는 무엇을 신뢰할 수 있고 무엇에 추가 조사가 필요한지에 대한 명확한 이해를 바탕으로 고위험 결정을 내릴 수 있는 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →