Adaptive Conformal Prediction for Improving Factuality of Generations by Large Language Models
이 논문은 입력에 따라 적응적으로 조정되는 '적응형 합동 예측 (Adaptive Conformal Prediction)' 기법을 제안하여 대규모 언어 모델의 생성물 사실성을 향상시키고, 기존 방법보다 조건부 커버리지를 개선하며 신뢰할 수 없는 내용을 선별적으로 필터링할 수 있음을 보여줍니다.
우리가 AI 에게 질문하면, AI 는 아주 유창하게 대답합니다. 하지만 가끔은 **사실과 다른 엉뚱한 이야기 (할루시네이션)**를 지어내기도 하죠. 예를 들어, "프랑스의 수도는 파리가 아니라 런던이다"라고 말하면 안 되는데, AI 는 그럴 수도 있습니다.
지금까지의 기존 방법들은 **"모든 질문에 대해 같은 기준"**으로 AI 의 답변을 검사했습니다.
기존 방식 (단일 기준): "이 AI 가 90% 확률로 맞다면 믿어라"라고 정해두면, 쉬운 질문에는 너무 엄격하게 (정답인데도 의심해서) 거절하고, 어려운 질문에는 너무 느슨하게 (틀린 걸도 믿게) 허용하는 문제가 생깁니다. 마치 모든 크기의 사람한테 같은 사이즈의 옷을 입히는 것과 같습니다.
💡 이 논문의 해결책: "상황에 맞춰 옷을 재단하는 맞춤형 Conformal 예측"
이 논문은 **"질문의 난이도나 종류에 따라 AI 의 답변 신뢰도 기준을 자동으로 조절하는 방법"**을 제안합니다. 이를 **'적응형 (Adaptive) 컨포멀 예측'**이라고 부릅니다.
1. 상황별 맞춤 필터 (Adaptive Conformal Prediction)
비유: AI 가 답변할 때, **쉬운 질문 (예: "사과는 빨간색이다")**에는 "약간 의심스러워도 믿어주자"라고 기준을 낮추고, **어려운 질문 (예: "17 세기 프랑스의 복잡한 정치 상황을 설명해줘")**에는 "완벽하게 증명되지 않으면 절대 믿지 말자"라고 기준을 높이는 것입니다.
핵심: 질문의 내용 (임베딩) 을 분석해서, 그 질문이 얼마나 까다로운지 파악한 뒤, AI 가 그 질문에 답할 때 "얼마나 확신해야 믿을 수 있는지" 그 기준선 (Threshold) 을 실시간으로 조정합니다.
2. 두 가지 주요 성과
이 방법은 두 가지 큰 장점이 있습니다.
① "거짓말"을 더 정확히 걸러냅니다 (조건부 커버리지 향상):
기존 방법은 전체 평균은 맞았지만, 특정 주제 (예: 의학, 역사) 에서는 틀린 답변을 많이 허용하거나, 반대로 맞는 답변까지 버리는 문제가 있었습니다.
이 새로운 방법은 주제별로 정확도를 맞춰줍니다. 의학 질문에는 더 엄격하게, 일상적인 질문에는 덜 엄격하게 적용해서, 전체적으로 더 신뢰할 수 있는 답변만 남깁니다.
② "불확실한 부분"은 과감히 잘라냅니다 (선택적 예측):
AI 가 "이 부분은 확실하지 않아요"라고 스스로 판단하거나, 기준에 미치지 못하는 엉뚱한 문장은 아예 답변에서 잘라냅니다.
마치 뉴스 편집자가 "이 기사는 사실 확인이 안 됐으니 싣지 않겠다"라고 결정하는 것처럼, AI 가 생성한 긴 글에서도 사실 확인이 안 된 문장만 골라내서 제거해 줍니다.
📊 실험 결과: "왜 이 방법이 더 좋은가?"
논문의 실험 결과 (그림 1, 2) 를 보면:
기존 방법: 전체적인 평균은 맞았지만, 특정 카테고리 (예: '발명품' vs '인물') 에 따라 오차가 컸습니다. (어떤 건 너무 많이 걸러내고, 어떤 건 너무 적게 걸러냄)
이 논문의 방법:모든 카테고리에서 일관되게 목표한 신뢰도 (예: 80% 신뢰) 를 달성했습니다. 즉, 어떤 질문을 던지든 AI 의 답변이 얼마나 믿을 만한지 예측이 훨씬 정확해졌습니다.
🚀 요약: 이 기술이 왜 중요한가요?
이 기술은 AI 를 의료, 법률, 금융처럼 실수가 치명적인 분야에서 쓸 때 필수적입니다.
한 줄 요약: "이 방법은 AI 가 어떤 질문을 받느냐에 따라 '얼마나 믿을 만한지'를 똑똑하게 판단하게 만들어, 거짓말은 걸러내고 진짜 사실만 골라내게 해줍니다."
마치 **AI 의 답변을 검사하는 '맞춤형 보안 검색대'**가 생긴 것과 같습니다. 여행객 (질문) 의 위험도에 따라 검색 강도를 조절하듯, AI 의 답변 신뢰도를 상황에 맞게 조절하여 더 안전하고 정확한 AI 사용을 가능하게 합니다.
1. 문제 정의 (Problem Definition)
대형 언어 모델 (LLM) 은 다양한 분야에서 뛰어난 성능을 보이지만, 할루시네이션 (Hallucination) 이라고 불리는 사실과 다른 내용을 생성하는 경향이 있습니다. 특히 의료와 같은 고위험 분야에서는 이러한 오류가 심각한 결과를 초래할 수 있습니다.
기존 접근법의 한계: 최근 연구에서는 LLM 의 생성물에 대한 불확실성 추정과 사실성 보장을 위해 합의 예측 (Conformal Prediction, CP) 을 적용했습니다. 그러나 기존 CP 방법은 모든 입력 (프롬프트) 에 대해 단일한 전역 임계값 (Global Threshold) 을 적용합니다.
핵심 문제: 입력의 난이도, 모호성, 희귀성에 따라 모델의 불확실성 분포가 달라지는데, 이를 고려하지 않은 전역 임계값은 특정 입력에 대해 과도한 보전 (Over-coverage, 너무 많은 항목을 포함) 이나 부족한 보전 (Under-coverage, 너무 많은 항목을 제외) 을 초래합니다. 이는 조건부 커버리지 (Conditional Coverage) 가 낮아져 특정 도메인이나 프롬프트 유형에서 신뢰할 수 없는 결과를 낳습니다.
2. 방법론 (Methodology)
저자들은 입력에 적응하는 적응형 합의 예측 (Adaptive Conformal Prediction) 프레임워크를 제안합니다. 이 방법은 비동일성 점수 (Nonconformity Score) 를 입력의 특성에 따라 변환하여 조건부 커버리지를 개선하면서도 마진 커버리지 (Marginal Coverage) 보장은 유지합니다.
주요 구성 요소:
비동일성 점수 정의 (Nonconformity Score Definition):
장문 QA (Long-form QA): 생성된 텍스트를 검증 가능한 원자적 주장 (Atomic Claims) 으로 분해합니다. 각 주장에 대한 불확실성 점수 s(c) 와 기준 정답 y 에 대한 사실성 함수 w(c,y) 를 정의합니다. 비동일성 점수 V(x,y) 는 모든 유지된 주장이 사실일 때의 최대 불확실성 임계값으로 정의됩니다.
다중 선택형 QA (Multi-choice QA): 가장 모호하지 않은 분류기 (Least Ambiguous Classifier, LAC) 를 사용하여 정답 클래스의 확률 기반 점수를 비동일성 점수로 사용합니다.
조건부 분위수 회귀 (Conditional Quantile Regression):
프롬프트의 임베딩 (Embedding) 을 입력으로 받아 해당 입력에 대한 비동일성 점수의 조건부 분위수 τ^(x) 를 학습합니다.
이를 위해 데이터셋을 세 부분 (Dcal1,Dcal2,Dtest) 으로 나누어 사용합니다.
Dcal1: 조건부 분위수 추정기 τ^(x) 학습.
Dcal2: 변환된 점수 V~(x,y)=V(x,y)/τ^(x) 를 계산하고, 이를 기반으로 새로운 합의 임계값을 보정 (Calibrate).
Dtest: 보정된 임계값을 사용하여 최종 예측 집합 생성.
점수 변환 및 필터링:
학습된 τ^(x) 로 비동일성 점수를 정규화 (나눗셈) 합니다. 이는 입력 간 점수 분포의 변동을 줄이고, 서로 다른 난이도의 프롬프트에 대해 일관된 조건부 분위수를 갖도록 합니다.
최종적으로 변환된 점수가 보정된 임계값보다 낮으면 해당 주장이나 답변을 유지합니다.
3. 주요 기여 (Key Contributions)
새로운 적응형 합의 예측 프레임워크 제안: LLM 의 환각 감지를 위해 임베딩 기반 조건부 분위수 회귀를 통해 프롬프트 적응형 보정 (Prompt-adaptive correction) 을 학습하는 방법을 제시했습니다.
이론적 보장 유지 및 조건부 커버리지 개선: 분할 합의 예측 (Split Conformal Prediction) 의 유한 표본 마진 커버리지 보장을 유지하면서, 이질적인 프롬프트에 대한 조건부 커버리지를 크게 향상시켰습니다.
광범위한 실험 검증: 다양한 도메인 (장문 QA, 다중 선택형 QA) 과 여러 LLM (Mistral, Llama, Gemma) 에서 기존 베이스라인보다 뛰어난 성능을 입증했습니다. 특히 선택적 예측 (Selective Prediction) 을 통해 신뢰할 수 없는 주장을 필터링하는 능력을 강화했습니다.
4. 실험 결과 (Experimental Results)
데이터셋 및 모델:
장문 QA: 8 가지 카테고리 (인물, 발명품, 예술작품 등) 의 300 개 샘플씩 생성. Mistral-7B, Llama-3.1-8B, Gemma-3-12B 사용.
다중 선택형 QA: MMLU 데이터셋의 16 개 카테고리 사용.
점수 함수: Claim Conditioned Probability (CCP) 가 가장 우수한 성능을 보임.
성능 비교:
조건부 커버리지 (Conditional Coverage): 기존 전역 임계값 방법은 카테고리별 편차가 컸습니다 (예: '발명품'은 과보전, '인물'은 과소보전). 반면, 제안된 적응형 방법은 모든 카테고리에서 목표 커버리지에 근접하는 일관된 성능을 보였습니다 (그림 1, 2 참조).
제거된 항목 비율: 적응형 방법은 불필요하게 많은 항목을 제거하는 것을 줄이면서 커버리지를 유지했습니다 (예: Mistral 7B 에서 Landmarks, Inventions 카테고리에서 제거율 감소).
Dolan-Moré 프로파일: 다양한 α 값과 시드에서 적응형 방법이 기존 방법보다 더 낮은 보정 오차 (Calibration Error) 를 보이며, 더 많은 문제에서 최상의 성능에 근접했습니다 (그림 3).
5. 의의 및 결론 (Significance & Conclusion)
이 논문은 LLM 의 사실성을 보장하는 데 있어 입력 의존적 (Input-dependent) 인 불확실성 보정의 중요성을 강조합니다.
실용적 가치: 의료, 법률 등 고위험 분야에서 LLM 을 사용할 때, 특정 유형의 질문이나 복잡한 프롬프트에 대해 모델이 얼마나 신뢰할 수 있는지를 더 정확하게 판단할 수 있게 합니다.
이론적 확장: 기존 합의 예측 이론을 LLM 의 복잡한 생성 작업 (장문 생성, 다중 선택형 QA) 에 성공적으로 확장하고, 조건부 유효성을 달성하기 위한 구체적인 알고리즘을 제시했습니다.
미래 방향: 더 넓은 생성 작업으로의 확장, 입력 표현 (Input Representation) 의 개선, 그리고 이론적 보장의 강화가 향후 과제로 제시되었습니다.
요약하자면, 이 연구는 LLM 이 생성한 내용이 사실적인지 판단할 때 "모든 질문에 동일한 기준을 적용하는 것"이 아니라 "질문의 특성에 맞춰 기준을 동적으로 조정하는 것" 이 더 정확하고 신뢰할 수 있음을 입증한 중요한 작업입니다.