← 최신 논문
💬 NLP

Aligning Language Models with Selective Prediction

이 논문은 위험-커버리지 곡선 하부 면적(AURC)을 직접적으로 목표로 함으로써 위험-커버리지 트레이드오프를 크게 개선하고 고위험 결정 시나리오에서의 신뢰성을 높이는, 선택적 예측을 위한 새로운 사후 학습 정렬 프레임워크인 선택 보상을 위한 강화 학습(RLSR)을 제안한다.

원저자: Gaoxiang Luo, Yifan Wu, Sinian Zhang, Aryan Deshwal, Ju Sun

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gaoxiang Luo, Yifan Wu, Sinian Zhang, Aryan Deshwal, Ju Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 문제: 과도하게 자신만만한 AI

당신이 환자를 진단하거나 주식을 분석하는 것과 같은 중요한 결정을 내릴 때 도움을 줄 아주 똑똑하지만 과하게 자신만만한 비서를 고용했다고 상상해 보세요. 이 비서(AI)는 질문에 답하는 능력은 뛰어나지만, 한 가지 나쁜 습관이 있습니다. 바로 자신이 모른다는 사실을 절대 인정하지 않는다는 점입니다. 심지어 추측을 하고 있을 때조차, 100% 확신에 찬 어조로 말합니다.

법률이나 의료와 같이 위험 부담이 큰 상황에서, 확신에 찬 실수는 매우 위험합니다. 당신은 비서가 틀린 답을 자신 있게 내놓는 것보다, "잘 모르겠습니다. 전문가의 확인이 필요합니다"라고 말해주기를 더 원할 것입니다. 이것이 이 논문이 다루는 핵심 문제입니다. 우리는 어떻게 AI에게 언제 침묵해야 하는지를 가르칠 수 있을까요?

해결책: "선택적 예측 (Selective Prediction)"

이 논문은 선택적 예측이라는 전략을 제안합니다. 이것을 AI에게 "선택적 필터"가 되는 법을 가르치는 것이라고 생각하면 됩니다.

모든 질문에 답하는 대신, AI는 다음과 같이 훈련됩니다:

  1. 자신이 매우 확신하는 질문에 대해서만 답변한다.
  2. 확신이 없는 질문에 대해서는 기권한다 (모른다고 말한다).

위험한 추측들을 걸러냄으로써, AI가 실제로 답변하는 질문들에 대한 전반적인 정확도는 크게 높아집니다.

기존 방법들이 효과가 없었던 이유

저자들은 이를 해결하려는 이전의 시도들이 **교정(Calibration)**에 의존했음을 설명합니다.

  • 교정의 비유: 기상 예보관이 "비가 올 확률이 70%입니다"라고 말한다고 가정해 봅시다. 만약 그가 그렇게 말했을 때 10번 중 7번 실제로 비가 온다면, 그는 "교정된(calibrated)" 상태입니다.
  • 결함: 이 논문은 단순히 "교정"되는 것만으로는 충분하지 않다고 주장합니다. 교정은 완벽하지만, '애매한' 답변을 '확실한' 답변보다 더 높은 순위에 두는 예보관이 존재할 수 있기 때문입니다.
  • 논문의 통찰: 당신에게 정말 필요한 것은 단순히 확률에 대해 정직한 예보관이 아니라, 답변들을 "정답일 가능성이 가장 높은 것"부터 "오답일 가능성이 가장 높은 것"까지 완벽하게 분류할 수 있는 심판입니다. 이 논문은 이를 선택적 예측이라 부르며, 이는 단순히 "교정"되는 것과는 다른 목표입니다.

새로운 방법: RLSR (선택 보상을 위한 강화 학습)

저자들은 RLSR이라는 새로운 훈련 방법을 만들었습니다. 이 방법이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

"마법의 분류 모자" 비유:
AI가 시험을 치르는 학생이라고 상상해 보세요.

  • 기존 방법 (RLVR): 선생님은 오직 정답을 맞혔을 때만 점수를 줍니다. 학생이 정답을 맞히면 점수를 얻고, 틀리면 아무것도 얻지 못합니다. 이 방식에서 학생은 추측을 하더라도 일단 모든 문제에 답을 하려고 배웁니다.
  • 새로운 방법 (RLSR): 선생님이 규칙을 바꿉니다. 선생님은 단순히 답이 맞았는지 틀렸는지만 신경 쓰는 것이 아니라, **순위(Ranking)**를 신경 씁니다.
    • 선생님은 학생의 모든 답변을 살펴보고 이렇게 말합니다: "나는 네가 가장 확신하는 답변들이 정답이 되길 바라고, 네가 가장 확신이 없는 답변들이 오답이 되길 바란다."
    • 만약 학생이 어려운 문제를 맞혔지만 스스로 "50%만 확신한다"라고 말했다면, 작은 보상을 받습니다.
    • 만약 학생이 쉬운 문제를 틀렸는데 "99% 확신한다"라고 말했다면, 엄청난 벌칙을 받습니다.
    • 만약 학생이 어려운 문제를 맞히면서 동시에 "99% 확신한다"라고 했다면, 막대한 보상을 받습니다.

RLSR이라 불리는 이 방법은 AURC라는 지표를 기반으로 한 특별한 점수 체계를 사용하여, AI가 자신의 "확신하는" 답변과 "확신하지 못하는" 답변 사이에 명확한 격차를 만들도록 보상합니다.

결과: 더 나은 필터

저자들은 이 새로운 방법을 다양한 어려운 과제(복잡한 수학 문제나 까다로운 상식 퀴즈 등)에 테스트하고 기존 방법들과 비교했습니다.

  • 결과: RLSR로 훈련된 AI는 언제 말하고 언제 침묵해야 하는지를 훨씬 더 잘 알게 되었습니다.
  • 증거: 연구진이 "90% 이상 확신할 때만 답하라"는 규칙을 설정했을 때, RLSR로 훈련된 AI는 다른 모델들보다 훨씬 더 높은 정확도를 보였습니다. 이 AI는 다른 모델들이 계속 저지르던 "확신에 찬 실수"들을 성공적으로 걸러냈습니다.
  • 실제 적용 테스트: 그들은 심지 even 의료 데이터셋(MedQA)에서도 테스트를 진행했습니다. 높은 수준의 정확도를 보장할 수 있는 질문에만 답하도록 강제했을 때, RLSR 모델만이 일관되게 높은 안전 표준을 충족할 수 있었습니다.

요약

요약하자면, 이 논문은 AI 모델이 "확신에 찬 추측꾼"이 되지 않도록 가르칩니다. 모든 것에 대해 정답을 맞히려 노력하는 대신, AI는 스마트한 문지기가 되는 법을 배웁니다. AI는 "이것은 알고 있다"와 "저것은 모른다"라고 말하는 법을 배우며, 이를 통해 입을 열었을 때 그 내용이 매우 정확할 수 있도록 보장합니다. 이는 AI를 훨씬 더 안전하고 신뢰할 수 있게 만들어, 중요한 실무 현장에서 AI를 더욱 유용하게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →