← 최신 논문
💬 NLP

Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty

본 논문은 언어 모델의 정확성과 보정된 신뢰도를 동시에 향상시키고 표준 강화 학습으로 인해 흔히 발생하는 환각 및 보정 저하를 완화하기 위해 이진 정답 보상에 브라이어 점수를 추가한 새로운 학습 방법인 RLCR(보정 보상을 활용한 강화 학습) 을 소개한다.

원저자: Mehul Damani, Isha Puri, Stewart Slocum, Idan Shenfeld, Leshem Choshen, Yoon Kim, Jacob Andreas

게시일 2026-05-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mehul Damani, Isha Puri, Stewart Slocum, Idan Shenfeld, Leshem Choshen, Yoon Kim, Jacob Andreas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 학생이 어려운 시험을 치르도록 훈련한다고 상상해 보세요. 목표는 단순히 정답을 맞추는 것이 아니라, 언제 추측하고 있는지언제 확신하는지를 아는 것입니다.

"이진 보상 (Binary Rewards) 을 넘어서"라는 제목의 이 논문은 이러한 AI "학생들"(언어 모델) 을 더 똑똑하고 동시에 자신감에 대해 더 정직하게 만드는 새로운 훈련 방법을 소개합니다.

문제: "추측 게임"의 함정

현재 우리는 AI 가 수학이나 상식 퀴즈와 같은 어려운 문제를 추론하도록 훈련할 때 **이진 보상 (Binary Rewards)**이라는 간단한 채점 시스템을 사용합니다.

  • 규칙: 정답이면 점수를 받고, 오답이면 0 점입니다.
  • 결함: 이 시스템은 AI 가 어떻게 정답에 도달했는지 신경 쓰지 않습니다. AI 가 깊은 논리로 문제를 해결했든, 아니면 막연히 추측하다가 운 좋게 맞혔든 같은 점수를 줍니다.
  • 결과: AI 는 "자신감 있는 도박꾼"이 됩니다. 무엇을 말하고 있는지 전혀 모르더라도 100% 확신으로 답을 추측하기 시작합니다. 현실 세계에서는 이것이 위험합니다. AI 가 "환각 (hallucinate)" 현상 (사실을 왜곡하거나 지어내는 것) 을 일으키면서도 거짓말을 매우 확신하는 것처럼 말하기 때문입니다.

해결책: RLCR ("정직 코치")

저자들은 RLCR(Calibration Rewards 를 활용한 강화 학습)이라는 새로운 훈련 방법을 제안합니다. 이는 학생을 두 가지 기준으로 동시에 채점하는 코치를 고용하는 것과 같습니다.

  1. 정답을 맞혔나요? (정확도)
  2. 자신감 수준이 정확했나요? (보정)

작동 원리:
단순히 "맞음" 또는 "틀림"이라고 말하는 대신, AI 는 이제 *"이것이 제 답이며, 0 에서 1 사이의 숫자로 얼마나 확신하는지 나타낸 것입니다"*라고 말해야 합니다.

코치는 **브리어 점수 (Brier Score)**라는 특별한 채점 규칙을 사용하여 자신감을 평가합니다.

  • AI 가 "90% 확신합니다"라고 말하고 정답이면 훌륭한 점수를 받습니다.
  • AI 가 "90% 확신합니다"라고 말하고 오답이면 끔찍한 패널티를 받습니다.
  • AI 가 "50% 확신합니다"(불확실) 고 말하고 오답이면 더 작은 패널티를 받습니다.

이것은 AI 에게 중요한 교훈을 가르칩니다: 확신 있게 틀리는 것보다 불확실하게 틀리는 것이 낫습니다.

비유: 기상 예보관

두 명의 기상 예보관을 상상해 보세요.

  • 예보관 A(구식 방법): 항상 "내일은 비가 확실히 올 것입니다!"라고 말합니다. 비가 오면 천재이고, 맑으면 틀린 것뿐이지만, 추측했다는 사실을 결코 인정하지 않습니다. 그들은 "과신"합니다.
  • 예보관 B(RLCR 방식): "비가 올 확률은 60% 입니다"라고 말합니다. 비가 오면 맞은 것입니다. 맑으면 "글쎄요, 60% 라고 했으니 틀렸지만, 비 올 가능성은 있었다는 걸 알았습니다"라고 인정합니다.

이 논문은 예보관 B(RLCR 모델)가 훨씬 더 신뢰할 수 있음을 보여줍니다. 그들은 단순히 정답을 더 자주 맞추는 것을 넘어, 언제 추측하고 있는지 정확히 알려주므로 언제 신뢰하고 언제 다시 확인해야 하는지 알 수 있게 합니다.

실험 결과

연구진들은 "1969 년 유로비전 대회의 우승자는 누구인가?"와 같은 사실 관련 어려운 질문과 수학 문제를 대상으로 이를 테스트했습니다.

  1. 더 나은 정직성: RLCR 모델은 막연히 추측하는 것을 멈췄습니다. 불확실할 때 자신감 점수를 낮췄습니다.
  2. 여전히 똑똑함: 중요한 점은 AI 를 "정직하게" 만드는 것이 "바보"로 만들지 않았다는 것입니다. 알고 있던 질문에 대해서는 높은 정확도를 유지했습니다.
  3. 일반화: AI 가 이전에 본 적 없는 질문 (도메인 외) 을 마주했을 때도, 이전의 "자신감 있는 추측꾼" 모델에 비해 불확실성에 대해 훨씬 더 정직하게 반응했습니다.
  4. 테스트 시간 향상: AI 의 자신감 점수가 이제 신뢰할 수 있게 되므로, 연구진들은 이를 사용하여 최종 답을 개선할 수 있었습니다. 예를 들어, AI 가 10 가지 다른 답을 생성했을 때, 가장 높은 자신감 점수를 가진 답을 선택하면 정답일 가능성이 더 높았습니다.

결론

이 논문은 AI 에게 "자신의 사고에 대해 생각"하도록 가르치고 불확실성에 대해 정직할 때 보상을 주면, 정확할 뿐만 아니라 신뢰할 수 있는 추론 시스템을 구축할 수 있음을 증명합니다. 그들은 모든 것을 안다는 척하는 것을 멈추고 언제 추측하고 있는지 알려주기 시작합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →