← 최신 논문
💬 NLP

Likelihood-Based Reward Designs for General LLM Reasoning

이 논문은 정답의 로그 확률을 보상 신호로 사용하는 것이 검증 가능한 환경에서는 이진 보상을 능가하고, 비검증 환경에서는 지도 미세 조정과 대등한 성능을 보이면서도 확률 기반 대안들의 함정을 피할 수 있다는 점에서, 거대 언어 모델의 사고 사슬 추론 미세 조정을 위한 더 우수하고 다재다능한 방법임을 체계적으로 입증한다.

원저자: Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier

게시일 2026-02-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하지만 경험이 부족한 학생(대규모 언어 모델)에게 복잡한 문제를 해결하는 법을 가르치고 있다고 상상해 보세요. 이 학생은 말하는 능력은 뛰어나지만, 답을 내놓기 전에 "생각을 밖으로 내뱉는 법"(Chain-of-Thought)을 배워야 합니다.

이 논문은 특정 문제를 다룹니다: 정답지가 없을 때 이 학생을 어떻게 채점할 것인가?

기존 방식: "합격/불합격" 퀴즈

전통적으로 이러한 모델을 가르칠 때, 연구자들은 엄격한 수학 선생님과 유사한 방법을 사용합니다.

  1. 학생이 생각을 밖으로 내뱉습니다.
  2. 학생이 답을 제시합니다.
  3. 선생님이 정답지와 대조하여 확인합니다.
    • 정답이면? 금메달을 받습니다 (보상 = 1).
    • 오답이면? 빨간색 X를 받습니다 (보상 = 0).

문제점: 이 방식은 정답이 하나뿐인 수학이나 코딩에는 아주 잘 작동합니다. 하지만 학생에게 긴 이야기, 시, 또는 복잡한 증명을 쓰라고 요청한다면 어떨까요? 거기에는 단 하나의 정답이 존재하지 않습니다. 따라서 단순한 "합격/불합격" 식의 성적을 매길 수 없습니다. 또한, 만약 학생이 99%의 확률로 틀린다면, 학생은 금메달을 한 번도 받지 못하게 되고, 신호가 너무 희소하기 때문에 학습을 멈추게 됩니다.

새로운 아이디어: "가능성(Likelihood)" 점수

저자들은 다른 방식으로 채점하는 방법을 제안합니다. 정답이 맞았는지 확인하는 대신, 학생이 자신의 답에 대해 얼마나 확신하고 있는지를 확인합니다.

이렇게 생각해보세요:

  • 기존 방식: "정답을 맞혔니? 예/아니오."
  • 새로운 방식: "네가 정확히 그 단어들을 말할 가능성이 얼마나 높았니?"

만약 학생이 학습 데이터에 있는 참조 답변과 정확히 똑같은 단어들을 말한다면, 선생님은 로그 확률(log-probability)(수학적으로 "이 일이 일어난 것에 대해 얼마나 놀랐는가?"를 의미함)을 기반으로 점수를 부여합니다.

  • 만약 학생이 매우 확신을 가지고 정답을 말했다면, 높은 점수를 받습니다.
  • 만약 학생이 추측을 했다면, 낮은 점수를 받습니다.

큰 발견: "로그 확률"은 마법의 열쇠

연구진은 이 "확신" 점수를 사용하는 여러 가지 방법을 테스트했습니다. 그 결과, 한 가지 특정 방법—참조 답변의 로그 확률을 사용하는 것—만이 모든 곳에서 작동한다는 것을 발견했습니다.

다음은 쉬운 비유를 사용한 결과의 요약입니다:

1. "단답형" 테스트 (수학 및 코딩)

  • 설정: 명확한 정답이 있는 짧은 문제들 (수학 퀴즈와 같은).
  • 결과: "로그 확률" 방식은 정답을 맞히는 데 있어 기존의 "합격/불합격" 방식만큼 효과적이었습니다.
  • 보너스: 또한 이 방식은 학생의 답변을 훨씬 더 "자연스럽고" 덜 불안정하게 만들었습니다. 기존 방식은 학생이 금메달을 따기 위해 무모하게 추측하게 만들었지만, 새로운 방식은 학생이 틀렸을 때조차 더 자신감 있고 매끄럽게 말하도록 만들었습니다.

2. "긴 에세이" 테스트 (이야기 및 증명)

  • 설정: 단 하나의 정답이 없는 길고 개방적인 과제들.
  • 다른 방식들의 문제점: 어떤 방식들은 단순한 "확률"(정답일 생생한 확률)을 사용하려고 했습니다. 하지만 긴 에세이의 경우, 정답과 똑같은 단어를 맞힐 확률은 극히 낮습니다 (마치 로또에 당첨되는 것과 같습니다). 점수가 너무 작아져서 사실상 0이 되었고, 학생은 학습을 멈췄습니다.
  • 승자: "로그 확률" 방식은 이 문제를 완벽하게 해결했습니다. 이 방식은 무너지지 않았습니다. 마치 선생님이 학생에게 정답을 보여주며 "이것을 암기하라"고 말한 것과 똑같이 잘 수행했습니다.

3. "짧게 생각하기"의 놀라운 결과

가장 흥-미로운 발견 중 하나는 학생이 얼마나 오래 생각했는지에 관한 것이었습니다.

  • 새로운 "로그 확률" 보상을 사용할 때, 학생은 처음에 생각을 적게 하기 시작했습니다. 즉, "사고 과정(Chain of Thought)"을 단 몇 단어로 줄였습니다.
  • 이유는? 모델은 처음 몇 단계에서는 길고 복잡한 사고 과정보다 짧고 단순한 사고 과정이 실제로 더 높은 점수로 이어진다는 것을 깨달았습니다.
  • 수학의 경우: 학생은 실력이 좋아짐에 따라 결국 다시 길게 생각하는 법을 배웠습니다.
  • 에세이의 경우: 학생은 짧게 유지했습니다. 그들은 기본적으로 "생각을 밖으로 내뱉는 것"을 멈추고, 그냥 답을 직접 제시하는 일반적인 암기 모델처럼 행동했습니다. 이는 긴 개방형 과제의 경우, 모델이 글자로 쓰는 대신 자신의 뇌(숨겨진 층/hidden layers) 내부에서 "생각"을 하고 있을 수도 있다는 점을 시사합니다. 즉, 길게 생각하라고 강요하는 것이 오히려 성능을 저하시킬 수 있습니다.

핵심 요약

이 논문은 로그 확률을 보상으로 사용하는 것이 AI 학습을 위한 "범용 번역기"라고 결론짓습니다.

  • 이는 검증 가능한 과제(수학)와 검증 불가능한 과제(글쓰기) 사이의 간극을 메워줍니다.
  • 별도의 "검증기"나 정답지를 필요로 하지 않습니다.
  • AI가 짧은 수학 문제부터 긴 증명에 이르기까지, 참조 답변이 존재하는 모든 데이터셋으로부터 학습할 수 있게 해줍니다.

요약하자면, AI에게 "맞았니?"라고 묻는 대신 "네가 이것을 말할 때 얼마나 확신했니?"라고 묻는 것이, 수학 퍼즐부터 긴 에세이까지 모든 것을 아우르는 더 단순하고 강력한 AI 학습 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →