← 최신 논문
🤖 AI

Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization

이 논문은 정책 자체의 확률로부터 유도된 내재적 신호를 통해 이진 보상을 밀집시킴으로써 제로 어드밴티지 붕괴(Zero-Advantage Collapse)와 환각적 확실성(Hallucinated Certainty)을 제거하고, 이를 통해 도전적인 수학적 벤치마크 전반에서 대규모 언어 모델의 장쇄 추론 성능을 크게 향상시키는 새로운 정책 최적화 방법인 ISPO를 소개한다.

원저자: Hao Chen, Zhanming Shen, Liyao Li, Yanyu Chen, Xuhang Zhu, Xiaomeng Hu, Qi Zhang, Ru Peng, Xiaoyu Shen, Haobo Wang, Junbo Zhao

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hao Chen, Zhanming Shen, Liyao Li, Yanyu Chen, Xuhang Zhu, Xiaomeng Hu, Qi Zhang, Ru Peng, Xiaoyu Shen, Haobo Wang, Junbo Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 고집 센 학생(AI)에게 복잡한 수학 문제를 푸는 법을 가르치고 있다고 상상해 보세요. 이 학생은 최종 답을 내놓기 전에 긴 단계별 "사고 과정(thinking process)"을 적습니다.

현재의 표준 방식(GRPO라고 불림)에서는 선생님이 맨 마지막에만 피드백을 줍니다: "정답!" 또는 "오답."

이 논문은 이러한 "전부 아니면 전무(all-or-nothing)" 식의 피드백이 두 가지 주요 문제를 일으킨다고 주장합니다.

  1. "집단 침묵" 문제 (Zero-Advantage Collapse):
    당신이 학생에게 8개의 유사한 문제를 풀게 했다고 가정해 봅시다.

    • 만약 8개 모두 정답이라면, 선생님은 모두에게 "잘했어!"라고 말합니다. 하지만 모두가 같은 점수를 받았기 때문에, 선생님은 어떤 구체적인 사고 단계가 더 나았는지 구분할 수 없습니다. 비교할 차이가 없기 때문에 학생은 새로운 것을 배우지 못합니다.
    • 만약 8개 모두 오답이라면, 선생님은 모두에게 "다시 해봐"라고 말합니다. 역시 마찬가지로, 누구도 왜 실패했는지, 혹은 어느 특정 단계에서 잘못되었는지 알 수 없습니다. 학생은 추측의 굴레에 갇히게 됩니다.
    • 논문의 해결책: 논문은 단순히 최종 성적을 보는 대신, 최종 성적이 모두 같더라도 그 안의 미묘한 차이를 찾아내기 위해 "사고 과정 자체"를 들여다볼 것을 제안합니다.
  2. "자신만만한 오답" 문제 (Hallucinated Certainty):
    학생은 연습을 거듭하면서 실수를 하면서도 점점 더 확신에 차게 될 수 있습니다. 예를 들어, "나는 2+2=5라는 사실을 100% 확신한다"라고 완벽한 자신감으로 말할 수 있습니다.

    • 기존 시스템에서 선생님은 마지막에 "오답"이라는 결과만 봅니다. 선생님은 학생이 과정 중 너무 일찍 과도한 확신을 가졌다는 사실을 알지 못합니다. 학생은 다른 가능성을 탐색하는 것을 멈추고, 자신의 확신 섞인 실수를 반복하게 됩니다.
    • 논문의 해결책: 선생님은 특정 결정적인 단계에서 학생이 "너무 확신에 찬 상태"가 되는 것에 대해 벌칙을 주어야 하며, 이를 통해 학생이 막혔을 때 다른 가능성을 열어두도록 유도해야 합니다 줄입니다.

해결책: ISPO (Intrinsic Signal Policy Optimization)

저자들은 ISPO라고 불리는 새로운 방법을 제안합니다. 이것을 학생의 추론에 "모멘텀(가속도) 부스트"를 주는 것이라고 생각하세요. 최종 시험 성적을 기다리는 대신, 선생님은 학생 자신의 뇌(AI의 확률)에서 유도된 두 가지 내부 "신호"를 사용하여 지속적이고 밀도 높은 피드백을 제공합니다.

여기에는 두 가지 "계측기"가 사용됩니다.

1. "사고-답안 연결" (Sequence-Level Signal)

  • 비유: 학생이 이야기(사고 흔적)를 쓰고 나서 결론(답안)을 내린다고 상상해 보세요.
  • 작동 방식: 선생님은 확인합니다: "만약 내가 이야기를 제거한다면, 결론이 여전히 말이 되는가?"
    • 만약 이야기가 답안에 큰 영향을 준다면(높은 연결성), 이는 학생이 실제로 문제를 깊이 생각했다는 뜻입니다.
    • 만약 이야기가 답안을 전혀 바꾸지 못한다면, 이는 학생이 그냥 답을 먼저 찍어놓고 나중에 그 답에 맞춰 이야기를 지어냈다는 뜻입니다.
  • 이점: 설령 그룹 전체가 똑같이 "오답"을 받았더라도, 선생님은 학생 A의 이야기는 답안에 매우 도움이 되었던 반면, 학생 B의 이야기는 엉터리였다는 것을 알 수 있습니다. 이는 "집단 침묵"을 깨뜨리고 모두에게 계속 학습할 이유를 제공합니다.

2. "확신도 체크" (Token-Level Signal)

  • 비유: 학생이 외줄 타기를 하고 있다고 상상해 보세요. 특정 결정적인 순간(토큰)마다 학생은 어려운 선택을 해야 합니다.
  • 작동 방식:
    • 답이 맞을 경우: 선생님은 결정적인 단계에서 학생이 확신을 가지고 명확하게 행동한 것에 대해 보상합니다.
    • 답이 틀릴 경우: 선생님은 학생의 확신도를 살핍니다. 만약 학생이 매우 확신하고 있는데 틀렸다면, 선생님은 브레이크를 밟습니다("힌지 페널티"). 이는 학생이 "잠깐, 내가 이렇게 확신해도 되는 건가?"라고 깨닫게 만듭니다.
  • 이점: 이는 "자신만만한 오답" 문제를 막아줍니다. 학생이 막혔을 때 더 깊은 수렁으로 빠지는 대신, 다른 옵션들을 탐색하며 겸손함을 유지하도록 강제합니다.

결과

저자들은 세 가지 서로 다른 AI 모델을 대상으로 다섯 가지 어려운 수학 벤치마크(AIME 및 올림피아드 시험 등)에서 이 방법을 테스트했습니다.

  • 결과: 새로운 방법(ISPO)은 기존 방법들을 일관되게 이겼습니다.
  • 가장 빛난 부분: ISPO는 가장 어려운 문제들에서 가장 큰 효과를 보였습니다. 이는 논리적으로 타당합니다. 어려운 문제에서는 기존 방식이 "집단 침묵"(모두가 틀려서 아무도 배우지 못함)에 빠지기 쉬운데, ISPO는 미묘한 "사고-답안 연결"을 찾아내고 "확신 섞인 실수"를 바로잡음으로써 학습의 흐름을 유지했기 때문입니다.

요약하자면, 이 논문은 AI 모델에게 최종 점수만이 아니라 그들의 사고 과정의 질로부터 배우도록 가르칩니다. 이는 단순히 "네가 경기에서 졌다"라고 말하는 코스가 아니라, "너의 2쿼터 전략은 훌륭했지만, 3쿼터에 너무 자만했어. 그 부분을 고쳐보자"라고 말하는 코치와 같습니다. 이를 통해 결과가 실패하더라도 학습의 모멘텀을 계속 이어갈 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →