← 최신 논문
🤖 machine learning

Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization

이 논문은 고품질 소량의 데이터와 정확도 필터링 없는 난이도 높은 샘플을 활용한 SFT, 그리고 잘라진 토큰으로부터의 그래디언트를 보존하여 탐색 능력을 향상시킨 새로운 GPPO 알고리즘을 통해 수학 및 프로그래밍 추론 성능을 획기적으로 개선한 'Klear-Reasoner' 모델을 제안합니다.

원저자: Zhenpeng Su, Leiyu Pan, Xue Bai, Dening Liu, Guanting Dong, Jiaming Huang, Minxuan Lv, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

게시일 2026-04-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhenpeng Su, Leiyu Pan, Xue Bai, Dening Liu, Guanting Dong, Jiaming Huang, Minxuan Lv, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

Klear-Reasoner: 머리가 좋은 AI 를 만드는 새로운 비법

이 논문은 **'Klear-Reasoner'**라는 이름의 새로운 인공지능 (AI) 모델을 소개합니다. 이 모델은 수학 문제나 코딩 문제를 풀 때, 단순히 정답만 외우는 게 아니라 천천히, 꼼꼼하게, 그리고 논리적으로 생각할 수 있는 능력을 갖췄습니다.

기존에도 똑똑한 AI 들이 많았지만, 어떻게 훈련시켰는지 비공개라 따라 하기 어려웠습니다. 이 논문은 그 '비밀 레시피'를 모두 공개하면서, 어떻게 하면 더 똑똑한 AI 를 만들 수 있는지 알려줍니다.

핵심 내용을 일상적인 비유로 설명해 드릴게요.


1. 공부 방법의 변화: "양보다 질" (SFT 단계)

AI 를 가르칠 때 (SFT 단계), 보통 많은 양의 문제를 풀게 하죠. 하지만 연구팀은 **"많은 양의 문제집보다는, 아주 좋은 문제집 몇 권이 더 효과적이다"**라는 사실을 발견했습니다.

  • 비유: imagine 하세요. 학생이 1,000 권의 잡다한 참고서를 두루뭉술 읽는 것보다, 최고의 명강사 (DeepSeek-R1) 가 쓴 10 권의 정통 교재를 깊이 있게 공부하는 것이 훨씬 실력이 느는 것과 같습니다.
  • 발견: 특히, 어려운 문제는 정답이 맞지 않아도 (틀린 풀이 과정이라도) 버리지 않는 게 좋았습니다. 왜냐하면 틀린 풀이를 보며 "아, 여기서 실수하면 안 되구나"라고 배우는 과정이 오히려 사고력을 키워주기 때문이죠.

2. 훈련의 핵심 기술: "GPPO" (강화학습 단계)

AI 가 스스로 문제를 풀며 실력을 늘리는 과정 (강화학습) 에서 기존에는 '잘못된 답'이나 '너무 큰 변화'를 두려워해서 일부러 무시하는 (Clipping) 기술이 쓰였습니다. 하지만 연구팀은 이것이 문제라고 지적합니다.

  • 기존 방식의 문제점:

    • 호기심 차단: AI 가 새로운 아이디어를 시도하다가 (탐험) 점수가 조금 낮게 나오면, 그 아이디어를 "아니야, 무시해"라고 잘라버립니다. AI 가 새로운 것을 시도할 기회를 잃는 거죠.
    • 실수 학습 지연: AI 가 틀린 답을 냈을 때, 그 실수를 가르쳐주지 않고 무시하면 AI 가 같은 실수를 반복하게 됩니다.
  • 새로운 해결책 (GPPO): "조용한 피드백"

    • 연구팀은 **"아무리 틀린 답이나 큰 변화라도, 그 안에는 배울 점이 있다"**고 생각했습니다.
    • 비유: 선생님이 학생의 답을 볼 때, 틀렸다고 "0 점! 무시해!"라고 외치는 대신, **"이 부분은 틀렸지만, 그 과정에서 네가 생각한 아이디어는 가치가 있어. 다음엔 이렇게 고쳐보자"**라고 조용히 (Gradient-Preserving) 가르쳐주는 방식입니다.
    • 이렇게 하면 AI 는 실수를 두려워하지 않고 **더 많이 시도 (탐험)**하게 되고, 틀린 답에서도 빠르게 배우게 되어 훨씬 빨리 성장합니다.

3. 채점 시스템의 변화: "하드코어 vs 소프트 코어"

코딩 문제를 풀 때, 기존에는 "모든 테스트를 통과해야 1 점, 하나라도 틀리면 0 점"이라는 하드코어 (Hard) 방식이었습니다.

  • 문제점: 16 개 테스트 중 15 개를 맞췄는데 1 개만 틀려도 0 점이라면, AI 는 "아, 15 개는 잘했는데 1 개 때문에 0 점이라니, 그냥 포기해야지"라고 생각할 수 있습니다.
  • 새로운 방식 (Soft Reward): 16 개 중 15 개를 맞췄다면 15/16 점을 줍니다.
  • 효과: AI 는 "내가 거의 다 맞췄네! 저 1 개만 고치면 돼!"라고 단계적으로 발전할 동기를 얻게 됩니다.

4. 결과: 얼마나 똑똑해졌나요?

이 새로운 방법론을 적용한 Klear-Reasoner는 기존에 가장 잘하던 모델들보다 더 뛰어난 성적을 냈습니다.

  • 수학 (AIME): 2024 년과 2025 년 수학 올림피아드 문제에서 90% 이상의 정답률을 기록했습니다. (일반적인 고등학생이 풀기 어려운 문제들입니다!)
  • 코딩 (LiveCodeBench): 코딩 대회 문제에서도 최상위권 성적을 냈습니다.

요약: 이 논문이 우리에게 알려주는 것

  1. 데이터는 양보다 질: 좋은 선생님의 교재를 깊이 있게 공부하세요.
  2. 실수는 기회: 틀린 답을 무시하지 말고, 그 안에서 배울 점을 찾아 조용히 가르치세요 (GPPO).
  3. 점수는 정직하게: 완벽하지 않아도, 조금이라도 잘한 부분에 점수를 주면 더 빨리 성장합니다.

이 논문은 **"AI 를 가르칠 때, 무조건적인 통제보다는 유연한 지도와 정직한 피드백이 더 큰 성장을 이끈다"**는 교훈을 줍니다. 마치 아이를 키울 때, 실수를 무조건 나무라기보다 "왜 그런 생각을 했지? 다음엔 이렇게 해보자"라고 대화하는 것이 더 큰 성장을 돕는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →