← 최신 논문
💬 NLP

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

본 논문은 자동 생성, 검증 및 GRPO 기반 선별을 통해 보상 함수 명세를 반복적으로 최적화하는 검색 기반 강화 학습 프레임워크를 제안하며, 정적 또는 무작위 보상 앙상블에 비해 GSM8K 에서 수학적 추론 성능을 크게 향상시키는 순위 기반 피드백 루프를 입증합니다.

원저자: Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad

게시일 2026-05-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑한 학생 (대형 언어 모델) 이 있는데, 말하기는 뛰어나지만 수학 문제 풀이에는 때때로 어려움을 겪습니다. 여러분은 그 학생이 수학 문제를 더 잘 풀 수 있도록 가르치고 싶어 합니다. 보통은 숙제를 채점할 교사를 고용하겠죠. 하지만 이 논문에서 저자들은 다른 질문을 던집니다. "만약 숙지를 완벽하게 채점하는 방법을 정확히 알지 못한다면 어떨까요? 만약 AI 가 최고의 채점 규칙을 발명하도록 돕는다면 어떨까요?"

이들이 어떻게 했는지 간단히 설명해 드리겠습니다.

1. 문제: "채점 기준표"의 미스터리

AI 세계에서는 모델이 더 잘 생각하도록 가르치기 위해 **강화 학습 (Reinforcement Learning)**이라는 시스템을 사용합니다. 이는 개를 훈련시키는 것과 비슷합니다.

  • 개: AI 모델.
  • 간식: "보상" (긍정적인 점수).
  • 재주: 수학 문제를 올바르게 푸는 것.

문제는 "간식" (보상 함수) 을 설계하는 것이 어렵다는 점입니다. AI 에게 "정답을 맞추면 잘했다"고 말하면, 실제로 생각하지 않고 추측하거나 패턴을 복사하는 식으로 속일 수 있습니다. 만약 AI 가 취하는 단계에 보상을 주려 한다면 복잡한 규칙을 작성해야 하며, 그 규칙들에서 실수하기 쉽습니다.

2. 해결책: "채점 규칙 공장"

저자들은 채점 규칙 자체를 최적화할 대상으로 삼는 시스템을 구축했습니다. 그들은 규칙을 직접 작성하지 않았고, 대신 AI(김미 K2 라는 이름의 '최전선' 모델) 가 규칙 발명가로 활동하는 공장을 세웠습니다.

다음은 공장이 작동하는 방식입니다.

  • 1 라운드: 규칙 발명가 AI 에게 수학 문제 20 개가 주어지고 이를 채점하는 새로운 방법 10 가지를 작성하라고 요청받습니다. 이 규칙들은 간단한 컴퓨터 코드 (요리법과 같은) 로 작성됩니다.
  • 안전 점검: 이러한 규칙들이 사용되기 전에, 위험하거나 고장 난 것이 아닌지 확인하기 위해 "보안 스캐너"를 통과합니다.
  • 테스트 주행: 연구자들은 작은 수학 학생 (30 억 파라미터 AI 모델) 을 데려와 이 새로운 규칙 중 하나를 사용하여 짧은 시간 (500 단계) 동안 문제 풀이를 연습하게 합니다.
  • 성적표: 연구자들은 학생이 시험에서 얼마나 잘 수행했는지 확인합니다. 새로운 규칙이 학생의 점수 향상에 도움이 되었다면 그 규칙은 높은 순위를 매깁니다. 규칙이 학생을 혼란스럽게 했다면 낮은 순위를 매깁니다.
  • 피드백 루프: 최상위 성능을 보인 규칙들을 요약하여 규칙 발명가 AI 에게 다시 전달합니다. AI 에게 "이봐, 생각의 단계 수를 세는 규칙은 잘 작동했어. 단순히 최종 답안만 본 규칙은 그렇게 잘 작동하지 않았어. 이를 바탕으로 새로운 규칙을 발명해 봐"라고 알려줍니다.

이 사이클을 5 번 반복하여 50 개의 다양한 후보 규칙을 생성했습니다.

3. 결과: "황금 규칙" 찾기

5 라운드 후, 그들은 몇몇 승자들을 찾았습니다.

  • 최고의 단일 규칙: thinking_steps_count 라는 이름의 한 규칙이 챔피언이었습니다. 이 규칙은 AI 가 적어도 세 개의 서로 다른 줄에 생각 과정을 적어내면 추가 점수를 주었습니다. 정답이 맞는지 확인한 것은 아닙니다 (기초 시스템이 그 일을 했습니다); 그저 AI 가 자신의 풀이 과정을 보여 주도록 장려한 것입니다.
  • 팀워크의 힘 (앙상블): 그들은 하나의 규칙만으로는 부족하다는 것을 깨달았습니다. 그래서 최고의 규칙 5 개를 가져와 "슈퍼 채점 팀"으로 결합했습니다.
    • 결과: 이 규칙 팀은 AI 가 기본 규칙만 사용했을 때의 60% 성공률에서 79.5% 성공률로 점프하도록 도왔습니다.
    • "마법" 확인: 단순히 운이나 규칙의 sheer 수 때문이 아님을 증명하기 위해, 더미에서 무작위로 선택한 5 개의 규칙으로 구성된 "무작위 팀"을 시도해 보았습니다. 그 무작위 팀은 실패하여 AI 가 거의 모든 것을 틀렸습니다. 이는 피드백 루프 (어떤 규칙이 작동하는지 학습하고 그 정보를 발명가에게 되돌려 주는 것) 가 단순히 규칙을 더 많이 가진 것이 아니라 비밀 소스였음을 증명했습니다.

4. AI 가 속였을까요? ("보상 해킹" 감사)

"생각하는 줄을 더 많이 써 달라"고 AI 에게 말하면, 점수를 얻기 위해 페이지를 뜬구름 잡는 말로 채울 것이라는 일반적인 두려움이 있습니다.

  • 감사: 저자들은 AI 의 답안을 확인했습니다. 그들은 AI 가 정답을 맞췄을 때, 틀렸을 때보다 실제로 더 많은 줄을 쓰고 더 많은 수학 기호를 사용했다는 사실을 발견했습니다.
  • 결론: AI 는 빈 공간을 채워 속이지 않았습니다. 규칙이 그렇게 하도록 장려했기 때문에 진정으로 더 열심히 생각한 것입니다.

5. 왜 이것이 중요한가

  • 접근성: 슈퍼컴퓨터가 필요하지 않습니다. 그들은 이 전체 실험을 게이머들이 사용하는 것과 같은 단일 고성능 소비자용 그래픽 카드에서 약 40 시간 만에 실행했습니다.
  • 자동화: 인간 전문가가 완벽한 채점 기준표가 어떻게 생겼는지 추측하는 데 몇 주를 보내는 대신, 이 시스템이 이러한 규칙들을 자동으로 발견합니다.
  • 투명성: 규칙들은 블랙박스가 아닙니다. 인간이 읽고, 이해하고, 수정할 수 있는 간단한 파이썬 코드입니다.

한 마디로 요약하면: 이 논문은 AI 가 다른 AI 를 위한 채점 시스템을 설계하도록 돕고, 학생의 수행 정도에 따라 그 규칙들을 지속적으로 정제한다면, 정적이며 인간이 작성한 규칙 세트만 주는 것보다 학생이 훨씬 더 잘 생각하도록 가르칠 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →