← 최신 논문
🤖 machine learning

From Reasoning to Code: GRPO Optimization for Underrepresented Languages

본 논문은 Prolog 및 Lisp 과 같은 소수 프로그래밍 언어에 대한 대규모 언어 모델의 코드 생성 및 추론 능력을 향상시키기 위해 실행 기반 피드백을 통합한 그룹 상대 정책 최적화 (GRPO) 프레임워크를 제안하여 희소한 훈련 데이터의 한계를 효과적으로 극복합니다.

원저자: Federico Pennino, Bianca Raimondi, Massimo Rondelli, Andrea Gurioli, Maurizio Gabbrielli

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Federico Pennino, Bianca Raimondi, Massimo Rondelli, Andrea Gurioli, Maurizio Gabbrielli

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 쉬운 언어와 일상적인 비유를 사용하여 설명합니다.

큰 문제: "희귀 언어" 격차

마치 뛰어난 학생 (AI) 이 코드를 작성하는 법을 가르치려 한다고 상상해 보세요. 이 학생은 파이썬이나 자바스크립트 같은 인기 언어로 코드를 작성하는 데 능숙합니다. 왜냐하면 수백만 권의 책과 예제를 읽었기 때문입니다.

하지만 이 학생에게 프로로그 (Prolog)리스프 (Lisp) 와 같은 오래된 논리 기반 언어로 코드를 작성하라고 하면 어려움을 겪습니다. 왜일까요?因为这些 언어는 희귀한 방언과 같기 때문입니다. AI 가 읽을 수 있는 책 (학습 데이터) 이 거의 없습니다. 충분한 예시가 없으면 AI 는 추측을 시작합니다. 겉보기에는 맞지만 실제로는 작동하지 않는 코드를 작성하거나, 존재하지 않는 규칙을 만들어낼 수도 있습니다.

해결책: 읽는 것보다 직접 해보며 배우기

이 논문의 저자들은 AI 에게 더 많은 책을 읽히려는 시도를 멈추기로 결정했습니다. 대신, 즉시 작업을 점검하는 "코치"를 활용하여 시행착오를 통해 학습하도록 가르쳤습니다.

그들은 GRPO(Group Relative Policy Optimization, 그룹 상대적 정책 최적화) 라는 방법을 사용했습니다. 이를 요리 대회에 비유해 보겠습니다:

  1. AI 에게 수학 단어 문제를 풀라고 요청합니다.
  2. 정답 하나만 제시하는 대신, AI 는 동시에 네 가지 다른 해결책을 만들어 보려고 합니다.
  3. "심판"(컴퓨터 인터프리터) 이 네 가지 해결책을 모두 실행합니다.
  4. 심판은 점수를 매깁니다: "이것은 완벽하게 작동했습니다 (+1 점)", "이것은 문법 오류가 있었습니다 (-0.5 점)", 또는 "이것은 잘못된 답을 내놓았습니다 (-1 점)".
  5. AI 는 어떤 "레시피"가 가장 잘 작동했는지 학습하고, 다음에는 그런 것을 더 많이 만들어 보려고 합니다.

비밀 재료: "추론 수축" 문제

처음에 연구자들은 표준 규칙을 사용하여 AI 를 가르치려 했습니다. 그들은 AI 에게 "네가 평소 말하는 방식에서 너무 벗어나지 마라"고 말했습니다. 이는 창의적인 학생에게 "교과서 예제에 충실하라"고 엄격하게 말하는 선생님과 같습니다.

그들은 "추론 수축 (Reasoning Contraction)" 이라는 문제를 발견했습니다.

  • 무슨 일이 일어났는가: AI 는 깊이 생각하기를 두려워하게 되었습니다. 안전해 보이지만 실제로는 틀린 매우 짧고 단순한 답변을 주기 시작했습니다. 실수를 할까 봐 두려워 논리를 설명하는 것을 멈췄습니다.
  • 해결책: 연구자들은 "엄격한 선생님"(KL 패널티라는 기술적 규칙) 을 제거하고 새로운 규칙을 추가했습니다: "네 이야기를 들려줘." 그들은 AI 가 코드를 제시하기 전에 자신의 사고 과정을 더 길고 상세하게 설명하면 추가 점수를 주었습니다.

결과: "그럭저럭"에서 "마스터"로

AI 가 더 오래 생각하게 하고 규범에서 벗어나는 것에 대한 두려움을 없애자 결과는 극적이었습니다:

  • 약자가 승리: 이 새로운 방법으로 훈련된 작은 AI 모델 (70 억 개의 "뇌 세포") 은 훨씬 크고 유명한 모델들 (700 억 개의 세포를 가진 모델 등) 보다 논리 퍼즐을 푸는 데 더 능숙해졌습니다.
  • 성공률 두 배: 가장 어려운 논리 작업에서 AI 의 성공률은 두 배 이상 증가했습니다.
  • 다른 언어에서도 작동: 그들은 또 다른 희귀 언어인 리스프 (Lisp) 에서 이를 테스트했고, 그곳에서도 효과가 있었습니다. AI 는 그 언어에 대해 "그럭저럭" 수준에서 "훌륭한" 수준으로 발전했습니다.

비유: "인터프리터"가 선생님이 됨

일반적으로 AI 는 인간이 작성한 예제에서 학습합니다. 하지만 희귀 언어의 경우 인간 예제가 충분하지 않습니다.
이 논문의 혁신은 컴퓨터 인터프리터 자체를 선생님으로 활용했다는 점입니다.

  • 당신이 저글링을 배우고 있다고 상상해 보세요. 마스터 저글러의 비디오를 보는 대신, 계속 저글링을 시도합니다.
  • 공을 떨어뜨리면 바닥 (인터프리터) 이 "아, 실패했어"라고 알려줍니다.
  • 공을 공중에 띄워두면 바닥이 "잘했어!"라고 말합니다.
  • AI 는 책을 외우는 것이 아니라, 컴퓨터의 "바닥"이 무엇이 작동하고 무엇이 작동하지 않는지 알려주는 느낌을 통해 언어의 규칙을 학습합니다.

요약

이 논문은 어렵고 희귀한 프로그래밍 언어의 경우 더 큰 AI 나 더 많은 책이 필요하지 않음을 보여줍니다. 단지 더 똑똑한 연습 방법이 필요합니다: AI 가 여러 해결책을 시도하게 하고, 컴퓨터가 즉시 심판하게 하며, AI 가 단계별로 자세히 생각하도록 장려하는 것입니다. 이렇게 하면 고군분투하는 학생이 최상위 수행자로 변모합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →