← 최신 논문
🤖 AI

CoRe-Code: Collaborative Reinforcement Learning for Code Generation

CoRe-Code 는 그룹 상대 정책 최적화 (GRPO) 로 강화된 역할 특화형 플래너 및 코더 에이전트를 활용하는 협력 강화 학습 프레임워크로, 자동회귀 디코딩의 한계를 극복하고 복잡한 작업 전반에 걸친 코드 생성의 정확성과 효율성을 향상시킵니다.

원저자: Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Xiaoyu Xia, Sumon Biswas

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Xiaoyu Xia, Sumon Biswas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 가구를, 예를 들어 책장을 만드는 상황을 상상해 보세요. 하지만 설계도가 없습니다. 그냥 못을 박고 나무를 접착제로 붙이며 진행되면서 제법 보이기를 바랄 뿐입니다. 이것이 현재 대부분의 AI 코드 생성기가 작동하는 방식입니다. 그들은 단어마다 (또는 '토큰 단위') 코드를 작성하는데, 이는 처음 glance 에서는 괜찮아 보이는 구조를 만들지만, 실제로 사용해 보면 무너져 버리는 결과를 초래합니다. 지역적으로는 일관성 있을 수 있습니다 (단어들이 의미는 통합니다). 하지만 전역적으로는 망가져 있습니다 (선반이 책을 지탱하지 못합니다).

이 논문은 Planner(계획자)와 Coder(코더)라는 두 가지 뚜렷한 역할을 수행하는 건설 팀처럼 행동하도록 AI 에게 코드를 작성하는 법을 가르치는 새로운 방법인 CoRe-Code를 소개합니다.

문제: "망치 먼저" 접근법

현재의 AI 모델들은 즉시 망치를 잡는 열정적인 견공들과 같습니다. 그들은 테이블의 다리를 튼튼해 보이는 모양으로 만들 수 있지만, 테이블 상판을 만드는 것을 잊어버렸다는 사실을 나중에 깨닫습니다. 아니면, 작동하는 테이블을 만들 수 있지만, 단계를 효율적으로 계획하지 않아 조립하는 데 100 년이 걸릴 수도 있습니다.

해결책: 건축가와 시공자

CoRe-Code 는 작업을 두 개의 전문화된 에이전트로 나눕니다.

  1. Planner(건축가): 어떤 코드도 작성되기 전에, 이 에이전트는 상세한 설계도를 그립니다. 스스로 코드를 작성하지는 않습니다. 대신 **"알고리즘적 사고 **(Algorithmic Thought)라는 단계별 레시피를 작성합니다. 이 레시피는 문제를 명확한 부분으로 분해합니다.

    • 입력/출력: 무엇을 가지고 시작하며, 무엇을 최종적으로 얻어야 합니까?
    • 선형 단계: 시작부터 끝까지의 직선 경로.
    • 조건: "이것이 발생하면, 저것을 하라."
    • 루프: "완료될 때까지 이 동작을 반복하라."
  2. Coder(시공자): 이 에이전트는 건축가의 설계도를 받아 실제로 가구를 제작합니다 (코드를 작성합니다). 이 에이전트의 유일한 임무는 계획을 충실하고 효율적으로 따르는 것입니다.

비결: 직접 해보며 배우기 (강화 학습)

CoRe-Code 의 진정한 마법은 단순히 두 개의 에이전트를 갖는 것이 아니라, 그들이 함께 일하는 법을 배우는 방식에 있습니다.

건축가와 시공자가 함께 연습하는 훈련 캠프를 상상해 보세요.

  • 건축가가 계획을 그립니다.
  • 시공자가 그것을 만들어 봅니다.
  • 테스트: 완성된 제품을 "시험실" (실제 문제와 코드를 실행) 에 넣습니다.
  • 피드백:
    • 코드가 완벽하게 작동하고 빠르면, 둘 다 높은 점수를 받습니다.
    • 코드가 실패하면, 시스템은 실패했는지 살펴봅니다. 시공자가 지시를 잘못 수행했습니까? 아니면 건축가가 나쁜 설계도를 제공했습니까?

이 논문은 GRPO(Group Relative Policy Optimization, 그룹 상대 정책 최적화)라는 특별한 훈련 방법을 사용합니다. 이는 다양한 건축가/시공자 팀 쌍을 비교하는 코치와 같습니다. 팀 A 의 계획이 튼튼한 테이블로 이어지고 팀 B 의 계획이 흔들리는 망가진 결과로 이어진다면, 코치는 팀 A 에게 "잘했다, 계속 그렇게 하라"고 말하고, 팀 B 에게 "너희 설계도가 문제였다; 다른 접근법을 시도하라"고 말합니다.

중요하게도, 건축가는 간접적으로 배웁니다. 건축가는 그림 자체에 대한 점수를 받는 것이 아니라, 시공자가 그 그림을 얼마나 잘 실행할 수 있었는지에 기반한 점수를 받습니다. 이는 건축가가 단순히 예쁜 것이 아니라 실제로 유용한 계획을 작성하도록 강제합니다.

그들이 발견한 것

연구자들은 이 "Planner-Building" 팀을 숫자 목록 정렬이나 복잡한 수학 퍼즐 풀이와 같은 여러 어려운 코딩 과제에 대해 테스트했습니다.

  • 더 높은 정확도: CoRe-Code 팀은 "Chain of Thought"(스스로와 대화하기) 를 사용하거나 다른 다중 에이전트 시스템을 포함하는 다른 AI 방법들보다 더 많은 문제를 정확하게 해결했습니다.
  • 효율성: 그들이 작성한 코드는 단순히 정확할 뿐만 아니라 더 빠르고 컴퓨터 메모리를 덜 사용했습니다.
  • 유연성: 팀은 이 "Planner-Building" 학습 스타일이 한 가지 유형의 작업에만 국한되지 않음을 보여주었습니다. 그들은 이를 정보를 찾는 "검색 에이전트"와 오류를 수정하는 "디버깅 에이전트"를 포함하는 다른 AI 팀에도 성공적으로 적용하여, 이 방법이 어떤 AI 건설 팀에게나 다재다능한 도구임을 입증했습니다.

요약

CoRe-Code 는 단계를 추측하는 독무작업자에서, 함께 훈련하는 전용 건축가와 시공자를 갖춘 전문 건설 팀으로 AI 를 업그레이드하는 것과 같습니다. 최종적으로 작동하는 결과물에 기반하여 그들에게 보상을 줌으로써, 그들은 더 잘 소통하고, 더 똑똑하게 계획하며, 실제로 작동하는 코드를 구축하는 법을 배우게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →