← 최신 논문
💬 NLP

Constrained Group Relative Policy Optimization

이 논문은 그룹 내 정규화로 인해 발생하는 해로운 결합 효과를 제거하기 위해 가공되지 않은 보상 대신 표준화된 어드밴티지를 스칼라화함으로써 제약 조건 준수와 학습 안정성을 개선하는 Group Relative Policy Optimization의 라그랑주 기반 확장인 Constrained GRPO를 소개한다.

원저자: Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

게시일 2026-09-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급변하는 인공지능의 세계에서 연구자들은 자율주행 자동차를 운전하는 것부터 어려운 수학 문제를 푸는 것에 이르기까지 복잡한 문제를 해결하도록 거대 컴퓨터 모델을 가르치고 있습니다. 이 모델들은 시행착오를 통해 학습하는데, 이 과정을 강화 학습이라고 합니다. 미로를 풀려고 노력하는 학생을 상상해 보십시오. 학생은 출구에 도辿하면 보상을 받고, 벽에 부딪히면 벌칙을 받습니다. 시간이 흐르면서 학생은 보상을 극대화하고 벌칙을 피하는 법을 배웁니다. 그러나 우리가 모델에게 "보행자를 절대 치지 마라" 또는 "항상 올바른 문법을 사용하라"와 같이 엄격한 규칙을 따르게 하면서도 동시에 유용하게 행동하도록 만들고자 할 때 큰 문제가 발생합니다. 규칙이 너무 엄격하면 모델은 쓸모없게 될 수 있고, 너무 느슨하면 규칙을 어길 수 있습니다. 이를 해결하기 위해 과학자들은 성공하고자 하는 욕구와 제약 조건을 준수해야 하는 필요성 사이의 균형을 맞추며, 모델이 학습함에 따라 각 규칙의 중요도를 조정하는 수학적 프레임워크를 사용합니다.

이러한 모델을 가르치는 대중적인 방법인 GRPO(Group Relative Policy Optimization)는 효율적이며 모든 단계를 평가하기 위해 별도의 "판사" 모델을 필요로 하지 않기 때문에 선호되어 왔습니다. 대신, 이 방법은 동일한 질문에 대해 생성된 일련의 답변들을 서로 비교하여 어떤 것이 더 나은지 결정합니다. 이 방법은 일반적인 작업에는 잘 작동하지만, 연구자들은 이를 엄격한 안전 규칙에 적용하는 것이 까다롭다는 것을 발견했습니다. 밀라(Mila) - 퀘벡 AI 연구소와 에콜 폴리테크니크 드 몬트리올의 연구팀은 새로운 연구에서, 서로 다른 목표들을 하나의 점수로 결합하는 기존의 방식이 실제로 시스템의 규칙 준수 능력을 망가뜨리고 있다는 사실을 발견했습니다. 그들은 이 결함을 해결하고 모델이 안전 한계치를 엄격히 준수하면서도 복잡한 행동을 학습할 수 있도록 하는 새로운 접근 방식인 CGRPO(Constrained Group Relative Policy Optimization)를 도입했습니다.

연구진이 식별한 핵심 문제는 컴퓨터가 여러 목표를 동시에 처리하는 방식입니다. 표준적인 접근 방식에서는 모델이 받는 모든 보상과 벌칙을 가져와서 하나의 숫자로 혼합한 다음, 학습을 용이하게 하기 위해 그 숫자를 정규화합니다. 연구진은 이 혼합 과정이 숨겨진 간섭을 일으킨다는 것을 보여주었습니다. 컴퓨터가 한 규칙의 가중치를 조정할 때, 의도치 않게 다른 모든 규칙의 상대적 중요성도 함께 변화시킵니다. 이는 오케스트라의 특정 악기 볼륨을 조절하기 위해 노브를 돌리는데, 그 노브가 밴드 전체의 균형까지 바꿔버리는 것과 같습니다. 바이올린 소리를 키우려 해도 의도치 않게 드럼 소리는 너무 작아지고 플루트 소리는 너무 커질 수 있는 것입니다. 이로 인해 모델은 정확히 어떤 규칙을 따라야 하는지 배우기가 매우 어려워지며, 종종 안전 제약 조건을 무시하거나 학습 과정 중에 불안정해지는 원인이 됩니다.

이를 해결하기 위해 연구진은 연산의 순서를 변경했습니다. 보상과 벌칙을 먼저 혼합하는 대신, 모델이 각 규칙의 가치를 개별적으로 계산하고 개별적으로 정규화하도록 했습니다. 각 규칙이 독자적으로 공정하게 처리된 후에야 학습된 가중치를 사용하여 이들을 결합합니다. 이 단순한 전환은 숨겨진 간섭을 제거합니다. 신호를 마지막까지 분리된 상태로 유지함으로써, 모델은 특정 규칙에 대해 자신이 얼마나 개선되고 있는지 명확하게 파악할 수 있습니다. 결과적으로 학습 과정은 훨씬 더 안정적이고 예측 가능해졌습니다. 연구진은 이 새로운 방법을 세 가지 매우 다른 환경에서 테스트했습니다: 에이전트가 용암을 피하고 배터리를 관리해야 하는 간단한 그리드 기반 게임, 수천 개의 복잡한 교통 시나리오가 포함된 현실적인 자율주행 시뮬레이션, 그리고 초등 수준의 문장제 수학 문제를 포함한 수학적 추론 과제입니다.

그리드 기반 게임에서 새로운 방법은 에이전트가 훨씬 더 매끄럽게 학습할 수 있게 해주었습니다. 표준 방식은 에이전트를 지나치게 조심스럽게 만들어 용암을 너무 공격적으로 피하느라 거의 움직이지 못하게 만든 반면, 새로운 방식은 에이전트가 위험에 대한 가용 "예산"을 효과적으로 사용하여 목표에 도달하면서도 안전을 유지할 수 있게 했습니다. 자율 주행 시뮬레이션에서 새로운 접근 방식은 경로를 완수하는 능력이 뛰어날 뿐만 아니라 더 안전한 운전자를 만들어냈습니다. 새로운 방법으로 훈련된 모델은 신호를 먼저 혼합했던 이전 방식들에 비해 안전 준수 및 경로 진행 측면에서 더 높은 점수를 기록했습니다. 이 모델들은 전진하는 능력을 희생하지 않으면서도 충돌을 성공적으로 피하고 교통 법규를 준수했습니다. 이는 기존의 방법들이 유지하기 어려워했던 균형입니다.

마지막 테스트는 언어 모델이 수학 문제를 풀면서 동시에 답변이 짧고, 형식이 올바르며, 유효한 숫자를 포함하도록 가르치는 것이었습니다. 여기서도 새로운 방법은 다시 한번 우월함을 입증했습니다. 표준 혼합 방식을 사용해 훈련된 모델들은 답변을 더 짧게 만들거나 특정 형식을 맞추기 위해 정답을 희생하는 경우가 많았습니다. 반면, 새로운 방식은 모델이 형식을 갖추고 길이를 유지하면서도 수학적 정확성을 확보하는 데 우선순위를 두도록 보장했습니다. 15억 개의 파라미터를 가진 작은 모델부터 70억 개의 파라미터를 가진 더 큰 모델에 이르기까지, 이 새로운 접근 방식은 값비싼 추가 훈련 구성 요소 없이도 일관되게 더 정확한 결과를 만들어냈습니다.

이러 возника한 결과는 우리가 서로 다른 학습 신호를 결합하는 방식이 신호 그 자체만큼 중요하다는 것을 시사합니다. 컴퓨터가 보상과 규칙을 처리하는 순서를 바꾸는 것만으로도, 연구진은 제약 조건을 훨씬 더 신뢰성 있게 준수하는 시스템을 만들 수 있었습니다. 이 연구는 단순히 작은 개선을 제공하는 것이 아닙니다. 이는 규칙을 따르는 것이 목표를 달성하는 것만큼이나 중요한 실제 세계에서 인공지능이 안전하게 작동하도록 훈련하기 위한 더 명확한 경로를 제공합니다. 이 연구는 우리가 AI가 유능하면서도 안전하기를 원한다면, 성공을 측정하는 방식이 모델이 실제로 무엇을 해야 하는지에 대해 혼란을 주지 않도록 주의해야 함을 확인시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →