OR Else: A Differentiable Trust Region for Policy Optimization
이 논문은 LLM 사후 학습을 위한 PPO 및 GRPO의 클리핑된 대리 목적 함수(clipped surrogate objectives)에 대한 매끄럽고 미분 가능한 대안으로서 "출력 리셋(Output Reset, OR)"을 조사하며, OR이 최적화 동작을 변화시키고 그룹 상대적 설정에서 분산을 감소시키기는 하지만, 표준 클리핑 방식과 비교하여 보상 모델 점수를 일관되게 개선하지는 못한다는 것을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
AI에게 "딱 적당한" 법을 가르치는 기술
당신이 매우 똑똑하지만 약간은 무질서한 로봇에게 인간이 실제로 즐길 수 있는 이야기를 쓰는 법을 가르치려 한다고 상상해 보세요. 이 분야를 인간 피드백으로부터의 강화 학습(RLHF)이라고 부릅니다. 이것은 로봇이 문장을 쓰고, 인간 심판이 엄지손가락을 위로 올리거나 아래로 내리는 게임과 같습니다. 로봇은 그 피드백으로부터 배워 다음에는 더 잘 쓰려고 노력합니다. 목표는 로봇이 궤도를 벗어나지 않으면서도 도움이 되고 해롭지 않게 만드는 것입니다.
이를 위해 과학자들은 로봇의 글쓰기에 점수를 매기는 디지털 심판인 "보상 모델"을 사용합니다. 하지만 까다로운 부분이 있습니다. 만약 로봇이 심판을 기쁘게 하기 위해 너무 애를 쓰면, 높은 점수를 받기 위해 횡설수설하기 시작하거나, 성격이 너무 급격하게 변해서 정상적으로 말하는 법을 잊어버릴 수도 있습니다. 이를 방지하기 위해 연구자들은 "신뢰 영역(trust region)"이라는 안전 규칙을 사용합니다. 이것은 마치 목줄과 같습니다. 로봇은 돌아다니며 배울 수 있지만, 이 목줄은 로봇이 원래의 합리적인 모습에서 너무 멀리 달아나지 못하게 붙잡아 줍니다.
이 목줄을 관리하는 가장 대중적인 방법은 PPO(Proximal Policy Optimization)라고 불리는 방식입니다. PPO는 "클리핑(clipping)" 메커니즘을 사용합니다. 로봇이 목표를 향해 달려가고 있다고 상상해 보세요. 만약 로봇이 안전 구역의 가장자리에 너무 가까워지면, PPO는 갑자기 브레이크를 밟아 더 빨리 달리려는 추가적인 동기 부여를 차단합니다. 이는 효과적이지만, 마치 전등 스위치와 같아서 완전히 켜지거나 완전히 꺼지는 식입니다. 이 논문은 간단한 질문을 던집니다. 만약 목줄이 툭 끊어지는 대신, 로봇이 안전 한계에 도달했을 때 부드럽게 사라진다면 어떨까요? 저자들은 이 새로운 "부드러운 목줄" 방식이 LLM(대규모 언어 모델)이 유익하도록 가르치는 데 더 효과적인지 확인하기 위해 "출력 리셋(Output Reset, OR)"이라는 새로운 방법을 제안합니다.
부드러운 목줄 vs. 클리핑된 스위치
연구자들인 친메이 레인(Chinmay Rane), 카니슈카 티아기(Kanishka Tyagi), 마이클 맨리(Michael Manry)는 이 새로운 "부드러운 목줄" 아이디어를 두 가지 다른 훈련 시나리오에서 기존의 "클리핑된 스위치"와 비교 테스트하기로 했습니다. 그들은 작지만 유능한 로봇 뇌(Llama-3.2-1B 모델)를 사용했고, 인간의 선호도 데이터셋(Anthropic hh-rlhf)으로 훈련시켰습니다. 결과가 단순히 운이 아니라는 것을 확인하기 위해 서로 다른 랜덤 시드로 실험을 세 번 반복했습니다.
실험: 두 가지 서로 다른 세상
팀은 PPO-OR 및 GRPO-OR라고 부르는 새로운 방법을 두 가지 뚜렷한 환경에서 테스트했습니다:
- GAE 세계 (PPO): 이것은 로봇이 "비평가(critic, 미래의 보상을 예측하는 조력자)"를 가지고 있으며, 토큰(단어) 하나하나로부터 학습하는 고전적인 설정입니다.
- 그룹 상대적 세계 (GRPO): 이것은 로봇이 두 개의 답변을 동시에 생성하고, 이를 비교하며, 비평가 없이 그 차이로부터 학습하는 더 새롭고 단순한 설정입니다.
결과: 두 가지 다른 결말
결과는 놀라웠으며, "부드러운 목줄"이 모든 상황에서 동일하게 작동하지 않는다는 것을 보여주었습니다.
GAE 세계 (PPO)에서: 부드러운 방식(PPO-OR)이 순수 점수 측면에서 명확한 승자였습니다. 새 방식으로 훈련된 로봇은 표준 클리핑 방식의 0.195와 비교하여 평균 보상 점수 0.500을 기록했습니다. 이는 0.305점의 도약입니다! 하지만 함정이 있었습니다. 결과가 다소 "흔들렸다"는 점입니다. 세 번의 실행 간에 점수 편차가 더 컸습니다(표준 편차 0.158 vs 0.110). 부드러운 목줄이 로봇을 더 빨리 달리게 도와주었지만, 그 경로를 덜 예측 가능하게 만든 것으로 보입니다.
그룹 상대적 세계 (GRPO)에서: 여기서는 부드러운 방식(GRPO-OR)이 로봇을 더 빨리 달리게 만들지 못했습니다. 사실, 평균 점수는 0.488에서 0.457로 약간 떨어졌습니다. 하지만 로봇은 훨씬 더 안정적이 되었습니다. 실행 간의 변동성이 0.080에서 0.027로 극적으로 줄어들었습니다. 마치 로봇이 떨림을 멈추고 일정한 리듬을 찾은 것 같았지만, 더 높은 정점에 도달하지는 못했습니다.
거대한 발견: 목줄은 짧아지지 않았다
그러나 가장 중요한 발견은 점수에 관한 것이 아니었습니다. 연구자들은 새로운 방식이 로봇을 원래의 성격으로부터 너무 멀리 떠나게 할 수도 있다는 점(정책 드리프트 문제)을 우려했습니다. 그들은 로봇의 현재 글쓰기 스타일이 시작할 때의 스타일에서 얼마나 멀어졌는지 측정했습니다.
그들은 그룹 상대적 세계에서 로봇이 기존의 클리핑 방식이나 새로운 부드러운 방식을 사용하든 상관없이 5에서 13 단위의 엄청난 거리만큼 표류했다는 것을 발견했습니다. 부드러운 목줄(OR)은 로봇이 원래의 성격에서 멀리 달아나는 것을 막지 못했습니다. 그것은 단지 로봇이 "안전 구역"에 도달했을 때 어떻게 반응하는지를 바꾼 것뿐입니다. 이 논문은 부드러운 포화(saturation)가 로봇을 집 근처에 머물게 하는 엄격한 "신뢰 영역" 역할을 한다는 생각을 명시적으로 부정합니다. 로봇은 여전히 멀리 떠돌았고, 새로운 방식은 단지 그곳에 도ر했을 때 어떻게 개선 노력을 멈출지에 대한 수학적 계산을 바꾼 것뿐입니다.
이것이 미래에 의미하는 바
저자들은 이것을 완전한 승리라고 부르기를 경계합니다. 그들은 "부드러운 목줄"(출력 리셋)이 로봇이 배우는 방식을 바꾸지만, 그룹 상대적 방식의 가장 큰 문제인 "원래의 정책으로부터 너무 멀리 떠도는 현상"을 해결하지는 못한다는 것을 발견했습니다.
고전적인 PPO 설정에서 부드러운 방식은 약간의 불안정성을 동반하면서도 로봇이 더 높은 점수를 얻도록 도왔습니다. 더 새로운 방식인 그룹 상대적 설정에서는 훈련을 훨씬 더 일관되게 만들었지만, 최종 점수를 높이거나 로봇의 표류를 막지는 못했습니다. 이 논문은 단순히 수학을 부드럽게 만드는 것만으로는 "표류" 문제를 해결하기에 충분하지 않다는 것을 시사합니다. 즉, 로봇이 도망가지 못하게 하려면 더 큰 규모의 비교 그룹이나 다른 안전 규칙이 필요할 수도 있습니다.
궁극적으로 이 연구는 AI 훈련의 세계에 단 하나의 "마법의 탄환"은 없다는 것을 보여줍니다. 한 설정에서 아름답게 작동하는 기술이 다른 설정에서는 다르게 행동할 수 있습니다. 출력 리셋의 부드럽고 연속적인 접근 방식은 맥락에 따라 더 안정적이거나 더 효과적일 수 있는 다른 종류의 학습 방식을 제공하지만, AI 모델을 통제하기 위한 보편적인 해결책은 아닙니다. 연구자들은 이 새로운 방식이 훈련 과정의 동작을 변화시키기는 하지만, 더 크고 복잡한 AI 시스템으로 나아감에 따라 이러한 강력한 모델들을 어떻게 최선으로 제어할 것인가라는 질문은 여전히 열려 있다고 결론지었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.