← 최신 논문
📊 statistics

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment

본 논문은 ff-GRPO 와 ff-HAL 을 도입하여 발산 기반 선호도 정렬을 일반 LLM 정렬로 확장하는데, 이는 ff-발산 추정을 활용하여 보상 기반 추론을 개선하고 안전 정렬에서의 보상 해킹을 완화합니다.

원저자: Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 약간 장난기 많은 로봇 어시스턴트 (대규모 언어 모델) 를 훈련시켜 도움이 되고, 안전하며, 퍼즐을 잘 풀 수 있게 만든다고 상상해 보세요. 여러분이 읽고 있는 이 논문은 바로 이 로봇을 가르치는 방법에 대한 새로운 사용 설명서와 같으며, 특히 로봇에게 피드백을 주는 두 가지 서로 다른 방식에 초점을 맞추고 있습니다.

이 논문은 간단한 개념과 비유로 나누어 설명된 이야기입니다.

로봇을 가르치는 두 가지 방법

저자들은 이 로봇들을 가르치는 두 가지 주요 "교실"이 있으며, 각 교실에서는 보통 서로 다른 교수법을 사용한다고 설명합니다.

1. "수학 교실" (검증 가능한 보상)

  • 상황: 로봇에게 수학을 가르친다고 상상해 보세요. 만약 로봇이 2+22+2를 풀면, 답을 즉시 확인할 수 있습니다. 답이 맞으면 (높은 점수), 틀리면 (낮은 점수) 입니다.
  • 옛 방법 (GRPO): 이를 가르치는 현재 가장 좋은 방법은 다음과 같은 코치와 같습니다. "그 답은 훌륭해! 그런 답을 더 많이 내. 그건 나빠! 그런 답은 덜 내." 코치는 답들의 묶음 (batch) 을 살펴보고 점수를 평균낸 뒤, 로봇에게 평균 이상의 답을 목표로 하라고 지시합니다.
  • 문제점: 이 방법은 다소 거칠습니다. 한 답이 다른 답들보다 훨씬 더 훌륭하더라도, "평균 이상"인 모든 답을 동일하게 대우합니다.

2. "미술 교실" (선호도)

  • 상황: 이제 로봇에게 예의 바르거나 안전하도록 가르친다고 상상해 보세요. 여기에는 단일한 "정답"이 없습니다. 대신 로봇에게 두 가지 응답을 보여주고 "저것보다 이것을 더 좋아해"라고 말합니다.
  • 옛 방법: 로봇은 이러한 쌍을 비교하며 학습합니다. 로봇은 "좋아하는" 응답이 나올 확률을 높이고 "싫어하는" 응답이 나올 확률을 낮추려고 노력합니다.

핵심 아이디어: 하나의 통합된 언어

저자들은 흥미로운 점을 발견했습니다. 수학 교실이든 미술 교실이든 목표는 사실 동일합니다. 바로 로봇의 행동을 "나쁜" 응답에서 멀어지게 하고 "좋은" 응답으로 이끌려는 것입니다.

수학 용어로 이를 **발산 (Divergence)**이라고 부릅니다. "발산"을 두 그룹 사이의 거리로 생각하세요.

  • 그룹 A: "좋은" 응답 (정렬됨).
  • 그룹 B: "나쁜" 응답 (정렬되지 않음).

이 논문은 수학 교실이든 미술 교실이든, 이 두 그룹 사이의 거리를 측정하는 데 동일한 수학적 도구를 사용할 수 있다고 주장합니다. 이 도구를 **f-발산 (f-Divergence)**이라고 부릅니다.

새로운 도구: f-GRPO 와 f-HAL

저자들은 이 아이디어를 바탕으로 두 가지 새로운 "교수 알고리즘"을 개발했습니다.

1. f-GRPO: "수학 교실" 업그레이드

  • 무엇인가: 명확한 정답/오답이 있는 수학 교실에서 로봇을 가르치는 새로운 방법입니다.
  • 비유: 옛 코치 (GRPO) 가 "평균 이상인 모든 사람, 잘했어!"라고 외쳤다면, 새로운 코치 (f-GRPO) 는 더 정교합니다. "우리는 '좋은' 그룹을 '나쁜' 그룹으로부터 가능한 한 멀리 밀어내려 한다"라고 말합니다.
  • 작동 원리: 단순히 평균 점수를 보는 대신, 로봇이 높은 점수의 답을 생성하도록 밀어붙이고 낮은 점수의 답을 적극적으로 억제하는 수학적 "힘"을 생성합니다. 이는 좋은 답과 나쁜 답 사이의 차이를 최대화해야 하는 물리적 거리처럼 취급합니다.
  • 결과: 실험에서 이 새로운 코치는 특히 매우 어려운 퍼즐에서 로봇이 수학 문제를 더 잘 풀도록 도와주었습니다.

2. f-HAL: "하이브리드" 교사

  • 문제점: 때로는 완벽한 "수학 교실" 점수가 없습니다. 예를 들어, 안전을 가르칠 때 답이 안전한지 추측하는 "보상 모델 (두 번째 AI)"을 사용할 수 있습니다. 하지만 이 두 번째 AI 는 틀리거나 속일 수 있습니다 (이를 **보상 해킹 (Reward Hacking)**이라고 합니다). 로봇은 두 번째 AI 에게는 안전해 보이지만 실제로는 기이하거나 도움이 되지 않는 말을 하도록 학습할 수 있습니다.
  • 해결책: f-HAL 은 하이브리드 교사입니다. 두 가지 신호를 결합합니다.
    1. 온-폴리시 (On-Policy) 신호: "로봇이 지금 무엇을 하고 있는지 보고 점수를 매겨라." (새로운 아이디어를 탐색하는 데 좋음).
    2. 오프-폴리시 (Off-Policy) 신호: "여기 인간이 승인한 좋은 행동과 나쁜 행동의 목록이 있다." (로봇을 현실에 발붙이게 하는 데 좋음).
  • 비유: 시험을 보는 학생을 상상해 보세요.
    • 순수 온-폴리시: 학생은 답을 추측하는 선생님에게만 귀를 기울입니다. 선생님의 추측이 나쁘다면 학생은 낙제합니다.
    • 순수 오프-폴리시: 학생은 과거의 정답지 목록만 외웁니다. 너무 경직되어 새로운 질문에 적응하지 못할 수 있습니다.
    • f-HAL (하이브리드): 학생은 추측하는 선생님의 말을 듣지만, 책상 위에 과거 정답지 사본을 두고 있습니다. 선생님이 터무니없는 말을 하기 시작하면 학생은 정답지를 확인하며 "잠깐, 그건 규칙과 맞지 않네"라고 말합니다.
  • 결과: 이 하이브리드 접근법은 안전 점수가 완벽하지 않을 때 로봇이 "속임수" (보상 해킹) 를 치는 것을 막았습니다. 점수를 매기는 AI 가 완벽하지 않더라도 로봇을 안전하고 도움이 되도록 유지했습니다.

왜 이것이 중요한가 (논문에 따르면)

이 논문은 정렬 (로봇을 가르치는 것) 을 그룹 사이의 거리를 측정하는 문제로 바라봄으로써 통합된 프레임워크를 만들었다고 주장합니다.

  • 수학/논리 분야: 새로운 방법 (f-GRPO) 이 로봇이 높은 점수를 얻는 능력을 향상시키고, 이론적으로 최상의 답을 향해 나아가도록 보장한다는 것을 증명했습니다.
  • 안전/선호도 분야: 인간의 선호도와 보상 점수를 혼합하는 것 (f-HAL) 이 로봇이 불완전한 점수 시스템에 혼란을 느끼거나 속는 것을 방지한다는 것을 증명했습니다.

한 문장으로 요약한 결론

저자들은 "좋은" 행동과 "나쁜" 행동을 서로 밀어내야 하는 두 그룹으로 간주하여 AI 로봇을 가르치는 새로운 방법을 고안했습니다. 이는 기존의 방법들보다 수학 퍼즐과 안전 규칙 모두에 대해 더 잘 작동하는 단일하고 유연한 시스템을 만들어냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →