Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
본 논문은 다중 보상 강화 학습에서 이점 추정을 안정화하여 추론이나 코딩 능력을 훼손하지 않으면서도 지시 따르기, 작성, 견고성 측면에서 모델 성능을 향상시키는 새로운 방법인 보상 비상관 정책 최적화 (RDPO) 를 소개하며, 이는 크기 인식 분위 정규화와 마할라노비스 화이트닝을 활용합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
여러분이 이야기를 쓰고, 수학 문제를 풀고, 소프트웨어를 코딩하고, 엄격한 지시를 따르는 등 여러 가지 일을 동시에 수행하도록 매우 똑똑한 로봇 (AI) 을 훈련한다고 상상해 보세요. 로봇을 가르치기 위해 여러분은 매번 시도 후에 피드백 (보상) 을 제공합니다.
문제는 이러한 피드백 신호들이 혼란스럽다는 점입니다. 어떤 것은 단순한 '합격/불합격' 등급 (이진 스위치와 유사) 이고, 어떤 것은 0 에서 100 점까지의 점수이며, 어떤 것은 복잡한 의견입니다. furthermore, 이러한 신호들은 종종 겹칩니다. 예를 들어, 긴 답변은 '상세함'이라는 이유로 점수를 받을 수 있지만, '너무 장황함'이라는 이유로 점수를 잃을 수 있으며, '상세함' 점수는 수학적으로 '장황함' 점수와 연결되어 있을 수 있습니다.
이러한 뒤죽박죽 섞인 점수들을 모두 합쳐 로봇이 어떻게 개선해야 하는지 알려주려고 할 때, 훈련은 혼란스러워집니다. 로봇은 하나의 거대한 점수에 혼란을 느끼거나, 다른 것들을 무시하거나, 두 신호가 서로 싸우기 때문에 고리 속에 갇힐 수 있습니다.
이 논문의 저자들은 이러한 혼란을 해결하기 위해 RDPO(보상 비상관 정책 최적화) 라는 새로운 방법을 제안합니다. RDPO 를 로봇이 학습하기 전에 피드백을 준비하는 2 단계 '신호 정화기'로 생각하세요.
1 단계: '공정성 필터'(크기 인식 분위수 정규화)
문제: 여러분이 학급을 채점한다고 상상해 보세요. 한 학생은 100 점, 다른 학생은 99 점, 세 번째 학생은 0 점을 받았습니다. 만약 raw 숫자만 본다면 99 점과 100 점 사이의 간격은 매우 작아 보이지만, 0 점과 99 점 사이의 간격은 매우 큽니다. AI 훈련에서 한 가지 유형의 보상 (예: '합격/불합격' 확인) 이 큰 간격을 가지면 다른 모든 피드백을 압도하여 로봇이 그 한 가지 것에만 집중하고 나머지는 무시하게 만들 수 있습니다.
해결책: RDPO 는 크기 인식 분위수 정규화라는 '공정성 필터'를 사용합니다.
- 작동 원리: raw 숫자를 보는 대신 시도 간의 순위와 간격을 봅니다. 거대한 간격은 압축하여 (100 점이 99 점보다 무한히 낫지 않도록) 그리고 작은 간격은 늘려서 (99 점과 100 점이 여전히 구별되도록) 처리합니다.
- 비유: 한 선수가 10 초에, 다른 선수가 100 초에 결승선을 통과하는 경주를 상상해 보세요. 만약 시간만 본다면 두 번째 선수는 끔찍해 보입니다. 하지만 모든 사람이 그룹에 대한 상대적 수행 능력으로 평가되도록 경주를 정규화하면, 두 번째 선수는 첫 번째 선수의 압도적인 리드에 짓눌리지 않고 공정한 기회를 얻어 개선할 수 있습니다. 이는 단일 '나쁜' 또는 '이상치' 시도가 로봇의 학습 과정을 장악하지 않도록 보장합니다.
2 단계: '노이즈 제거기'(마할라노비스 화이트닝)
문제: 때로는 피드백 신호들이 중복됩니다. 예를 들어, 한 센서는 '로봇이 얼마나 말했는지'를 측정하고 다른 센서는 '로봇이 얼마나 말했는지'를 측정한다고 가정해 보세요. 이 두 점수를 합치면 동일한 정보를 두 번 계산하는 것입니다. 또는 두 센서가 서로 반대라고 상상해 보세요. 하나는 '더 길게 하라'고 하고 다른 하나는 '더 짧게 하라'고 합니다. 단순히 합치면 서로 상쇄되어 로봇은 명확한 방향을 얻지 못합니다.
해결책: RDPO 는 마할라노비스 화이트닝이라는 '노이즈 제거기'를 사용합니다.
- 작동 원리: 서로 다른 피드백 신호 간의 관계를 살펴봅니다. 두 신호가 같은 것을 말하고 있다면 (상관관계), 하나가 정보를 두 번 계산하지 않도록 하나의 가중치를 줄입니다. 서로 싸우고 있다면 로봇이 명확하고 균형 잡힌 지시를 얻도록 조정합니다.
- 비유: 드럼 연주자와 베이스 연주자가 정확히 같은 리듬을 연주하는 밴드를 생각해 보세요. 소리가 흐리고 중복됩니다. '노이즈 제거기'는 리듬 섹션이 흐릿하지 않고 선명하고 명확하게 들리도록 베이스를 약간 줄이는 사운드 엔지니어와 같습니다. 이는 로봇이 반복된 노이즈가 아닌 고유한 정보에서 학습하도록 보장합니다.
결과
저자들은 이 방법을 LongCat-Flash라는 대규모 AI 모델로 테스트했습니다. 그들은 네 가지 유형의 작업으로 이를 훈련시켰습니다:
- 지시 따르기: 요청한 대로 정확히 수행하기.
- 일반 작성: 좋은 이야기나 기사를 작성하기.
- 수학 추론: 논리 퍼즐 풀기.
- 코딩: 컴퓨터 프로그램 작성하기.
무슨 일이 일어났나요?
- 작성 및 지시: 로봇은 지시를 따르고 고품질 텍스트를 작성하는 능력이 크게 향상되었습니다. 어렵거나 까다로운 프롬프트가 주어졌을 때 더 견고해졌습니다.
- 수학 및 코딩: 로봇은 이전의 최선 방법만큼 잘 수행했습니다. 수학이나 코딩 능력이 나빠지지 않았으며, 다른 작업에서 훨씬 더 나아지는 동안 경쟁력을 유지했습니다.
결론
이 논문은 AI 가 학습하기 전에 피드백 신호를 정리 (공정하게 만들고 중복 제거) 함으로써 훈련 과정이 훨씬 더 안정적으로 변한다고 주장합니다. 이는 AI 가 수학 문제를 풀거나 코드를 작성하는 능력을 잃지 않으면서도 (작성 및 규칙 따르기 같은) 복잡하고 다중 작업 업무를 더 잘 수행할 수 있게 합니다. 이는 AI 가 올바른 교훈을 배우도록 다양한 유형의 칭찬과 비판을 더 똑똑하게 혼합하는 방법입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.