← 최신 논문
🤖 machine learning

Adaptive Loss Balancing for Noise-Robust GRPO in Generative Recommendation

이 논문은 정책이 불확실하고 보상 모델이 변별력이 있는 샘플에 대해서만 선택적으로 강화 학습을 적용함으로써, 오프라인 지표와 온라인 프로덕션 A/B 테스트 모두에서 균일한 RL 방식보다 우수한 성능을 보이는 노이즈 강건 생성형 추천을 위한 새로운 프레임워크인 AdaGRPO를 소개한다.

원저자: Kewei Xu, Junbo Qi, Yanyan Zou, Pengfei Zhang, Xingzhi Yao, Shengjie Li

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kewei Xu, Junbo Qi, Yanyan Zou, Pengfei Zhang, Xingzhi Yao, Shengjie Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하고 창의적인 비서에게 영화를 추천하는 법을 가르치고 있다고 상상해 보세요. 당신은 이 비서를 교육하는 두 가지 방법을 가지고 있습니다:

  1. "교과서" 방식 (지도 학습): 당신은 비서에게 수천 개의 "사용자 기록 -> 올바른 영화 추천" 사례를 보여줍니다. 비서는 이러한 패턴을 암기하며 학습합니다. 이는 안전하고 꾸준하지만, 똑같은 구식 제안만 반복하는 데 갇힐 수 있습니다.
  2. "코치" 방식 (강화 학습): 당신은 비서가 스스로 영화를 추측하도록 둡니다. 그러면 "코치"(순위 알고리즘)가 지켜보며 점수를 줍니다: "좋은 추측이야!" 또는 "나쁜 추측이야!" 비서는 높은 점수를 쫓으며 학습합니다.

문제점: 코치는 결함이 있다
이 논문은 현실 세계에서 이 "코치"가 완벽하지 않다고 주장합니다. 코치는 시스템이 이미 보여주었던 영화들만을 본 데이터로 학습되었습니다. 이는 편향을 만듭니다:

  • "쉬운" 경우: 만약 비서가 이미 인기 있는 영화를 잘 맞히고 있다면, 코치는 그저 일반적인 "잘했어!"라는 반응만 보입니다. 모든 추측에 대한 점수가 거의 비슷해집니다. 비서는 새로운 것을 배우지 못하거나, 더 나아가 코치를 기쁘게 하기 위해 무작정 아무거나 추측하기 시작하며, 실제로 무엇이 중요한지를 잊어버립니다.
  • "어려운" 경우: 만약 비서가 틈새 상품이나 새로운 영화를 맞춰야 한다면, 코치는 혼란스러워할 수 있습니다. 코치가 이 영화를 본 적이 없기 때문에, 올바르고 독특한 영화 대신 지루하고 대중적인 영화에 높은 점수를 줄 수도 있습니다. 만약 비서가 이 잘못된 조언을 듣는다면, 결과적으로 더 나빠지게 됩니다.

해결책: AdaGRPO (선택적 코치)
저자들은 AdaGRPO라고 불리는 새로운 시스템을 만들었습니다. AdaGRPO는 코치가 비서에게 100% 명령을 내리도록 허용하는 대신, 스마트한 문지기 역할을 합니다.

AdaGRPO는 코치의 조언이 유효하게 작용하기 전에 두 가지 간단한 질문을 던집니다:

  1. "비서가 어려움을 겪고 있는가?" (정책 난이도): 만약 비서가 이미 정답을 잘 알고 있다면, 코치의 조언은 중복되는 것이므로 무시됩니다.
  2. "코치가 지금 정말 도움이 되는가?" (보상 변별력): 만 만약 코치가 혼란스럽거나 편향되어 있다면(예: 올바른 틈새 상품 대신 인기 있는 상품을 선호하는 경우), 그 조언은 무시됩니다.

비유: "선택적 튜터(개인 과외 교사)"
시험 공부를 하는 학생과 튜터를 생각해 보세요.

  • 기존 방식: 튜터는 학생이 정답을 맞히든 틀리든 상관없이 모든 답변에 대해 소리를 지릅니다. 만약 튜터가 지쳤거나 편향되어 있다면, 학생은 혼란에 빠져 실수를 하기 시작합니다.
  • AdaGR포 방식: 튜터는 오직 두 가지 조건이 모두 충족될 때만 입을 엽니다:
    1. 학생이 실제로 막혀서 답을 모르고 있을 때.
    2. 튜터가 정답을 알고 있다는 확신이 있고, 단순히 추측하는 것이 아닐 때.

만약 학생이 이미 답을 알고 있다면, 튜터는 조용히 있습니다(학생이 자신의 지식에 의존하도록 둡니다). 만약 튜터가 확신이 없다면, 튜터 역시 조용히 있습니다. 이를 통해 학생이 나쁜 습관을 배우는 것을 방지합니다.

결과
연구팀은 이를 대규모 이커머스 플랫폼(JD.com)에서 테스트했습니다:

  • 오프라인 테스트: 새로운 방식은 정확도(올바른 아이템 찾기)를 최고점에서 11.01%에서 12.18%로 향상시키는 동시에, "환각"(가짜 아이템을 만들어내는 현상)을 매우 낮게 유지했습니다. 기존 방식들은 결함이 있는 코치를 만족시키려고 너무 애쓰다가 결국 성능이 저하되었습니다.
  • 실제 환경 테스트: 이 방식을 실제 사용자들에게 적용했을 때, 더 많은 사람들이 아이템을 클릭하고 사이트에서 더 많은 시간을 보내는 결과를 가져왔습니다.

핵적인 시사점
이 논문의 결론은, 추천을 위한 AI를 만드는 데 있어 가장 큰 과제는 더 "똑똑한" 코치를 만드는 것이 아니라는 것입니다. 진짜 과제는 코치를 언제 믿을 것인가를 아는 것입니다. 코치가 실제로 도움이 되고 학생이 실제로 어려움을 겪고 있을 때만 코치의 말에 귀를 기울함으로써, 시스템은 더 빠르게 학습하고 더 신뢰할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →