A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems
본 논문은 핀터레스트 홈피드의 다목적 최적화 균형을 동적으로 조정하여 Pareto 스캐닝을 통해 개인화된 유틸리티 가중치 튜닝을 자동화하는 생산 준비 완료형 랭커 독립 강화 학습 프레임워크인 PRL-PUTS 를 소개하며, 이는 서빙 지연을 추가하지 않고도 상당한 참여도 개선을 이끌어냅니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핀터레스트를 상상해 보세요. 수백만 권의 책 (핀) 이 방문객들에게 끊임없이 추천되는 거대하고 활기찬 도서관입니다. 이 도서관에는 매우 똑똑한 사서 (랭커) 가 있어 모든 책을 살펴보고 다양한 기준에 따라 특정 방문객이 그 책을 얼마나 좋아할지 예측합니다. "이 책을 클릭할까요?", "보드에 저장할까요?", "관련 이미지를 볼까요?"
구식 방식: "일률 적용" 규칙집
과거 도서관 관리자들은 이러한 예측들을 어떻게 하나의 점수로 결합하여 어떤 책을 먼저 보여줄지 결정해야 했습니다. 그들은 간단한 공식을 사용했습니다.
총점 = (클릭 × 가중치 A) + (저장 × 가중치 B)
문제는 가중치 A 와 B 가 수동으로 설정되었다는 점입니다. 관리자들이 더 많은 저장을 원한다면 가중치 B 를 수동으로 높였습니다. 하지만 이는 느리고 경직되었으며, 모든 사람에게 똑같은 규칙을 적용했습니다. 파티 아이디어를 찾는 십대나 홈데코를 찾는 전문가나, 전혀 다른 필요를 가진 두 사람에게 추천을 위한 똑같은 "레시피"가 적용된 것입니다. 이는 베이비용 수프와 미식평론가를 위한 수프에 똑같은 양의 소금을 사용하는 셰프와 같은 상황입니다.
새로운 해결책: PRL-PUTS (똑똑하고 적응력 있는 수석 셰프)
이 논문은 사서 바로 옆에 서 있는 똑똑하고 적응력 있는 수석 셰프와 같은 새로운 시스템인 PRL-PUTS를 소개합니다.
- 사서를 재작성하지 않습니다: 주 사서 (랭커) 는 그대로 유지됩니다. PRL-PUTS 는 사서를 재학습시키거나 책을 읽는 방식을 바꾸려 하지 않습니다. 그저 그 위에 얹혀 있을 뿐입니다.
- 실시간으로 레시피를 조정합니다: 모든 방문객 요청마다 PRL-PUTS 는 맥락 (이 사람은 누구인가? 지금 무엇을 하고 있는가?) 을 살펴보고 즉시 결정합니다. *"이 특정 사용자에게는 '저장'을 조금 더 강조하자"*거나 *"이 사용자에게는 '관련 이미지'를 더 강조하자"*고요.
- 경험에서 배웁니다: 가중치를 추측하는 대신, PRL-PUTS 는 강화학습 에이전트입니다. 안전하고 통제된 방식으로 다양한 "레시피" (가중치 조합) 를 시도하고, 그 결과를 확인합니다 (사용자가 참여했는가?) 그리고 어떤 레시피가 어떤 유형의 사용자에게 가장 효과적인지 학습합니다.
"파레토 스캐닝" 트릭: 옵션 메뉴
추천 시스템을 관리하는 가장 어려운 부분 중 하나는 모든 것을 항상 이길 수 없다는 점입니다. "저장"을 너무 강력하게 밀어붙이면 "클릭"이 줄어들 수 있습니다.
이 논문은 파레토 스캐닝이라는 교묘한 거버넌스 도구를 소개합니다. 시스템이 단순히 하나의 최상위 레시피만 선택하는 것이 아니라, 전체 가능한 레시피 메뉴 (파레토 프론티어) 를 생성한다고 상상해 보세요.
- 레시피 A: 저장을 최대화하고, 클릭은 약간 낮춤.
- 레시피 B: 완벽한 균형.
- 레시피 C: 클릭을 최대화하고, 저장은 약간 낮춤.
비즈니스 리더 (이해관계자) 는 이 메뉴를 보고 *"오늘 우리의 목표는 저장을 늘리는 것이니 시스템을 레시피 A 로 전환하자"*고 말할 수 있습니다. 전체 AI 모델을 재학습하거나 새로운 업데이트를 몇 주 동안 기다릴 필요 없이, 단일 다이얼 ( 라는 매개변수) 을 돌리는 것만으로 즉시 이를 수행할 수 있습니다.
현실 세계 (핀터레스트 홈피드) 에서의 작동 방식
팀원들은 핀터레스트 홈피드 (사용자가 로그인했을 때 보는 메인 피드) 에서 이를 테스트했습니다.
- 속도: 사용자가 지연을 느끼지 않을 정도로 매우 빠르게 실행됩니다. 음식이 이미 접시에 담겨 있는 동안 웨이터가 셰프에게 속삭여 조언하는 것과 같습니다.
- 안전성: 시스템에 오류가 발생하면 즉시 이전의 안전한 수동 가중치로 돌아갑니다.
- 결과: 특정 사용자를 위해 "저장"을 선호하도록 다이얼을 돌렸을 때, "성공적인 세션" (사용자가 실제로 긍정적인 행동을 한 세션) 이 0.13% 증가했습니다. 이는 작게 들릴 수 있지만, 수백만 명의 사용자가 있는 플랫폼에서는 엄청난 성과입니다.
핵심 교훈
이 논문은 추천 엔진을 완전히 재건하지 않아도 더 똑똑하게 만들 수 있음을 증명합니다. 각 사용자마다 "레시피"를 개인화하고 관리자에게 트레이드오프 옵션 메뉴를 제공하는 작은 스마트 레이어를 추가함으로써 더 나은 결과를 얻고, 비즈니스 변화에 더 빠르게 적응하며, 시스템을 안정적으로 유지할 수 있습니다.
간단히 말해: PRL-PUTS 는 경직된 전역 규칙집을 시스템과 사용자 간의 유연하고 개인화된 대화로 바꾸며, 비즈니스 리더가 우선순위를 변경할 때마다 돌릴 수 있는 간단한 다이얼로 관리됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.