← 최신 논문
🤖 machine learning

A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems

본 논문은 핀터레스트 홈피드의 다목적 최적화 균형을 동적으로 조정하여 Pareto 스캐닝을 통해 개인화된 유틸리티 가중치 튜닝을 자동화하는 생산 준비 완료형 랭커 독립 강화 학습 프레임워크인 PRL-PUTS 를 소개하며, 이는 서빙 지연을 추가하지 않고도 상당한 참여도 개선을 이끌어냅니다.

원저자: Yichu Zhou, Mehdi Ben Ayed, Lin Yang, Jiacong He, Andreanne Lemay, Jiaye Wang, Jaewon Yang, Josie Zeng, Dhruvil Deven Badani, Yijie Dylan Wang, Jiajing Xu, Charles Rosenberg

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yichu Zhou, Mehdi Ben Ayed, Lin Yang, Jiacong He, Andreanne Lemay, Jiaye Wang, Jaewon Yang, Josie Zeng, Dhruvil Deven Badani, Yijie Dylan Wang, Jiajing Xu, Charles Rosenberg

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핀터레스트를 상상해 보세요. 수백만 권의 책 (핀) 이 방문객들에게 끊임없이 추천되는 거대하고 활기찬 도서관입니다. 이 도서관에는 매우 똑똑한 사서 (랭커) 가 있어 모든 책을 살펴보고 다양한 기준에 따라 특정 방문객이 그 책을 얼마나 좋아할지 예측합니다. "이 책을 클릭할까요?", "보드에 저장할까요?", "관련 이미지를 볼까요?"

구식 방식: "일률 적용" 규칙집

과거 도서관 관리자들은 이러한 예측들을 어떻게 하나의 점수로 결합하여 어떤 책을 먼저 보여줄지 결정해야 했습니다. 그들은 간단한 공식을 사용했습니다.

총점 = (클릭 × 가중치 A) + (저장 × 가중치 B)

문제는 가중치 A 와 B 가 수동으로 설정되었다는 점입니다. 관리자들이 더 많은 저장을 원한다면 가중치 B 를 수동으로 높였습니다. 하지만 이는 느리고 경직되었으며, 모든 사람에게 똑같은 규칙을 적용했습니다. 파티 아이디어를 찾는 십대나 홈데코를 찾는 전문가나, 전혀 다른 필요를 가진 두 사람에게 추천을 위한 똑같은 "레시피"가 적용된 것입니다. 이는 베이비용 수프와 미식평론가를 위한 수프에 똑같은 양의 소금을 사용하는 셰프와 같은 상황입니다.

새로운 해결책: PRL-PUTS (똑똑하고 적응력 있는 수석 셰프)

이 논문은 사서 바로 옆에 서 있는 똑똑하고 적응력 있는 수석 셰프와 같은 새로운 시스템인 PRL-PUTS를 소개합니다.

  1. 사서를 재작성하지 않습니다: 주 사서 (랭커) 는 그대로 유지됩니다. PRL-PUTS 는 사서를 재학습시키거나 책을 읽는 방식을 바꾸려 하지 않습니다. 그저 그 위에 얹혀 있을 뿐입니다.
  2. 실시간으로 레시피를 조정합니다: 모든 방문객 요청마다 PRL-PUTS 는 맥락 (이 사람은 누구인가? 지금 무엇을 하고 있는가?) 을 살펴보고 즉시 결정합니다. *"이 특정 사용자에게는 '저장'을 조금 더 강조하자"*거나 *"이 사용자에게는 '관련 이미지'를 더 강조하자"*고요.
  3. 경험에서 배웁니다: 가중치를 추측하는 대신, PRL-PUTS 는 강화학습 에이전트입니다. 안전하고 통제된 방식으로 다양한 "레시피" (가중치 조합) 를 시도하고, 그 결과를 확인합니다 (사용자가 참여했는가?) 그리고 어떤 레시피가 어떤 유형의 사용자에게 가장 효과적인지 학습합니다.

"파레토 스캐닝" 트릭: 옵션 메뉴

추천 시스템을 관리하는 가장 어려운 부분 중 하나는 모든 것을 항상 이길 수 없다는 점입니다. "저장"을 너무 강력하게 밀어붙이면 "클릭"이 줄어들 수 있습니다.

이 논문은 파레토 스캐닝이라는 교묘한 거버넌스 도구를 소개합니다. 시스템이 단순히 하나의 최상위 레시피만 선택하는 것이 아니라, 전체 가능한 레시피 메뉴 (파레토 프론티어) 를 생성한다고 상상해 보세요.

  • 레시피 A: 저장을 최대화하고, 클릭은 약간 낮춤.
  • 레시피 B: 완벽한 균형.
  • 레시피 C: 클릭을 최대화하고, 저장은 약간 낮춤.

비즈니스 리더 (이해관계자) 는 이 메뉴를 보고 *"오늘 우리의 목표는 저장을 늘리는 것이니 시스템을 레시피 A 로 전환하자"*고 말할 수 있습니다. 전체 AI 모델을 재학습하거나 새로운 업데이트를 몇 주 동안 기다릴 필요 없이, 단일 다이얼 ( α\alpha 라는 매개변수) 을 돌리는 것만으로 즉시 이를 수행할 수 있습니다.

현실 세계 (핀터레스트 홈피드) 에서의 작동 방식

팀원들은 핀터레스트 홈피드 (사용자가 로그인했을 때 보는 메인 피드) 에서 이를 테스트했습니다.

  • 속도: 사용자가 지연을 느끼지 않을 정도로 매우 빠르게 실행됩니다. 음식이 이미 접시에 담겨 있는 동안 웨이터가 셰프에게 속삭여 조언하는 것과 같습니다.
  • 안전성: 시스템에 오류가 발생하면 즉시 이전의 안전한 수동 가중치로 돌아갑니다.
  • 결과: 특정 사용자를 위해 "저장"을 선호하도록 다이얼을 돌렸을 때, "성공적인 세션" (사용자가 실제로 긍정적인 행동을 한 세션) 이 0.13% 증가했습니다. 이는 작게 들릴 수 있지만, 수백만 명의 사용자가 있는 플랫폼에서는 엄청난 성과입니다.

핵심 교훈

이 논문은 추천 엔진을 완전히 재건하지 않아도 더 똑똑하게 만들 수 있음을 증명합니다. 각 사용자마다 "레시피"를 개인화하고 관리자에게 트레이드오프 옵션 메뉴를 제공하는 작은 스마트 레이어를 추가함으로써 더 나은 결과를 얻고, 비즈니스 변화에 더 빠르게 적응하며, 시스템을 안정적으로 유지할 수 있습니다.

간단히 말해: PRL-PUTS 는 경직된 전역 규칙집을 시스템과 사용자 간의 유연하고 개인화된 대화로 바꾸며, 비즈니스 리더가 우선순위를 변경할 때마다 돌릴 수 있는 간단한 다이얼로 관리됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →