← 최신 논문
🤖 machine learning

PinEqualizer: Full Funnel Content Exploration and Debiasing System at Pinterest

이 논문은 검색 및 추천 인터페이스 전반에서 신선한 콘텐츠 발견과 사용자 참여 사이의 균형을 맞춤으로써 콜드 스타트 문제를 해결하고, 단기 및 장기적 영향을 검증하기 위한 확장 가능한 프레임워크를 활용하여 핀터레스트(Pinterest)에 배포된 풀 퍼널(full-funnel) 콘텐츠 탐색 및 디바이아싱(debiasing) 시스템인 PinEqualizer를 소개한다.

원저자: Olafur Gudmundsson, Bo Zhao, Huayi Liao, Anna Kiyantseva, Sai Xiao, Heath Vinicombe, Mostafa Keikha, Luke DeLuccia, Zihao Chen, Junpeng Hou, Weijie Jiang, Bhawna Juneja, Andreanne Lemay, Wei-Ting Lin
게시일 2026-07-27
📖 6 분 읽기🧠 심층 분석

원저자: Olafur Gudmundsson, Bo Zhao, Huayi Liao, Anna Kiyantseva, Sai Xiao, Heath Vinicombe, Mostafa Keikha, Luke DeLuccia, Zihao Chen, Junpeng Hou, Weijie Jiang, Bhawna Juneja, Andreanne Lemay, Wei-Ting Lin, Keyvan Moghadam, Jiaxing Qu, Zhiqing Rao, Zhihua Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 끝없이 펼쳐진 거대한 도서관에 들어갔다고 상상해 보세요. 그곳의 선반에는 끊임없이 새로운 책들이 채워지고 있습니다. 이 도서관의 사서들은 사실 매우 똑똑한 컴퓨터 프로그램들인데, 그들의 임포는 바로 지금 당신에게 읽기에 완벽한 책을 건네주는 것입니다. 하지만 여기에는 함정이 있습니다. 사서들에게는 나쁜 버릇이 하나 있습니다. 그들은 이미 수백만 번 보았던 오래된 책들을 너무나 좋아합니다. 그 책들이 얼마나 인기가 있는지 정확히 알고 있기 때문에, 계속해서 그 오래된 인기작들을 당신의 손에 쥐여줍니다. 반면, 아직 아무도 읽지 않은 아주 새로운 책들은 저 뒤편에서 먼지만 쌓인 채 방치되어 있습니다. 이것이 바로 "콜드 스타트(cold-start)"라고 불리는 문제입니다. 만약 새로운 책이 읽힐 기회를 전혀 얻지 못한다면, 사서들은 그 책이 정말 좋은지 배울 수 없게 되고, 결국 그 책을 추천하지 않게 됩니다. 도서관은 결국 똑같은 옛날 이야기들만 반복되는 지루한 루프에 빠지게 되며, 흥미로운 새로운 목소리들은 빛을 볼 기회조차 얻지 못하게 됩니다.

이 논문은 바로 이 문제를 해결하기 위해 노력한 핀터레스트(Pinterest)의 엔지니어 팀에 관한 이야기입니다. 그들은 "핀이퀄라이저(PinEqualizer)"라는 새로운 시스템을 구축하여, 컴퓨터 사서들이 오래된 유명 콘텐츠에 편향되는 습관을 버리고 신선하고 새로운 콘텐츠에 공정한 기회를 줄 수 있도록 도왔습니다. 그들은 단순히 프로세스의 한 부분만을 미세하게 조정한 것이 아니라, 어떤 새로운 책을 살펴볼지 결정하는 단계부터, 그 책들을 찾아내는 방식, 그리고 어떤 것을 당신에게 보여줄지 결정하는 단계에 이르기까지 전체 파이프라인을 전면적으로 개편했습니다. 그들의 목표는 새로운 콘텐츠가 스스로를 증명할 수 있는 공정한 기회를 갖도록 만드는 것이었으며, 이를 통해 독자들이 더 즐거워하고 훨씬 더 건강하며 다양한 도서관을 만들 수 있다는 것을 발견했습니다.

문제점: "부자가 더 부자가 되는" 도서관

핀터레스트는 '핀(Pin)'이라고 불리는 수천억 개의 고유한 아이템이 존재하는 거대한 시각적 발견 엔진과 같습니다. 매일 수백만 개의 새로운 핀이 업로드됩니다. 시스템의 역할은 이러한 핀들을 그것을 좋아할 만한 사용자들과 연결해 주는 것입니다. 하지만 여기에는 교묘한 함정이 있습니다. 시스템은 과거로부터 학습한다는 점입니다. 만약 어떤 핀이 과거에 클릭이 많이 되었다면, 시스템은 "이것은 훌륭해!"라고 생각하며 더 많은 사람에게 보여줍니다. 반면, 새로운 핀은 이력이 없기 때문에 시스템은 그것이 좋은지 알 수 없어 보여주기를 주저합니다.

이것은 "부자가 더 부자가 되는(rich-get-richer)" 효과를 만들어냅니다. 인기 있는 오래된 콘텐츠는 더욱 유명해지는 반면, 새롭고 신선한 콘텐츠는 묻혀버립니다. 시간이 흐르면서 이는 생태계 전체에 해를 끼칩니다. 새로운 크리에이터들은 성장할 수 없고, 사용자들은 흥미로운 새로운 것들을 보는 것을 멈추게 됩니다. 엔지니어들은 단순히 "탐색(exploration, 새로운 것을 무작위로 보여주는 것)"을 하는 것만으로는 충분하지 않다는 것을 깨달았습니다. 그들은 컴퓨터가 긴 이력 없이도 새로운 콘텐츠가 얼마나 좋을지 예측할 수 있도록, 시스템 내부 깊숙한 곳의 편향성을 수정해야 했습니다.

해결책: 핀이퀄라이저 (PinEqualizer)

팀은 콘텐츠가 사용자에게 전달되는 전체 "깔때기(funnel)" 과정에서 작동하는 핀이퀄라이저라는 새로운 시스템을 구축했습니다. 이 깔때기를 핀이 미끄럼틀을 타는 과정이라고 생각해보세요. 핀은 사용자의 화면에 도달하기 위해 몇 가지 단계를 거쳐야 합니다:

  1. 코퍼스 선택 (Corpus Selection): 어떤 새로운 핀들을 후보군으로 유지할지 결정하는 단계.
  2. 리트리벌 (Retrieval, 검색/추출): 특정 사용자를 위한 적절한 핀들을 찾는 단계.
  3. 랭킹 (Ranking, 순위 매기기): 어떤 순서로 보여줄지 결정하는 단계.

핀이퀄라이저는 이 미끄럼틀의 모든 단계에 특별한 도구들을 추가하여, 새로운 콘텐츠가 바닥에 갇히지 않도록 만듭니다.

1. 최고의 신인 선발하기 (코퍼스 선택)
모든 새로운 핀을 일일이 확인하기에는 너무 많기 때문에, 시스템은 "톰슨 샘플링(Thompson Sampling)"이라는 스마트한 추측 게임을 사용합니다. 미스터리 박스가 가득 든 가방을 상상해 보세요. 어떤 상자는 안에 장난감이 들어있을 확률이 높고, 어떤 상자는 낮습니다. 모든 상자를 다 열어보는 대신, 시스템은 크리에이터에 대해 알고 있는 정보와 약간의 운을 조합하여 가장 좋을 것 같은 상자들을 골라냅니다. 또한, 시스템이 즉시 오래된 유명 핀들과 경쟁하지 않아도 되도록 신선한 콘텐츠만을 위한 특별한 "탐색 라이브러리"를 구축했습니다.

2. 딱 맞는 짝 찾기 (리트리벌)
좋은 새로운 핀들의 풀(pool)이 모이면, 이제 시스템은 당신에게 맞는 핀을 찾아야 합니다. 보통 시스템은 핀들이 서로 어떻게 연결되어 있는지(마치 친구 관계의 네트워크처럼)를 봅니다. 하지만 새로운 핀들은 아직 친구가 별로 없습니다! 그래서 엔지니어들은 시스템이 "콘텐츠 기반"의 단서들을 사용하도록 가르쳤습니다. 그들은 단순히 누가 이 핀을 저장했는지를 보는 대신, 고급 AI를 사용하여 사진이 실제로 어떻게 생겼는지(시각 언어 모델 등을 활용하여) 이해하도록 했습니다. 또한, 아직 인기가 없더라도 새로운 핀들이 미끄럼틀을 타고 내려올 수 있도록 꾸준한 흐로를 보장하는 "전용 채널"을 만들었습니다.

3. 최종 결정 (랭킹)
이 부분이 가장 중요합니다. 시스템이 당신에게 보여줄 최종 리스트를 선택할 때, 대개 과거 데이터에 크게 의존합니다. 만약 어떤 핀이 과거 데이터가 없다면, 시스템은 종종 낮은 점수를 줍니다. 핀이퀄라이저는 다음과 같은 방법으로 이를 해결합니다:

  • AI에게 과거를 무시하도록 가르치기: 그들은 훈련 중에 "인기도" 수치를 무작위로 숨기는 "드롭아웃(dropout)"이라는 기술을 사용했습니다. 이를 통해 AI가 단순히 명성(fame)이 아니라 실제 콘텐츠(사진과 설명)를 바탕으로 핀을 판단하는 법을 배우게 합니다.
  • 자신감 부여하기: 그들은 새로운 아이템에 "보너스" 점수를 추가했습니다. 이는 "아직 이게 좋은지 모르겠지만, 일단 볼 기회를 주자"라고 말하는 것과 같습니다. 이는 아직 많이 노출되지 않은 아이템에 약간의 흥미를 더해주는 UCB(Upper Confidence Bound)라는 방법을 통해 이루어집니다.
  • 점수 보정하기: 시스템이 단지 새롭다는 이유만으로 새로운 콘텐츠에 불공평하게 불이익을 주지 않도록 했습니다. 수학적 계산을 조정하여, 잠재력이 큰 새로운 핀이 오래된 유명 핀과 동일한 기회를 얻을 수 있도록 했습니다.

성공 측정 방법

"이것이 실제로 효과가 있는지 어떻게 알 수 있을까요?"라고 물을 수 있습니다. 단순히 사람들에게 새로운 것을 보여주기만 하면, 사람들이 아직 새로운 것에 익나 익숙하지 않아 처음에는 클릭을 덜 할 수도 있습니다. 이것이 "장기적인 이득을 위한 단기적인 고통" 문제입니다.

이를 해결하기 위해 팀은 특별한 측정 프레임워크를 구축했습니다:

  • "홀드아웃(Holdout)" 테스트: 한 그룹의 사용자에게는 오직 오래된 콘텐츠만 보여주고(새로운 것 제외), 다른 그룹에게는 새로운 탐색 콘텐츠를 보여주는 장기 실험을 진행했습니다. 그 결과, 새로운 콘텐츠를 보는 그룹이 장기적인 참여도(engagement) 측면에서 훨씬 더 나은 결과를 보였습니다. 이는 새로운 콘텐츠가 비록 발견되는 데 시간이 걸릴지라도, 실제로 가치 있는 것임을 입증했습니다.
  • "졸업(Graduation)" 지표: 그들은 "졸업" 지점을 정의했습니다. 새로운 핀이 일정 기간 내에 충분한 긍정적 상호작용(좋아요, 저장 등)을 얻으면, 미스터리 상태에서 알려진 존재로 "졸업"하게 됩니다. 그들은 얼마나 많은 핀이 성공적으로 졸업하는지를 추적했습니다.
  • "저탐색(Under-Explored)" 지표: 아직 많이 노출되지 않은 콘텐츠로부터 얼마나 많은 참여를 얻고 있는지 측정했습니다. 이를 통해 그들의 변화가 새로운 콘텐츠를 주목받게 하는 데 실제로 도움이 되었는지 확인할 수 있었습니다.

결과

결과는 인상적이었습니다. 핀이퀄라이저를 배포한 후, 핀터레스트는 신선한 콘텐츠 노출량이 350% 증가하는 것을 목격했습니다. 이는 사용자들이 이전보다 훨씬 더 많은 새로운 핀을 보고 있음을 의미합니다.

  • 사용자 참여: 이 시스템은 북미 지역에서 성공적인 세션(successful sessions)을 24% 증가시켰고, 해외 지역에서는 49% 증가시켰습니다.
  • 쇼핑: 쇼핑 분야에서의 영향은 엄청났습니다. 북미 지역의 쇼핑 세션이 63% 증가했는데, 이는 새로운 제품들이 마침내 마땅히 받아야 할 관심을 받고 있음을 시사합니다.
  • 크리에이터의 건강: 시스템은 더 많은 크리에이터가 성공하도록 도왔습니다. "성공적인 콘텐츠 제공자"(콘텐츠가 상당한 주목을 받은 크리에이터)의 수가 전년 대비 99% 급증했습니다.

왜 중요한가

이 논문은 사용자가 지금 당히 좋아하는 것을 보여주는 것과, 미래에 좋아할 수도 있는 것을 보여주는 것 사이에서 선택할 필요가 없다는 것을 보여줍니다. 시스템의 두뇌 속에 있는 편향성을 수정함으로써, 두 가지를 모두 할 수 있습니다. 엔지니어들은 후보를 잘 뽑고, 더 잘 찾고, 공정하게 순위를 매기는 등 모든 단계에서 작고 스마트한 변화를 주는 것만으로도 "부자가 더 부자가 되는" 순환을 끊을 수 있다는 것을 발견했습니다.

또한, 시스템의 한 부분만 고쳐서는 안 된다는 것도 배웠습니다. 만약 랭킹 단계는 고쳤지만 리트리벌 단계가 여전히 편향되어 있다면, 새로운 콘텐츠는 랭킹 단계에 도달조차 하지 못할 것입니다. 이는 멋진 새 책을 가지고 있지만 아무도 찾을 수 없도록 방 안에 가둬둔 것과 같습니다. 핀이퀄라이저는 전체 도서관의 문을 열었습니다.

결국, 이 시스템은 단순히 핀터레스트가 더 많은 새로운 핀을 보여주도록 도운 것이 아니라, 새로운 크리에이터들이 성장하고 사용자들이 더 넓고 흥미로운 콘텐츠의 세계를 발견할 수 있는 더 건강한 생태계를 만드는 데 도움을 주었습니다. 이 논문은 이러한 "풀 퍼널(full-funnel)" 접근 방식이 대규모 추천 시스템의 콜드 스타트 문제를 해결하는 강력한 방법임을 보여주며, 공정성과 정확성이 어떻게 공존할 수 있는지를 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →