Decomposing Staleness in Recommender Systems: A Dual-Filter Framework for Supersession and Decay
이 논문은 학습된 모델을 활용하여 아이템의 대체(supersession)를 감지하고 관련성 저하(relevance decay)를 예측함으로써, 구글 디스커버(Google Discover)에 배포되어 오래된 콘텐츠 보고를 54.9% 감소시키는 동시에 사용자 참여도와 시스템 효율성을 개선하는 데 성공한 이중 필터 프레임워크인 SDF를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
방대한, 끊임없이 변화하는 디지털 정보의 풍경 속에서, 관련성(relevance)은 덧없는 상품이다. 우리가 화면에서 보는 것을 큐레이션하는 엔진인 추천 시스템은 뉴스가 매시간 변하고, 새로운 전개 상황이 발생하는 즉시 이야기의 중요성이 사라질 수 있는 세상에서 작동한다. 이러한 시스템에 있어 콘텐츠는 단순히 오래된 것이 아니라, '식상해지는(stale)' 것이다. 이러한 식상함은 두 가지 뚜렷한 힘에서 비롯된다. 첫째, 새로운 업데이트가 기존의 서사를 반박하거나 완성함으로써 이전 버전을 사실적으로 불완전하거나 오해의 소지가 있게 만들어, 이야기가 갑작스럽게 대체될 수 있다. 둘째, 콘텐츠는 자연스러운 가치 하락을 겪을 수 있는데, 특정 이벤트에 대한 가이드나 시간 제한적인 팁은 새로운 이야기가 나타나든 아니든, 그 순간이 지나면 유용성을 잃는다. 이러한 시스템이 이러한 변화를 인식하지 못할 때, 시스템은 구식 자료를 계속 제공하여 사용자를 좌절시키고 더 이상 목적을 수행하지 못하는 정보로 피드를 어지럽힌다.
구글의 연구진들은 SDF라는 새로운 접근 방식을 통해 이 만연한 문제를 해결했다. SDF는 콘텐츠가 사용자의 화면에 도달하기 전에 식상한 콘텐츠를 식별하고 제거하도록 설계된 이중 필터 시스템이다. 매일 수억 명의 사람들이 사용하는 개인화된 피드인 구글 디스커버(Google Discover)에 배포된 이 시스템은, 단순히 정해진 일수가 지난 기사를 삭제하거나 클릭 횟수에 의존하는 과거의 투박한 방식들을 넘어선다. 대신, 연구팀은 정보의 생애 주기를 이해하기 위해 협력하는 두 개의 특화된 필터를 구축했다. 한 필터는 이야기 사이의 관계를 찾아내어 새로운 도착물이 기존의 것을 어떻게 무효화하는지 감지한다. 다른 필터는 콘텐츠 자체를 조사하여 시간이 지남에 따라 그 가치가 얼마나 빨리 사라질지 예측한다. 이 두 가지 관점을 결합함으로써, 이 시스템은 선제적인 문지기 역할을 수행하며, 신선하고 관련성 있으며 유용한 콘텐츠만이 랭킹을 매기고 표시되는 단계로 넘어갈 수 있도록 후보군인 기사들을 정리한다.
연구진이 다룬 첫 번째 과제는 새로운 이야기가 기존의 것을 구식으로 만드는 순간인 '대체(supersession)'였다. 이는 시간이 흐르는 문제가 아니라 서사의 진행 문제이다. 예를 들어, 공인이 의료 감독 하에 있다는 초기 보고는 그 인물의 사망을 확인하는 발표가 나오는 즉시 식상해진다. 이러한 순간을 포착하기 위해 연구팀은 기사 쌍을 비교하는 관계형 필터를 개발했다. 컴퓨터에게 이 기술을 가르치기 위해 수백만 개의 기사 쌍을 수동으로 라벨링하는 것은 불가능하기 때문에, 그들은 대규모 언어 모델(LLM)을 사용하여 합성 학습 데이터를 생성했다. 이 모델은 두 개의 기사를 읽고 새로운 것이 기존 것의 내용을 반박하거나 완성하는지를 판단하는 법을 배웠다. 이 대규모 모델로부터 얻은 지식은 실시간으로 이러한 판단을 내릴 수 있는 더 작고 빠른 학생 모델로 증류되었다. 이 필터는 최종 선거 결과가 전망치를 대체하거나 확정된 가격이 루머를 대체하는 경우와 같이, 새로운 업데이트가 이전 보고를 쓸모없게 만든 사례들을 성공적으로 식별해 냈다.
두 번째 과제는 특정 기회의 창이 닫힘에 따라 아이템의 가치가 자연스럽게 희미해지는 '관련성 쇠퇴(relevance decay)'였다. 유성우에 대한 가이드는 이벤트가 일어나는 밤에는 매우 유용하지만 다음 날 아침에는 무의미해지는 반면, 지역 축제에 대한 가이드는 며칠 동안 유용할 수 있다. 대체와 달리, 이러한 쇠퇴는 새로운 경쟁자에 의존하는 것이 아니라 콘텐츠 자체에 내재되어 있다. 이를 해결하기 위해 연구진은 아이템의 '트래픽 비율(traffic ratio)'을 예측하는 모델을 만들었다. 기사 내의 텍스트, 이미지, 영상을 분석함으로써, 모델은 해당 아이템의 전체 생애 트래픽 중 특정 미래 시점까지 얼마나 많은 양이 축적될지를 예측한다. 만약 모델이 아이템이 받을 수 있는 트래픽의 대부분을 이미 확보했다고 예측하면, 해당 아이템을 식상한 것으로 표시한다. 이를 통해 시스템은 이벤트 기간이 종료된 직후의 시간 제한적 가이드를 즉시 드롭할 수 있는 동시에, 건강 조언과 같은 상시 콘텐츠(evergreen content)는 훨씬 더 오래 유지할 수 있다.
이 시스템의 힘은 두 필터가 어떻게 함께 작동하는지에 있다. 이들은 독립적으로 작동하여 대체와 쇠퇴를 각각 별도로 체크한 뒤, 그 결과를 결합한다. 만약 어느 한 필터라도 아이템이 식상하다고 결정하면, 아이템은 무거운 계산 단계인 랭킹 프로세스에 도달하기 전에 후보 풀에서 제거된다. 이는 사용자가 보는 콘텐츠의 품질을 개선할 뿐만 아니라, 무시될 운명인 콘텐츠를 처리하는 데 드는 상당한 컴퓨팅 파워를 절약한다. 온라인 테스트에서 이 접근 방식은 매우 효과적임이 입증되었다. 이 시스템은 단순한 연령 제한이나 참여 임계값에 의존했던 기존 방식들에 비해 피드 내의 식상한 콘텐츠 발생을 유의미하게 줄였다. 이 이중 필터 프레임워크는 이전 시스템들이 놓쳤던 서로 다른 유형의 식상함을 잡아냈으며, 이 두 메커니즘을 별개의 문제로 다루는 것이 하나의 둔탁한 도구로 해결하려는 것보다 더 나은 결과를 낸다는 것을 보여주었다.
2년간의 실제 배포 기간 동안, 이 시스템의 영향은 사용자 피드백을 통해 측정되었다. 식상한 콘텐츠에 대해 불만을 제기하는 사용자 보고 건수가 절반 이상 감소하여, 사용자 경험이 크게 개선되었다. 구체적으로, 대체된 뉴스 이야기에 대한 보고는 거의 3분의 2 가까이 감소한 반면, 자연스럽게 관련성을 잃은 콘텐츠에 대한 불만은 약 3분의 1 정도 감소했다. 또한 시스템은 피드의 전반적인 건강 상태를 개선하여, 긍정적인 사용자 참여를 약간 증가시키고 주제의 다양성을 높였다. 시스템이 완벽하지 않아 미묘한 사례를 놓치거나 사용자가 이미 다른 곳에서 본 콘텐츠를 잘못 판단하는 경우가 간혹 발생하기도 하지만, 이는 복잡한 산업적 문제를 해결하는 견고하고 확장 가능한 솔루션을 나타낸다. 식상함이라는 개념을 관계적 요소와 내재적 요소로 분해함으로써, 연구진은 디지털 콘텐츠를 신선하게 유지하기 위한 새로운 패러다임을 구축했으며, 사용자에게 전달되는 정보가 단지 인기 있는 것뿐만 아니라 시의적절하고 정확하다는 것을 보장했다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.