Predicting Custom-Feed Returns for New Bluesky Posts: A Prospective Study
이 논문은 새로 게시된 Bluesky 포스트가 특정 커스텀 피드에 나타날지 여부를 예측하는 새로운 콜드 스타트 라우팅 태스크를 소개하며, 대규모 벤치마크 데이터셋을 제시하고 새로운 콘텐츠를 반환할 가능성이 높은 피드를 순위 매기는 데 있어 LambdaRank가 우수한 성능을 달성함을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 사람들이 자신의 생각, 농담, 뉴스를 동시에 외쳐대는 거대하고 북적이는 마을 광장이라고 상상해 보세요. 이 혼란스러운 광장에는 사람들이 운영하는 수천 개의 서로 다른 "클럽" 또는 "뉴스 가판대"(커스텀 피드라고 불림)가 있습니다. 각 클럽은 광장의 외침 중 어떤 것이 게시판에 올릴 만큼 흥미로운지를 결정하는 자신만의 규칙 책을 가지고 있습니다. 보통 새로운 사람이 클럽에 가입하면, 클럽은 그에게 친구를 추천하기 위해 그가 누구인지 알아야 합니다. 하지만 여기에는 반전이 있습니다. 이 특정 마을에서는, 새로운 "외침"(포스트)들이 아직 역사가 없는 것들, 즉 "콜드 스타트(cold starts)"입니다. 여기서 핵심적인 질문은 다음과 같습니다: 어떤 포스트가 아직 아무에게도 보이지 않은 상태에서, 어떤 클럽이 그 포스트를 자신의 게시판에 올리고 싶어 할지 어떻게 미리 짐작할 수 있을까요? 이것이 바로 "콜드 스타트 라우팅(cold-start routing)"의 퍼즐입니다. 이는 마치 당신이 글의 마지막 마침표를 찍는 순간, 당신이 쓴 이야지를 어떤 특정 잡지 편집자가 좋아할지 데이터 없이 예측해야 하는 것과 같습니다.
이 논문은 커스텀 피드가 주요 기능인 소셜 미디어 플랫폼 블루스카이(Bluesky)를 대상으로 바로 그 문제를 다룹니다. 연구자들인 이펭 왕(Yipeng Wang)과 모힛 싱할(Mohit Singhal)은 일종의 초스마트한 매치메이커 역할을 하는 시스템을 구축하고자 했습니다. 그들의 목표는 새로운 포스트를 받자마자, 해당 포스트가 24시간 이내에 어떤 피드의 상위 결과에 나타날지(반환될지) 예측하여 수천 개의 잠재적 피드를 즉시 순위 매기는 것이었습니다.
이를 위해 그들은 단순히 추측하는 대신, 거대한 시간 여행 실험을 구축했습니다. 그들은 5,000개의 서로 다른 피드로 구성된 "모니터링 패널"을 설정하고 일주일 동안 관찰했습니다. 그들은 1,780만 4,000개의 공개 포스트를 수집했습니다. 각 포스트에 대해, 그들은 실제로 24시간 이내에 어떤 피드의 상위 50개 결과에 나타나는지 지켜보았습니다. 만약 나타났다면, 그것을 "히트(hit)"로 표시했습니다. 이를 통해 그들은 186만 5,000개의 관찰 가능한 포스트와 피드 간의 연결 고리를 만들어냈습니다. 그들은 이를 "먼저 수집하고, 나중에 라벨링하는(collect-first, label-later)" 접근 방식이라고 부르는데, 이는 데이터를 먼저 수집한 뒤 미래가 실제로 일어난 후에야 성공 또는 실패로 라벨을 붙임으로써, 예측이 단순한 추측이 아닌 실제 결과에 의해 검증되도록 보장했기 때문입니다.
연구팀은 이 매칭 게임을 해결하기 위해 여러 가지 서로 다른 컴퓨터 두뇌를 시도했습니다. 그들은 "작가가 보통 이 피드에 글을 올리는가?" 또는 "텍스트가 이 피드가 좋아하는 것과 유사한가?"와 같은 단순한 규칙부터 시작했습니다. 이러한 단순한 방법들은 괜찮았지만, 아주 뛰어나지는 않았습니다. 그다음, 그들은 단어뿐만 아니라 텍스트의 의미를 이해할 수 있는 더 복잡한 모델들을 시도했습니다. 경쟁의 승자는 **람다랭크(LambdaRank)**라고 불리는 모델이었습니다.
다음은 그 결과가 얼마나 잘 작동했는지를 보여주는 숫자들입니다. 연구진은 두 개의 별도 데이터 날짜를 대상으로 시스템을 테스트했습니다. 테스트한 모든 포스트 중에서, 실제로 적어도 하나의 피드에 의해 채택된 포스트들(전체의 약 9.04%)에 집중했습니다. 이 포스트들에 대해, 람다랭크 모델은 올바른 피드를 Top 10 리스트에 넣는 데 **73.61%**의 성공률(capped Recall@10이라는 지표)을 보였습니다. 또한 적절한 매치를 정렬하는 척도인 NDCG@10에서 0.6127을 기록했으며, "히트"(상위 10개 안에 적어도 하나의 올바른 피드를 찾는 것)를 기록한 비율은 **77.49%**였습니다.
이 논문은 모델이 매우 뛰어나지만 완벽하지는 않다고 제안합니다. 가장 큰 병목 현상은 랭킹을 매기는 '두뇌' 자체가 아니라, 첫 번째 단계인 '적절한 후보를 찾는 것'입니다. 설령 모델이 완벽하더라도, 애초에 그 피드를 살펴보지 않았다면 피드를 선택할 수 없습니다. 연구진은 자신들의 시스템이 전체 4,233개의 순위 매겨진 피드 중 최대 370개의 피드라는 작은 조각(후보 집합)만을 살펴본다는 것을 발견했습니다. 만약 모든 가능한 피드를 살펴볼 수 있었다면, 시스템은 이론적 "천장"인 0.8448에 도달하여 훨씬 더 높은 성능을 낼 수 있었을 것입니다. 이는 다음 단계의 과제가 반드시 더 똑똑한 두뇌를 만드는 것이 아니라, 검색의 폭을 넓히는 데 있음을 의미합니다.
요약하자면, 이 논문은 포스트가 과거의 이력을 갖기도 전에, 어떤 커스텀 피드가 그 포스트를 선택할지 성공적으로 예측할 수 있음을 증명합니다. 이는 단순한 텍스트 매칭과 의미에 대한 깊은 이해를 결합함으로써 새로운 콘텐츠를 적절한 곳으로 보낼 수 있음을 보여줍니다. 그러나 또한 우리는 현재 한 번에 확인할 수 있는 피드의 수에 의해 제한되어 있다는 점을 경고합니다. 이 시스템은 강력한 시작이지만, 여전히 성장할 여지가 남아 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.