Don't Contrast the Impossible: Region-Constrained Batching for Contrastive User Modeling on a Local Community Platform
본 논문은 로컬 커뮤니티 플랫폼을 위해 지리적으로 불가능한 네거티브 샘플을 실행 가능한 샘플로 대체하여 대조적 사용자 모델링을 개선함으로써, 실제 운영 환경에서의 추천 및 광고 성능을 향상시키는 새로운 배칭 방법인 지역 제약 배치 샘플링(Region-Constrained Batch Sampling, RCBS)을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 사람들이 무엇을 좋아하는지 이해하는 법을 가르치려 한다고 상상해 보세요. 컴퓨터 과학의 세계에서 이것은 "추천 시스템(recommender systems)"이라고 불리며, 로봇의 두뇌는 "대조 학습(contrastive learning)"이라는 기술을 사용하여 구축됩니다. 이것은 마치 "틀린 그림 찾기" 게임과 같습니다. 로봇에게 사용자가 클릭한 것(하나의 "포지티브")을 보여준 다음, 사용자가 클릭하지 않은 다른 사진들(여러 개의 "네거티브")을 보여주는 것입니다. 로봇은 "아, 사용자는 이것은 좋아하지만 저것들은 좋아하지 않는구나"라는 것을 깨달으며 배웁니다.
이 게임이 잘 작동하려면, 로봇에게 보여주는 "네거티브" 사진들은 사용자가 볼 수 있었지만 단순히 무시한 것들이어야 합니다. 만약 사막 한가운데 사는 사람에게 펭귄 사진을 보여준다면, 그 사람은 펭귄을 본 적도 없으므로 로봇은 아무것도 배울 수 없습니다. 사용자가 펭귄을 무시한 이유는 그것을 싫어해서가 아니라, 애초에 그것을 보는 것이 불가능했기 때문입니다. 이 논문은 게임의 규칙이 누가 무엇을 볼 수 있는지에 대해 엄격한 제한을 두는 특정 문제를 다룹니다. 그리고 로봇이 불가능한 것들을 보여줌으로써 혼란을 겪고 있는 상황을 해결합니다.
문제점: 불가능한 선택지로 로봇을 가르치기
당근마켓(한국의 인기 있는 지역 기반 중고 거래 앱)과 같은 지역 커뮤니티 앱에서는 게임의 규칙이 아마존과 같은 글로벌 스토어와는 매우 다릅니다. 당근마켓에서는 당신 근처에 있는 아이템만 볼 수 있습니다. 예를 들어, 당신이 서울에 산다면 부산에서 판매 중인 자전거는 아무리 멋진 자전거라 할지라도 당신에게 보이지 않을 것입니다. 이 앱은 거리가 마치 벽처럼 작용하도록 설계되어 있습니다. 벽 너머의 아이템은 당신에게 아예 보이지 않습니다.
연구진은 기존의 로봇 훈련 방식이 큰 실수를 저지르고 있다는 것을 발견했습니다. 로봇은 "미니 배치(mini-batches)"를 사용하여 훈련되고 있었는데, 이는 사용자들과 아이템들을 무작위로 섞어 만든 작은 그룹을 의미합니다. 이 섞는 과정이 무작위였기 때문에, 로봇은 종종 특정 사용자에게 물리적으로 보여주는 것이 불가능한 아이템을 보여주게 되었습니다. 예를 들어, 특정 동네에 사는 사용자에게 50km 떨어진 다른 동네의 아이템을 보여줄 수도 있는 것입니다.
논문에서는 이를 "불가능한 네거티브(impossible negatives)"라고 부릅니다. 로봇이 사용자가 볼 수 없었던 아이템을 무시하는 것을 볼 때, 로봇은 "좋아, 이 사용자는 확실히 이 아이템을 싫어하는구나!"라고 생각합니다. 하지만 이것은 틀렸습니다. 사용자는 그것을 싫어한 것이 아니라, 단지 볼 수 없었을 뿐입니다. 이것은 마치 학생이 배우지 못한 언어로 쓰인 질문에 답하지 않았다고 해서 선생님이 학생을 꾸짖는 것과 같습니다. 논문은 이러한 "불가능한" 선택지들로 훈련 게임을 채우는 것이 로봇의 학습을 희석시켜, 사람들이 실제로 무엇을 원하는지 맞히는 능력을 떨어뜨린다고 주장합니다.
해결책: "같은 동네" 규칙
이를 해결하기 위해, 저자인 한승호, 김병창, 유진은 **지역 제약 배치 샘플링(Region-Constrained Batch Sampling, RCBS)**이라는 새로운 방식의 훈련 게임 조직법을 제안했습니다.
모두를 하나의 큰 통에 무작위로 던져 넣는 대신, RCBS는 엄격한 동네 파수꾼 역할을 합니다. 로봇을 훈련시키기 위해 사용자 그룹을 만들 때, 이들은 같은 지역(또는 매우 가까운 지역)에 사는 사용자들만 선택합니다. 그룹 내의 모든 사람이 근처에 살기 때문에, 그 그룹에서 보여지는 모든 아이템은 이론적으로 그 그룹 내의 누구라도 볼 수 있는 것들입니다.
이 단순한 변화는 강력한 효과를 가져옵니다. 이제 로봇이 사용자가 아이템을 무시하는 것을 볼 때, 로봇은 사용자가 그 아이템을 실제로 볼 수 있었다는 사실을 확신할 수 있습니다. 만약 그럼에도 클릭하지 않았다면, 그것은 정말로 관심이 없다는 신호입니다. 이를 "실현 가능한 네거티브(feasible negatives)"라고 부릅니다. 논문은 이러한 "실현 가능한" 선택지들이 쉬운 "불가능한" 선택지들보다 로봇이 학습하기에 더 어렵고 정보 가치가 높다고 제안합니다. 이는 로봇의 훈련 수준을 "잠긴 상자 안에 무엇이 있는지 추측하기"에서 "눈앞에 있는 상자 안에 무엇이 있는지 추측하기"로 업그레이드하는 것과 같습니다.
결과: 더 나은 로봇
연구팀은 두 가지 방식으로 이 아이디어를 테스트했습니다. 첫째는 시뮬레이션을 통한 오프라인 테스트(연습 경기와 같은 방식)였고, 둘째는 실제 앱의 실제 사용자들을 대상으로 한 라이브 A/B 테스트였습니다.
시뮬레이션에서 그들은 훈련 그룹 내에 "불가능한" 선택지가 얼마나 포함되어 있는지 측정했습니다. 기존의 무작위 방식으로는 무려 **98%**의 네거티브 선택지가 사용자가 볼 수 없는 불가능한 것들이었습니다. 하지만 새로운 RCBS 방식을 통해 이 숫자를 **30%**까지 낮출 수 있었습니다.
결과는 명확했습니다. 새로운 "동네 규칙"으로 훈련된 로봇은 사용자를 이해하는 능력이 훨씬 뛰어났습니다.
- 오프라인 테스트: 새로운 로봇은 기존 로봇과 비교했을 때 홈 피드 검색 능력은 약 7.56%, 광고 순위 결정 능력은 약 4.61% 향상되었습니다.
- 라이브 테스트: 이 새로운 로봇을 실제 앱에 적용했을 때 결과는 더욱 흥미로웠습니다. 홈 피드 클릭 수가 10.0% 증가했고, 피드를 보는 사람들의 수(노출 수)는 5.12% 증가했습니다. 광고 또한 클릭률이 7.46% 상승하며 더 좋은 성과를 보였습니다.
핵의 요점
논문은 지역 기반 커뮤니티 플랫폼의 경우, 사용자들과 아이템들을 단순히 무작위로 섞어서는 안 된다고 결론짓습니다. 반드시 지리적 요건을 존중해야 합니다. 사용자가 실제로 볼 수 있는 것들로부터만 학습하도록 보장함으로써, 로봇은 훨씬 더 빠르고 똑똑하게 배울 수 있습니다. 저자들은 이미 이 새로운 방식을 당근마켓에 도입했으며, 현재 이 방식은 수백만 명의 사용자들이 자신의 동네에서 실제로 원하는 것을 찾도록 돕고 있습니다. 그들은 이것이 큰 진전이지만, 향후 이러한 "동네" 규칙을 더 미세하게 조정할 수 있는 방법이 더 있을 것이라고 제안하면서도, 현재로서는 "불가능한 것과 대조하지 마라"는 단순한 해결책이 승리임을 입증했다고 밝혔습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.