Action-Aware Generative Sequence Modeling for Short Video Recommendation
본 논문은 단편 영상 추천에서 전통적인 이진 분류의 한계를 극복하기 위해 사용자 행동의 시간적 패턴을 활용하는 새로운 모델인 액션 인식 생성 시퀀스 네트워크 (A2Gen) 를 제안하며, 이는 쿠페이소우에서 수행한 광범위한 오프라인 및 대규모 온라인 A/B 테스트를 통해 시청 시간, 상호작용률, 사용자 유지율에서 상당한 개선을 이루었습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
휴대폰으로 짧은 동영상을 보고 있다고 상상해 보세요. 이 영상은 다양한 요소가 섞여 있습니다. 아마도 재미있는 농담, 진지한 뉴스 클립, 중독성 있는 노래, 그리고 갑자기 등장하는 광고가 포함될 수 있죠.
기존 방식 (만능 접근법)
전통적인 추천 시스템은 전체 동영상을 단일하고 단단한 치즈 덩어리처럼 취급합니다. 사용자가 동영상을 '좋아요'하면, 시스템은 그 안에 있는 모든 것을 좋아했다고 가정합니다.
- 문제점: 예를 들어, 게스트가 '메시'를 '호날두'보다 선택하는 인터뷰 영상이 있다고 가정해 봅시다. 당신이 메시를 사랑하기 때문에 그 순간 바로 동영상을 '좋아요'합니다. 하지만 영상의 나머지는 호날두의 하이라이트만 담겨 있습니다. 기존 시스템은 "아, 사용자가 동영상을 좋아했으니 호날두도 사랑하겠군!"이라고 생각하여 호날두 관련 영상을 계속 보여줍니다. 당신은 메시 부분만 좋아했는데 호날두 영상을 보게 되어 짜증이 납니다.
새로운 통찰 (타이밍이 모든 것을 결정한다)
이 논문의 저자들은 버튼을 클릭한 '시점'이 클릭 '여부'만큼이나 중요하다는 사실을 깨달았습니다.
- 유사성: 동영상을 영화 예고편이라고 생각해 보세요. 영웅이 위기를 구할 때 바로 박수를 치는 ('좋아요'를 누르는) 것은 그 특정 순간에 대한 반응입니다. 반면, 끝부분에서 박수를 치는 것은 단순히 예의일 뿐일 수 있습니다. 타이밍은 시스템에게 정확히 영상의 어느 부분이 당신을 기쁘게 했는지 알려줍니다.
- 발견: 수백만 개의 동영상을 분석한 결과, '좋아요'와 '팔로우'는 종종 특정 '피크'(하이라이트) 에서 발생한다는 것을 발견했습니다. 동영상을 다 보기 전에 크리에이터를 '팔로우'한다면, 이는 방금 본 특정 콘텐츠가 아니라 그 '사람'을 사랑한다는 의미입니다.
해결책: A2Gen (이야기꾼 모델)
이 논문은 A2Gen(Action-Aware Generative Sequence Network, 행동 인식 생성 시퀀스 네트워크) 이라는 새로운 모델을 소개합니다. A2Gen은 동영상을 좋아할지 추측하는 대신, 사용자가 동영상을 어떻게 시청할지 그 전체 이야기를 예측하려고 합니다.
다음은 이를 간단한 부분으로 나누어 설명한 작동 원리입니다:
맥락 인식 어텐션 모듈 (CAM) – "현명한 독자"
단순히 단어를 읽는 것이 아니라 방의 분위기를 이해하는 독자를 상상해 보세요. CAM 은 사용자의 과거 행동과 특정 동영상 콘텐츠를 함께 살펴봅니다. 코미디 동영상에 대한 '좋아요'와 뉴스 동영상에 대한 '좋아요'가 의미하는 바가 다르다는 것을 알고 있죠. 이는 그 순간의 맥락에 주의를 기울입니다.계층적 시퀀스 인코더 (HSE) – "기억 은행"
이 부분은 사용자의 장기적인 습관을 기억합니다. 도서관 사서가 책을 정리하듯 사용자의 기록을 살펴봅니다. 단순히 "사용자 X 가 100 개의 동영상을 시청했다"는 사실만 보는 것이 아닙니다. "사용자 X 는 보통 광고는 건너뛰지만 뮤직비디오를 사랑하며, 15 초 후에 크리에이터를 '팔로우'하는 경향이 있다"는 패턴을 파악합니다. 이를 통해 사용자의 고유한 스타일에 대한 심층적인 프로필을 구축합니다.액션 시퀀스 자기회귀 생성기 (AAG) – "수정구슬"
이것이 마법과 같은 부분입니다. 단순히 '예/아니오'라고 말하는 대신, AAG 는 사용자의 미래 행동 전체 시퀀스를 예측하는 수정구슬처럼 작동합니다.- 질문합니다: "이 동영상을 보여준다면, 사용자는 시청을 시작할까? 5 초 지점에서 '좋아요'를 누를까? 10 초 지점에서 크리에이터를 '팔로우'할까? 언제 시청을 중단할까?"
- 영화의 줄거리가 일어나기 전에 예측하듯, 모든 클릭의 순서와 정확한 타이밍을 예측합니다.
이것이 중요한 이유 (결과)
이 팀은 수억 명의 사용자가 있는 거대한 숏폼 동영상 플랫폼인 쿠아쇼우 (Kuaishou) 에서 이 모델을 테스트했습니다. 기존 시스템을 A2Gen 으로 교체하고 대규모 실험 (A/B 테스트) 을 진행했습니다.
- 결과: 시스템이 이제 동영상의 어떤 부분을 실제로 즐기는지 이해하기 때문에 더 나은 콘텐츠를 추천합니다.
- 수치:
- 사람들은 동영상 시청 시간이 0.34% 증가했습니다 (작은 숫자처럼 들리지만 수백만 명의 사용자를 고려하면 엄청난 시간입니다).
- 사용자의 상호작용 (좋아요, 팔로우, 댓글) 은 8.1% 증가했습니다.
- 더 중요한 것은 다음 날 다시 돌아온 사용자가 늘어났다는 점입니다 (리텐션이 0.162% 증가). 이는 플랫폼에 머무르는 하루 약 100 만 명의 추가 사용자로 이어집니다.
요약
이 논문은 동영상을 단일한 '예/아니오' 항목으로 취급해서는 안 된다고 주장합니다. 대신 동영상을 순간들의 타임라인으로 취급해야 합니다. 사용자가 언제, 어떤 순서로 반응할지 예측하는 모델을 사용하면, 앱은 마침내 사용자의 진정한 취향을 이해하고 단순한 클릭 추측이 아닌 실제로 보고 싶어 하는 동영상을 보여줄 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.