← 최신 논문
🤖 AI

M3TR: Temporal Retrieval Enhanced Multi-Modal Micro-video Popularity Prediction

본 논문은 자기 흥분적 사용자 피드백 역학을 모델링하기 위한 Mamba-Hawkes 프로세스와 인기 진화를 포착하기 위한 시간 인지형 검색 메커니즘을 활용하여 마이크로 비디오 인기 예측에서 최첨단 성능을 달하는 시간적 검색 강화 멀티모달 프레임워크인 M3TR을 제안한다.

원저자: Jiacheng Lu, Weijian Wang, Mingyuan Xiao, Yang Hua, Tao Song, Bo Peng, Cheng Hua, Haibing Guan

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiacheng Lu, Weijian Wang, Mingyuan Xiao, Yang Hua, Tao Song, Bo Peng, Cheng Hua, Haibing Guan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매일 수백만 개의 클립이 업로드되는 방대한 단편 영상 콘텐츠의 소용돌이 속에서, 추천 알고리즘의 엔진을 움직이는 단 하나의 질문은 이것입니다. 어떤 영상이 전 세계의 관심을 사로잡을 것이며, 얼마나 오랫동안 그 관심을 유지할 것인가? 이 인기를 예측하는 것은 단순히 '좋아요'나 '공유'의 수를 세는 문제가 아닙니다. 그것은 개인들의 찰나적이고 종종 혼란스러운 반응을 바탕으로 대중의 미래 행동을 예측하려는 시도입니다. 수년간 연구자들은 영상의 콘텐츠—그것이 어떻게 보이는지, 어떤 소리가 나는지, 그리고 텍전적인 텍스트가 무엇을 말하는지—를 분석하여 영상의 성공적인 미래를 내다볼 수 있는 모델을 구축하려고 노력해 왔습니다. 또한 사용자들의 상호작용을 시간이 지남에 따라 오르거나 내리는 단순한 선 그래프로 취급하며 그 상호작용을 추적하려고도 했습니다. 그러나 이러한 접근 방식은 인간 참여의 더 깊고 복잡한 리듬을 놓치는 경우가 많습니다. 그들은 '좋아요'의 폭발이 공유의 물결을 촉발할 수 있다는 점이나, 갑작스러운 부정적 댓글의 홍수가 영상 자체가 아무리 아름답더라도 즉각적으로 영상의 모멘텀을 죽일 수 있다는 사실을 이해하지 못합니다.

상하이 교통대학교와 퀸즈 대학교 벨파스트의 연구진은 이 수수께끼를 풀기 위한 새로운 방법인 M3TR이라 불리는 시스템을 도입하며 새로운 해결책을 제안했습니다. 영상이 무엇으로 만들어졌는지 단순히 살펴보거나 사용자 피드백을 시간에 따라 변하는 단순한 숫자로 취급하는 대신, 이 새로운 접근 방식은 인기를 살아 움직이는 일련의 사건의 흐름으로 취급합니다. 연구진은 영상의 미래를 예측하기 위해서는 인간 반응의 구체적이고 복잡한 연쇄 반응을 이해해야 한다는 것을 깨달았습니다. 그들은 영상의 성공이 가진 고유한 "시간적 DNA"를 인식하도록 학습하는 시스템을 구축했습니다. 이는 시스템이 단순히 "이 영상은 고양이에 관한 것인가?"라고 묻는 것이 아니라, "이 영상이 요리나 춤에 관한 다른 영상들과는 다르더라도, 유명해진 다른 영상들과 동일한 흥분과 쇠퇴의 패턴을 따르는가?"라고 묻는 것을 의미합니다. 사용자 상호작용이 서로 어떻게 영향을 미치는지에 대한 깊은 이해와 유사한 인기 역사를 가진 영상을 찾아내는 스마트한 검색 엔진을 결합함으로써, 연구팀은 그 어느 때보다 명확하게 미래를 내다보는 도구를 만들어냈습니다.

그들의 발견의 핵심은 사람들이 영상에 반응하는 방식을 어떻게 모델링했느냐에 있습니다. 과거의 시스템들은 종로는 '좋아요', '공유', '댓글'을 독립적인 사건으로 취급하거나 단순히 하나의 점수로 합산했습니다. 연구진은 이것이 잘못되었다는 것을 알고 있었습니다. 그들은 이러한 행동들이 깊게 연결되어 있음을 이해했습니다. 즉, '좋아요'의 급증은 더 많은 공유를 독려할 수 있는 반면, 논란이 되는 댓글의 물결은 추가적인 참여를 억제할 수 있다는 것입니다. 이를 포착하기 위해 그들은 사용자 피드백을 하나의 행동이 자연스럽게 다음 행동을 유발하지만, 그 유발의 성격이 맥락에 따라 변할 수 있는 일련의 자기 흥분적(self-exciting) 사건으로 보는 새로운 방법을 개발했습니다. 그들은 정교한 신경망 구조를 사용하여 이러한 시퀀스의 장기적인 패턴을 학습함으로써, 특정 유형의 댓글이 영상이 여전히 '좋아요'를 받고 있더라도 인기의 종말을 알리는 신호가 될 수 있음을 파악할 수 있게 했습니다. 이러한 긍정적 모멘텀과 가짜 정점(false peak)을 구별하는 능력은 결정적인 돌파구였습니다.

시스템이 영상의 상호작용에 대한 복잡한 이력을 정확하게 매핑할 수 있게 되자, 연구진은 다음 과제에 직면했습니다. 그 지식을 어떻게 미래를 예측하는 데 사용할 것인가 하는 점이었습니다. 전통적인 방식은 외형이나 소리가 비슷한 다른 영상을 검색할 것입니다. 만약 당신이 고양이에 관한 영상을 가지고 있다면, 시스템은 다른 고양이 영상을 찾을 것입니다. 연구진은 이 접근 방식이 결함이 있다고 보았습니다. 고양이에 관한 영상은 인기가 완만하고 꾸준하게 상승할 수도 있고, 또 다른 고양이 영상은 즉각적으로 폭발했다가 사라질 수도 있기 때문입니다. 콘텐츠는 같았지만, 그 성공의 이야기는 완전히 달랐습니다. 그들의 새로운 시스템인 M3TR은 검색의 규칙을 바꾸었습니다. 단순히 콘텐츠를 매칭하는 대신, 인기의 "이야기"를 매칭했습니다. 시스템은 방대한 역사적 영상 라이브러리를 검색하여, 주제가 고양이든 자동차든 요리든 상관없이 동일한 참여 패턴을 공유하는—즉, 똑같은 방식으로 상승하고 하락한—사례들을 찾아냈습니다.

콘텐츠 매칭에서 패턴 매칭으로의 이러한 전환은 믿을 수 없을 정도로 강력한 힘을 발휘했습니다. 연구진이 두 개의 대규모 데이터셋을 통해 실제 데이터로 시스템을 테스트했을 때, 결과는 놀라웠습니다. 새로운 모델은 모든 이전 방식들을 크게 앞질렀으며, 예측 오차를 최대 19.3%까지 줄였습니다. 더 쉽게 말하면, 향후 몇 시간 또는 며칠 동안 얼마나 많은 사람이 영상을 시청하고, 좋아요를 누르고, 공유할지를 예측하는 데 훨씬 더 정확했습니다. 이 시스템은 특히 가장 까다로운 경우, 즉 초반에는 강세를 보였으나 이후 쇠퇴한 영상이나, 갑자기 입소문(viral)이 나기 전까지 잠잠했던 영상을 처리하는 데 탁로 뛰어났습니다. 과거 영상의 구체적인 궤적으로부터 학습함으로써, 모델은 오래된 모델들이 완전히 놓쳤던, 영상이 멈추려 하거나 혹은 치솟으려 하는 미묘한 징후를 포착할 수 있었습니다.

연구진은 또한 그들의 접근 방식이 실무에서 실용적이라는 것을 입증했습니다. 시스템이 영상 패턴의 라이브러리를 구축하는 데는 상당한 컴퓨팅 능력이 필요하지만, 이 작업은 사전에 오프라인으로 수행됩니다. 일단 라이브러리가 구축되면, 시스템은 새로운 영상에 대해 실시간으로 예측을 수행하며, 가장 관련성 높은 역사적 사례를 순식간에 찾아낼 수 있습니다. 이 2단계 프로세스는 데이터 라이브러리가 수백만 개의 영상으로 늘어나더라도 시스템이 사용자에게 빠르고 효율적으로 유지되도록 보장합니다. 이 연구는 사람들이 콘텐츠에 어떻게 상호작용하는지에 대한 역동적이고 진화하는 이야기를 이해하는 것이 단순히 콘텐츠 자체를 분석하는 것보다 예측에 있어 훨씬 더 중요하다는 것을 확인시켜 줍니다. 그림을 보는 대신 인간의 주의력의 리듬에 귀를 기울임으로써, 연구진은 예측 불가능한 바이럴 미디어의 세계를 항해할 수 있는 새롭고 더 신뢰할 수 있는 방법을 제공했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →