← 최신 논문
🤖 AI

FlowTime: Towards Continuous Generative Watch Time Prediction via Flow-based Personalized Priors

이 논문은 기존의 시청 시간 예측 방법들의 한계를 극복하기 위해 플로우 기반의 개인화된 사전 확률(personalized priors)과 1단계 변이형 오토인코더(one-step variational autoencoder)를 활용하여 다중 모드 사용자-아이템 상호작용 패턴을 효과적으로 모델링하는 동시에 낮은 추론 지연 시간을 보장함으로써, 오프라인 및 온라인 평가 모두에서 우수한 성능을 달성하는 새로운 연속적 생성 회귀 프레임워크인 FlowTime을 소개한다.

원저자: Hongxu Ma, Han Zhou, Chenghou Jin, Jie Zhang, Xiaoyu Yang, Chunjie Chen, Jihong Guan, Shuigeng Zhou

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hongxu Ma, Han Zhou, Chenghou Jin, Jie Zhang, Xiaoyu Yang, Chunjie Chen, Jihong Guan, Shuigeng Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 짧은 영상 클립의 도서관과 같은 대규모 디지털 비디오 플랫폼을 운영하고 있다고 상상해 보십시오. 당신의 가장 큰 목표는 단순히 사람들이 비디오를 클릭하게 만드는 것(그것은 옛날 방식의 사고방식입니다)이 아니라, 사람들이 그 비디오에 머물며 끝까지 시청하게 만드는 것입니다. 이 "시청 시간(Watch Time)"은 사용자가 얼마나 만족하고 있는지를 보여주는 궁극적인 성적표입니다.

"FlowTime"이라는 논문은 매우 구 구체적인 문제를 다룹니다: 어떻게 하면 특정 비디오를 사람이 정확히 얼마나 오래 시청할지 예측할 수 있을까?

다음은 이 논문의 아이디어를 쉬운 비유와 함께 설명한 내용입니다.

문제점: "평균"의 함정

저자들은 현재의 시청 시간 예측 방식이 마치 평균 기온만을 보고 날씨를 예측하려는 것과 같다고 말합니다.

  1. "직접 회귀(Direct Regression)"의 실수: 100명에게 "이 영상을 얼마나 오래 볼 것 같습니까?"라고 묻는다고 가정해 봅시다. 어떤 사람은 10초만 보고 떠나고, 어떤 사람은 10분을 볼 것입니다. 만약 일반적인 수학 공식(단순 평균 같은 것)을 사용한다면, 컴퓨터는 "5분"이라고 추측할 것입니다. 하지만 실제로 5분을 딱 맞춰 보는 사람은 거의 없습니다. 사람들은 아주 조금 보거나, 아니면 아주 많이 보거나 둘 중 하나입니다. 컴퓨터는 그 중간 지점에 갇혀서, 아무도 경험하지 않는 시간을 예측하게 됩니다. 저자들은 이를 **"평균 붕괴(Mean Collapse)"**라고 부릅니다.
  2. "서수 회귀(Ordinal Regression)"의 실수: 또 다른 방법은 시간을 엄격한 구간(예: "0-5초", "5-10초")으로 나누어 해결하려고 합니다. 하지만 이것은 눈금이 인치 단위로만 되어 있는 자로 액체의 양을 측정하려는 것과 같습니다. 정밀도가 떨어지고, 각 구간이 서로 영향을 주지 않는다고 가정하기 때문에 수학적으로 복잡해집니다.
  3. "생성형(Generative)"의 실수: 최신 방법들은 답변을 단계별로 생성하려고 시도합니다(마치 로봇이 문장을 한 단어씩 써 내려가는 것처럼). 정확하긴 하지만 너무 느립니다. 이는 로봇이 소설 한 권을 다 쓸 때까지 기다려야 당신이 첫 페이지를 좋아할지 알려주는 것과 같습니다. 실제 라이브 비디오 앱에서는 너무 오래 걸립니다.

핵심 통찰: 이 논문은 시청 시간이 단순히 무엇을 좋아하는가(비디오 콘텐츠)에 관한 것이 아니라, 당신이 어떻게 행동하는가에 관한 것이라고 주장합니다.

  • 비유: 똑같은 재미있는 고양이 영상을 보는 두 사람이 있다고 상상해 보십시오.
    • 사용자 A는 "공격적"입니다. 즉, 즉시 건너뛰거나(0초) 혹은 끝까지 다 봅니다(1분). 이들의 행동은 양봉 분포(bimodal)(두 개의 뚜렷한 정점이 있는 형태)를 보입니다.
    • 사용자 B는 "수동적"입니다. 이들은 영상 주변을 맴돌며 중간 정도의 시간 동안 시청합니다. 이들의 행동은 단봉 분포(unimodal)(하나의 매끄러운 정점이 있는 형태)를 보입니다.
    • 현재의 시스템은 이 두 사용자가 같은 영상을 좋아한다는 이유로 동일하게 취급합니다. FlowTime은 이들의 행동 패턴이 결과값을 바꾼다는 점을 깨달았습니다.

해결책: FlowTime

저자들은 **연속 생성 회귀(Continuous Generative Regression)**라고 불리는 새로운 해결책을 제안합니다. 이것은 "모양을 바꾸는 수정구슬"이라고 생각하면 됩니다.

단순히 하나의 숫자나 구간을 추측하는 대신, FlowTime은 가능한 결과의 전체적인 **모양(shape)**을 학습하려고 합니다.

1. 원스텝 생성기 (속도)

대부분의 화려한 AI 생성기(Diffusion 모델 같은 것)는 모양을 제대로 잡기 위해 반복해서 돌을 깎아내는 조각가처럼 작동합니다. 정확하지만 느립니다.

  • FlowTime의 비법: 이들은 "원스텝(One-Step)" 생성기를 만들었습니다. 한 번의 동작으로 찰흙을 완벽한 모양으로 빚어내는 조각가를 상상해 보십시오. 이 덕분에 실시간 비디오 앱에서도 빠르게 예측할 수 있습니다.

2. 플로우 기반 개인화 사전 확률 (The "Warp")

이것이 이 논문의 핵심 비법입니다.

  • 문제점: 표준 AI 모델은 모든 사람의 행동이 동일한 "백지 상태"(표준 정규 분포)에서 시작한다고 가정합니다.
  • 해결책: FlowTime은 **노멀라이징 플로우(Normalizing Flows)**라는 기술을 사용합니다. 당신이 표준적인 둥근 풍선을 가지고 있다고 상상해 보십시오. FlowTime은 사용자의 기록을 바탕으로 이 풍선을 늘리고, 찌그러뜨리고, 뒤틀어서 변형시킵니다.
    • 만약 사용자가 "공격적인 스키퍼(건너뛰는 사람)"라면, 풍선은 두 개의 길고 얇은 모양으로 늘어납니다(두 개의 행동 정점을 나타냄).
    • 만약 사용자가 "수동적인 시청자"라면, 풍선은 둥근 상태를 유지하며 중앙으로 이동합니다.
  • 이를 통해 AI는 "당신의 과거 기록을 바탕으로 볼 때, 당신의 시청 시간 모양은 '이것'이 아니라 '저것'이다"라고 말할 수 있게 됩니다.

결과: 왜 중요한가

저자들은 단순히 이론만 제시한 것이 아니라, 공정한 테스트를 위해 TimeRec이라는 도구(이 특정 문제를 위한 최초의 오픈 소스 라이브러리)를 구축했습니다.

  1. 더 나은 정확도: FlowTime은 기존의 모든 "최첨단(State-of-the-Art)" 방식들을 이겼습니다. 시청 시간을 더 정확하게 예측했고, 비디오 순위도 더 잘 매겼습니다.
  2. 실제 세계에서의 성공: 이들은 4억 명 이상의 일일 사용자가 있는 실제 플랫폼에서 테스트했습니다.
    • 결과: 사용자들이 앱에서 약 1% 더 많은 시간을 보냈고, 더 많은 영상을 시청했습니다. 빅테크의 세계에서 1%의 상승은 수백만 달러의 수익으로 직결되는 엄청난 승리입니다.
  3. 속도: 이 모델은 단계별로 진행되는 느린 AI 모델들과 달리, 앱의 속도를 늦추지 않고 실시간으로 실행될 만큼 충분히 빨랐습니다.

요약

FlowTime은 사람들이 영상을 얼마나 오래 시청할지 예측하는 새로운 방법입니다. 하나의 평균적인 숫자를 추측하는 대신(그것은 대개 틀리기 마련입니다), "모양을 바꾸는" 수학 모델을 사용합니다. 이 모델은 사용자의 과거 습관을 바탕으로 예측을 변형하여, 사람마다 서로 다른 "시청 성향"이 있음을 이해합니다. 이는 더 나은 추천, 더 행복한 사용자, 그리고 앱 체류 시간의 증가로 이어집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →