ViASNet: A Video Ad Saliency Network for Predicting Dynamic Saliency and Viewer Engagement
본 논문은 오디오 및 의미적 단서를 통합하여 숏폼 비디오 광고의 동적 주시도 지도를 예측하는 3D U-Net 아키텍처 기반의 딥러닝 모델인 ViASNet을 소개하며, 시선 추적 검증과 엔트로피 기반 진단을 통해 광고 디자인 최적화 및 비참여 콘텐츠 식별 능력을 입증합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
30 초짜리 광고를 촬영하는 감독이라고 상상해 보세요. 사람들이 이 광고를 볼 때, 눈이 당신이 원하는 정확한 지점, 즉 제품, 미소 짓는 배우, 또는 눈에 띄는 로고에 머물도록 하고 싶을 것입니다. 하지만 여기엔 문제가 있습니다. 백만 명에게 광고를 보여주고 매 프레임마다 그들의 눈을 추적할 수는 없습니다. 그렇게 하려면 비용이 너무 많이 들고 시간도 너무 오래 걸립니다.
이 논문은 바로 그 문제를 해결하도록 설계된 스마트 컴퓨터 프로그램인 ViASNet을 소개합니다. ViASNet 을 광고 영상을 보고 인간의 눈이 매초 어디로 향할지 즉시 예측할 수 있는"초 관찰자"라고 생각하세요.
다음은 이를 간단한 개념으로 분해한 작동 원리입니다:
1. 문제: 광고의"혼란"
우리는 틱톡, 유튜브, TV 의 짧은 영상 광고에溺하고 있습니다. 광고가 너무 많기 때문에 단일 광고가 당신의 관심을 끌기 어렵습니다. 광고주들은 어떤 광고가 효과적이고 어떤 것이 지루한지 빠르게 테스트할 방법이 필요합니다. 보통 그들은 사람을 고용해 눈 추적 카메라를 연결하고 사람들이 화면을 응시하는 모습을 지켜봐야 합니다. ViASNet 은 이를 자동으로 수행하는 것을 목표로 합니다.
2. 해결책: "세 가지 감각"을 가진 탐정
눈 움직임을 예측하는 대부분의 기존 컴퓨터 모델은 이미지 (시각) 만 보았습니다. 그들은 사건 현장만 보고 소음이나 이야기를 무시하는 탐정처럼 행동했습니다.
ViASNet 은 다릅니다. 그것은 세 가지 요소를 동시에 살펴보는"세 가지 감각"을 가진 탐정입니다:
- 시각: 화면에서 무슨 일이 일어나고 있나요? (얼굴이 있나요? 무언가가 움직이고 있나요?)
- 오디오: 무엇이 말해지거나 들리고 있나요? (큰 소음이나 목소리가 당신을 위로 올려보게 만들나요?)
- 이야기 (의미론): 그 장면은 무엇에 관한 것인가요? (슬픈 순간인가요? 재미있는 농담인가요? 자동차 추격전인가요?)
"이야기"를 이해하기 위해 이 시스템은 비디오를 읽고 마치 인간이 하듯 장면을 설명하는 짧은 캡션을 작성하는 거대한 AI 뇌 (Qwen3-VL 이라고 함) 를 사용합니다.
3. 지도를 만드는 방법: "주목도 지도"
ViASNet 의 목표는 **주목도 지도 (Saliency Map)**를 만드는 것입니다. 비디오 프레임의 사진을 찍어 열지도 (heat map) 로 칠한다고 상상해 보세요:
- 빨간색/뜨거운 영역: 사람들이 바라볼 곳.
- 파란색/차가운 영역: 사람들이 무시할 곳.
ViASNet 은 비디오의 매 프레임마다 이 지도를 구축하여 시간이 지남에 따라 주의가 어떻게 이동하는지 보여주는 움직이는 열지도를 생성합니다.
4. 비밀 재료: 학습 방법
연구진들은 고기술 카메라로 눈이 추적된 약 20 명의 사람들이 시청한 151 개의 실제 TV 광고 데이터를 사용하여 ViASNet 을 훈련시켰습니다.
이 모델은 20 명의 실제 눈 움직임과 자신의 예측을 비교하며 학습했습니다. 이는 3D U-Net이라는 특수한 아키텍처를 사용합니다.
- 유추: U-Net 을 깔때기라고 생각하세요. 비디오를 받아 주요 아이디어 (즉, "병목") 를 이해하기 위해 압축했다가, 다시 확장하여 상세한 열지도로 그려냅니다.
- "중앙 편향": 인간은 본능적으로 화면 중앙을 바라보는 경향이 있습니다. ViASNet 은 이 트릭을 알고 있으며, 실제 인간이 하듯 예측에 약간의"중앙 편향"을 추가합니다.
5. "엔트로피"테스트: 지루함 측정
저자들이 만든 가장 멋진 도구 중 하나는 엔트로피(혼란 또는 당혹감을 나타내는 어려운 단어) 를 측정하는 방법입니다.
- 낮은 엔트로피 (질서 정연함): 열지도가 한 곳 (예: 중앙의 얼굴) 으로 모든 사람이 집중하는 것을 보여주면 엔트로피는 낮습니다. 이는 광고가 매력적임을 의미합니다.
- 높은 엔트로피 (혼란스러움): 열지도가 여기저기 흩어져 있거나 사람들이 특정 곳을 보지 않는다면 엔트로피는 높습니다. 이는 광고가 혼란스럽거나 지루함을 의미합니다.
저자들은 이 방법을 사용하여 이전에 본 적 없는 15 개의 새로운 광고를 테스트했습니다. 그들은 시청자의 집중력을 잃게 만든 장면들을 즉시 찾아낼 수 있었습니다. 예를 들어, 장면이 너무 많은 객체나 여기저기 흩어진 텍스트를 포함하고 있다면 시청자의 눈이 방황하게 되고"매력 점수"가 떨어진다는 것을 발견했습니다.
6. 결과: 다른 것들보다 더 잘 작동합니다
연구진들은 ViASNet 을 다른 유명한 컴퓨터 모델들 (이미지만 보는 것, 영화를 보는 것 등) 과 비교하여 테스트했습니다.
- 판결: ViASNet 이 승리했습니다. 그들이 테스트한 어떤 모델보다 사람들이 어디를 볼지 더 정확하게 예측했습니다.
- 이유: 그것은 픽셀만 본 것이 아니라 소리, 이야기, 장면 사이의 전환을 이해했기 때문입니다. 장면이 바뀔 때 ("컷"), 사람들의 눈이 자연스럽게 재배치하기 위해 중앙으로 뛰어든다는 것을 깨닫고 이를 반영했습니다.
요약
간단히 말해, ViASNet은 실험실에 앉아 있는 인간 한 명도 필요 없이 광고주가 그들의 관객의 눈으로"볼"수 있게 해주는 자동화 도구입니다. 그것은 당신이 보는 것, 듣는 것, 그리고 이야기가 의미하는 바를 결합하여 당신의 주의가 정확히 어디로 향할지 예측합니다. 광고가 지루하거나 혼란스럽다면, 이 시스템은 그것이 정확히 몇 초에 발생하는지 알려주어 제작자들이 대규모 마케팅 캠페인에 돈을 쓰기 전에 문제를 수정할 수 있게 해줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.