← 최신 논문
💻 computer science

NTIRE 2026 Challenge on Video Saliency Prediction: Methods and Results

이 논문은 5,000 명 이상의 평가자가 참여하여 구축된 대규모 크라우드소싱 데이터셋을 기반으로 2026 년 NTIRE 비디오 saliency 예측 챌린지의 방법론과 결과를 요약하고 있습니다.

원저자: Andrey Moskalenko, Alexey Bryncev, Ivan Kosmynin, Kira Shilovskaya, Mikhail Erofeev, Dmitry Vatolin, Radu Timofte, Kun Wang, Yupeng Hu, Zhiran Li, Hao Liu, Qianlong Xiang, Liqiang Nie, Konstantinos Ch
게시일 2026-04-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Andrey Moskalenko, Alexey Bryncev, Ivan Kosmynin, Kira Shilovskaya, Mikhail Erofeev, Dmitry Vatolin, Radu Timofte, Kun Wang, Yupeng Hu, Zhiran Li, Hao Liu, Qianlong Xiang, Liqiang Nie, Konstantinos Chaldaiopoulos, Niki Efthymiou, Athanasia Zlatintsi, Panagiotis Filntisis, Katerina Pastra, Petros Maragos, Li Yang, Gen Zhan, Yiting Liao, Yabin Zhang, Yuxin Liu, Xu Wu, Yunheng Zheng, Linze Li, Kun He, Cong Wu, Xuefeng Zhu, Tianyang Xu, Xiaojun Wu, Wenzhuo Zhao, Keren Fu, Gongyang Li, Shixiang Shi, Jianlin Chen, Haibin Ling, Yaoxin Jiang, Guoyi Xu, Jiajia Liu, Yaokun Shi, Jiachen Tu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

NTIRE 2026 비디오 '주목도 예측' 챌린지: 사람들이 어디를 볼까?

이 논문은 2026 년에 열린 **'NTIRE 비디오 주목도 예측 챌린지'**에 대한 보고서입니다. 쉽게 말해, **"사람들이 동영상을 볼 때 눈이 어디로 향할지 컴퓨터가 예측하는 대회"**였습니다.

이 대회를 이해하기 위해 몇 가지 재미있는 비유를 들어보겠습니다.


1. 대회의 목표: "눈의 나침반" 만들기

사람들은 동영상을 볼 때 모든 것을 똑같이 보지 않습니다. 예를 들어, 뉴스 화면에서 화난 정치인의 얼굴이나 배경에서 튀는 붉은색 사인판에 먼저 눈이 갑니다. 이를 **'주목 (Saliency)'**이라고 합니다.

이 대회의 목표는 컴퓨터에게 **"사람의 눈이 어디로 갈지 미리 알려주는 나침반"**을 만드는 것이었습니다. 이 기술이 있으면:

  • 비디오 압축: 사람들이 잘 보지 않는 부분은 화질을 낮춰서 인터넷 속도를 빠르게 할 수 있습니다.
  • 광고: 사람들이 가장 많이 보는 곳에 광고를 배치할 수 있습니다.
  • VR/게임: 사람이 보는 부분만 선명하게 그려서 컴퓨터 성능을 아낄 수 있습니다.

2. 새로운 지도 만들기: 5,000 명 이상의 '눈'을 모으다

컴퓨터가 배우려면 많은 '정답'이 필요합니다. 하지만 사람의 눈을 직접 추적하는 장비 (아이 트래커) 는 비싸고 귀찮습니다.

그래서 주최팀은 2,000 개의 다양한 동영상을 준비하고, 5,000 명 이상의 일반인에게 컴퓨터 마우스로 "어디가 가장 눈에 띄니?"라고 물어봤습니다. 마치 수천 명의 사람들이 동영상을 보며 마우스로 "여기야!"라고 가리키는 것을 모아, 마치 눈이 움직인 것처럼 만든 거대한 **'시선 지도'**를 만들었습니다.

3. 참가팀들의 전략: 각자 다른 '수사관'들

총 20 개 팀이 참가했고, 최종적으로 7 개 팀이 결승에 올랐습니다. 각 팀은 문제를 해결하기 위해 전혀 다른 방법을 썼습니다.

  • 1 위 팀 (iLearn): "두 명의 전문가가 협력"
    • 비유: 한 팀은 두 명의 탐정을 고용했습니다. 한 명은 "중앙에 있는 게 중요할 거야"라고 생각하며, 다른 한 명은 "주변의 복잡한 움직임도 봐야 해"라고 생각합니다. 두 사람의 의견을 합쳐서 가장 정확한 답을 냈습니다.
  • 2 위 팀 (CVSP): "예측 실패를 찾아서"
    • 비유: 이 팀은 "사람은 예상치 못한 것에 놀라 눈을 돌린다"는 심리를 이용했습니다. "다음 장면이 이렇게 될 거야"라고 예측했는데, 실제로는 다르게 나오면 (예측 오류), 그 부분이 바로 사람들이 주목할 곳이라고 판단했습니다.
  • 3 위 팀 (ARK MMLAB): "층층이 쌓은 정보"
    • 비유: 멀리서 보는 큰 그림과 가까이서 보는 작은 디테일을 모두 한 번에 분석하는 '층층이 쌓은 사다리' 구조를 사용했습니다.
  • 기타 팀들:
    • Vertex: 위아래로 정보를 오가는 '양방향 통신'을 강화했습니다.
    • AAM: 소리와 영상, 텍스트를 모두 섞어 "이 소리가 들리면 여기가 중요할 거야"라고 추론했습니다.
    • SHU-MIIPLab: '확산 모델'이라는 기술을 써서, 처음엔 흐릿했던 시선 지도를 점점 선명하게 다듬어 나갔습니다.
    • NTR: '움직임'을 잘 보는 카메라와 '세부 묘사'를 잘 보는 카메라 두 대를 동시에 작동시켰습니다.

4. 결과: 무엇이 이겼을까?

최종 순위는 4 가지 점수 (상관관계, 유사도 등) 를 종합해서 매겼습니다.

  • 1 위: iLearn 팀 (두 전문가의 협력)
  • 2 위: CVSP 팀 (예측 실패 분석)
  • 3 위: ARK MMLAB 팀 (층층이 쌓은 정보)

이들 모두 이미 거대한 양의 데이터를 학습한 최신 AI 모델을 기반으로 했으며, 특히 시간의 흐름 (동영상) 과 공간의 구조 (화면) 를 동시에 잘 이해하는 능력이 중요하다는 것을 보여줬습니다.

5. 결론: 왜 이 일이 중요할까?

이 대회는 단순히 점수를 따는 게임이 아닙니다. 컴퓨터가 인간의 눈을 더 잘 이해하게 되면, 우리가 보는 모든 영상 콘텐츠가 더 똑똑해집니다.

  • 더 빠른 인터넷
  • 더 선명한 VR 경험
  • 더 효율적인 영상 편집

이처럼 **"사람이 무엇을 볼지 아는 기술"**은 미래의 디지털 세상을 더 편리하게 만드는 핵심 열쇠가 될 것입니다.


한 줄 요약:

"수천 명의 마우스 클릭을 모아 만든 거대한 지도로, AI 가 사람의 눈이 어디로 향할지 가장 정확하게 예측하는 방법을 찾아낸 2026 년의 흥미진진한 기술 대결!"

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →