← 최신 논문
💻 computer science

SF20K Competition 2025: Summary and findings

ICCV 2025 에서 열린 첫 번째 SF20K 경기는 개방형 단편 영화 질문 응답을 평가하여 22 개 팀을 대상으로 진행했으며, 그 결과 원시 모델 용량보다 내러티브 인식 처리와 효과적인 정보 선택이 더 중요함을 밝혔으나 현재 AI 시스템과 인간 이해도 사이에는 여전히 상당한 성능 격차가 존재합니다.

원저자: Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

게시일 2026-05-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 영화 밤을 주최한다고 상상해 보세요. 하지만 어벤져스스타워즈 같은 유명한 블록버스터를 보는 대신, 일반인들이 만든 20,000 편의 홈메이드 단편 영화를 시청합니다. 이 영화들은 약 12 분 길이로, 독특하고 복잡한 이야기들을 담고 있습니다.

이제, 컴퓨터가 이러한 이야기들을 얼마나 잘 이해하는지 테스트하고 싶다고 가정해 보세요. 단순히 "영웅은 누구인가?"라고 묻는 것은 불가능합니다. 컴퓨터가 유명한 영화들에 대한 지식을 바탕으로 단순히 추측할 수 있기 때문입니다. 대신, "8 분 지점에서 파란 셔츠를 입은 캐릭터는 왜 방을 떠났는가?"와 같이 줄거리와 관련된 구체적인 질문을 던져야 합니다.

이것이 바로 SF20K 대회의 핵심이었습니다. 2025 년에 열린 이 대회에서는 22 개의 AI 연구 팀이 이러한 아마추어 영화들을 시청하고 스토리에 관한 질문에 답할 수 있는 컴퓨터를 구축하려고 시도했습니다.

간단한 비유를 사용하여 발생한 일을 다음과 같이 정리해 보겠습니다:

1. 도전 과제: 책 읽기 vs 메뉴판 훑어보기

오늘날 대부분의 AI 는 짧은 클립 (예: 5 초짜리 틱톡) 을 보고 "저것은 달리는 개다"라고 말하는 데 매우 능숙합니다. 하지만 이번 대회는 AI 에게 훨씬 더 어려운 일을 요구했습니다: 책 전체를 읽는 것.

AI 는 등장인물을 기억하고, 인과관계를 추적하며 (예: "그가 컵을 떨어뜨렸기 때문에 그래서 깨졌다"), 12 분 동안의 스토리 흐름을 이해해야 했습니다. 목표는 AI 가 실제로 보고 이해하는지, 아니면 단순히 훈련 데이터에서 답을 암기하고 있는지를 확인하는 것이었습니다.

2. 게임의 규칙

대회는 "프로 디비전"과 "주니어 디비전"처럼 두 가지 주요 카테고리로 나뉘었습니다:

  • 메인 트랙: 팀들은 원하는 크기의 컴퓨터 두뇌 (가장 크고 비싼 것까지) 를 사용할 수 있었습니다.
  • 스페셜 트랙: 팀들은 "작은" 두뇌 (80 억 개 미만의 파라미터) 를 사용해야 했습니다. 이는 날카로운 트릭이 순수한 힘보다 우위를 점할 수 있는지 확인하기 위한 것이었습니다.

테스트는 엄격했습니다. AI 는 단순히 추측할 수 없었습니다. 만약 영화 자체를 보지 않았다면, 맹목적인 추측 테스트에서 14.7% 만 획득하며 처참하게 실패했을 것입니다.

3. 우승자들: 힘의 문제가 아니라 전략의 문제

큰 놀라움은 누가 가장 큰 컴퓨터를 가졌는지가 아니라, 그들이 그것을 어떻게 사용했는지에 있었습니다.

  • "무식한 힘 (Brute Force)" 접근법: 일부 팀은 영화의 모든 프레임을 AI 에게 입력하려 했습니다 (책의 모든 글자를 한 번에 응시하며 읽으려 하는 것과 같습니다). 이는 잘 작동하지 않았습니다.
  • "스마트 편집자" 접근법: 우승 팀 (WXYZ) 은 영화를 장이 있는 동화책처럼 취급했습니다. 그들은 모든 프레임을 보지 않았습니다. 대신 다음과 같이 행동했습니다:
    1. 영화를 "샷 (shots)"으로 잘라냈습니다 (연극의 장면과 같습니다).
    2. 이야기의 리듬 (어떤 부분이 흥미진진하거나 조용한지) 을 찾기 위해 오디오를 청취했습니다.
    3. 질문에 답하기 전에 각 장면을 요약했습니다.

비유: 책 보고서를 작성해야 한다고 상상해 보세요.

  • 팀 A는 책의 모든 단어를 10 번씩 읽으려 합니다. 그들은 지쳐서 요점을 놓칩니다.
  • 팀 B는 목차를 읽고, 각 장을 요약한 다음 보고서를 씁니다.
  • 결과: 팀 B (더 작고 똑똑한 팀) 가 팀 A (거대하고 무식한 힘에 의존하는 팀) 보다 더 좋은 성적을 받았습니다.

사실, 우승 팀은 상대적으로 작은 AI 모델을 사용했지만, 정보를 이렇게 잘 조직화했기 때문에 30 배 더 큰 모델을 사용했지만 더 단순한 방법을 사용한 팀보다 더 좋은 성적을 거둘 수 있었습니다.

4. 비밀 재료: 자막

연구자들은 캐릭터들이 말한 내용이 그들이 어떻게 생겼는지보다 종종 더 중요하다는 사실을 발견했습니다.

  • AI 는 비디오만 시청했을 때 어려움을 겪었습니다.
  • AI 는 말해진 내용의 대본 (자막) 을 가지고 있을 때 훨씬 더 잘 수행했습니다.
  • 더 나은 자막을 만드는 데 추가 시간을 보낸 팀들 (오류를 수정하거나 더 나은 음성-텍스트 도구를 사용하는 등) 은 훨씬 더 높은 점수를 받았습니다. 이는 외국 영화를 이해하려는 것과 같습니다: 자막이 나쁘면 줄거리를 놓치고, 자막이 완벽하면 이해하게 됩니다.

5. 최종 점수: 여전히 인간이 승리합니다

AI 팀들이 훌륭한 성과를 냈음에도 불구하고, 그들과 인간 사이에는 여전히 엄청난 격차가 존재합니다.

  • 인간 점수: 91.7% (인간은 이야기를 이해하는 데 뛰어납니다).
  • 최고 AI 점수: 65.7% (가장 좋은 컴퓨터는 약 3 분의 2 만 정확했습니다).
  • 작은 AI 점수: 48.7% ("주니어 디비전" 우승자).

큰 교훈

이 대회의 주요 교훈은 똑똑하다는 것이 단순히 더 큰 두뇌를 가지는 것만은 아니다는 것입니다.

컴퓨터가 긴 이야기를 이해하려면 단순히 더 크게 만드는 것만으로는 부족합니다. 우리는 그들에게 정보를 어떻게 조직화하는지, 중요한 부분 (핵심 장면과 같은) 을 어떻게 골라내는지, 그리고 시각적 요소를 이해하기 위해 대화를 어떻게 활용하는지를 가르쳐야 합니다. "병목 현상"은 컴퓨터의 크기가 아니라, 그들에게 이야기를 공급하는 데 사용하는 전략입니다.

현재 AI 는 사실을 암기할 수 있는 매우 빠른 독서자처럼 보이지만, 여전히 복잡한 이야기의 느낌흐름을 이해하는 데 어려움을 겪고 있습니다. 우리는 그 길에 도달하고 있지만, 인간 수준의 이해에 도달하기 위해서는 아직 갈 길이 멉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →