← 최신 논문
💻 computer science

Perception Test 2025: Challenge Summary and a Unified VQA Extension

본 논문은 단일 인터페이스를 통해 다양한 지각 작업을 처리할 때 현재 모델이 직면한 상당한 어려움을 부각시키기 위해 통합 비디오 QA 및 추적과 같은 통합된 트랙을 갖춘 통합 벤치마크에서 최첨단 멀티모달 비디오 모델을 평가한 Perception Test 2025 챌린지의 결과를 요약합니다.

원저자: Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

게시일 2026-04-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터 비전을 위한 거대하고 고위험의 재능 쇼를 상상해 보세요. 다만, 참가자들이 노래를 부르거나 춤을 추는 대신 인공지능 모델들이 세상을 '보고' 이해하려고 노력하는 것입니다. 이 논문은 주요 컴퓨터 과학 회의와 함께 개최된, 2025 년 버전인 Perception Test의 성적표입니다.

다음은 간단한 비유를 사용하여 설명한 사건의 개요입니다.

핵심 아이디어: 특수 도구에서 스위스 군용 칼로

과거의 인공지능 모델들은 특수 도구와 같았습니다. 한 모델은 군중 속에서 특정 사람을 찾는 것 (추적) 에 뛰어나고, 다른 모델은 차량 추락 사고를 감지하는 것 (행동 감지) 에 뛰어나며, 세 번째 모델은 비디오에 대한 질문에 답하는 데 능숙했습니다.

올해의 도전 과제에서 주최진은 이러한 '특수 도구'들을 테스트하는 것을 중단하기로 결정했습니다. 대신 그들은 스위스 군용 칼을 요구했습니다. 단일 인공지능 모델이 모자를 갈아쓰지 않고 모든 것을 동시에 수행할 수 있는지 확인하고 싶었던 것입니다. 그들은 이렇게 물었습니다. "하나의 두뇌가 공을 추적하고, 소리를 듣고, 장면과 관련된 질문에 답하는 것을 모두 동시에 처리할 수 있을까?"

다섯 가지 주요 종목 (트랙)

이 대회는 인공지능의 서로 다른 '근육'을 테스트하는 다섯 가지 주요 종목으로 구성되었습니다.

  1. 통합 비디오 퀴즈 (마법 눈 테스트):

    • 과거 방식: 인공지능이 움직이는 점을 추적할 수 있는지 테스트하려면 특정 추적기를 구축해야 했습니다.
    • 새로운 방식: 주최진은 이러한 어려운 과제들을 객관식 문제로 바꾸었습니다. 테이블의 특정 지점이 초록색으로 깜빡이는 비디오를 상상해 보세요. 인공지능은 "이 다섯 점 중 어떤 점이 깜빡였습니까?"라고 질문받습니다.
    • 반전: 그들은 "이 행동들은 어떤 순서로 일어났습니까?" 또는 "어떤 물체가 무언가를 하는 척하고 있었습니까?"와 같은 까다로운 질문들을 추가했습니다. 이로써 인공지능은 시각적 퍼즐을 해결하기 위해 언어를 사용하도록 강요받았습니다.
  2. 이중 추적 도전:

    • 인공지능은 전체 물체 (예: 튀는 공) 와 그 물체의 특정 지점 (예: 공에 붙은 빨간 스티커) 을 동시에 따라가야 했습니다. 공이 벽 뒤에 숨겨져 가려지더라도 (가려짐) 말입니다.
  3. 소리와 행동 탐정:

    • 인공지능은 비디오를 보고 "정확히 10 초에 누군가 공을 차고, 하는 소리가 들렸습니다"라고 말해야 했습니다. 시각적 행동과 소리 모두에 대해 '언제'와 '무엇'을 동시에 찾아내야 했습니다.
  4. "가리키고 클릭하기" 탐정:

    • 인공지능은 "어떤 개가 고양이를 쫓고 있습니까?"와 같은 질문을 받았고, 단순히 "갈색 개"라고 말하는 것을 넘어, 그 특정 개를 둘러싼 상자를 실제로 그리고 비디오 전체를 통해 그 개를 따라가야 했습니다.
  5. 마라톤 주자 (1 시간짜리 비디오):

    • 대부분의 인공지능 모델은 30 초짜리 클립을 본 후 지쳐버립니다. 이 종목은 그들에게 1 시간짜리 비디오를 던졌습니다. 인공지능은 끝에서 질문에 답하기 위해 처음의 세부 사항들을 기억해야 했습니다.

결과: 두 가지 속도의 이야기

이 논문은 인공지능의 성과가 흥미롭게 갈라졌음을 보고합니다.

  • 언어 승리자: 인공지능이 언어를 사용할 수 있을 때 (질문에 답하고, 장면을 설명하는 등), 작년보다 훨씬 더 좋아졌습니다. 실제로 "가리키고 클릭하기"와 "1 시간짜리" 테스트에서 점수는 거의 두 배가 되었습니다. 마치 인공지능이 갑자기 매뉴얼을 읽고 시각적 세계에 적용하는 법을 배운 것처럼 말입니다.
  • "침묵"의 고난: 인공지능이 언어 없이 (예: 점 추적이나 소리 찾기) 무언가를 해야 할 때는 크게 개선되지 않았습니다. 올해의 최우수 "스위스 군용 칼" 모델들은 실제로 작년의 특수 "단일 작업" 모델들보다 더 느렸습니다.

핵심 교훈: 이 논문은 인공지능이 자신이 보는 것에 대해 이야기하는 데는 놀라울 정도로 발전하고 있지만, 모든 것을 완벽하게 동시에 수행할 수 있는 단일 통합 두뇌가 되는 데는 여전히 어려움을 겪고 있다고 결론지었습니다. "일반적 지각" 모델이 머지않아 등장할 것이지만, 아직은 완전히 도달하지는 못했습니다.

수상자

  • 총 제출 건수: 100 개 이상의 팀이 450 건의 시도를 제출했습니다.
  • 상금: 수상자들은 총 47,000 달러를 수상했습니다.
  • 최고 성과팀: "NJUST_KMG" 팀은 빈번한 우승자로, 추적, 소리, 1 시간짜리 비디오 부문에서 상위권을 차지했습니다. 다른 팀인 "SGVR@KAIST"는 "가리키고 클릭하기" 부문을 우승했습니다.

한 마디로 요약

2025 년 Perception Test 는 인공지능이 자신이 보는 것에 대해 이야기하는 법을 빠르게 배우고 있지만, 혼란스러워지지 않고 모든 것을 동시에 수행하는 법은 아직 배우고 있음을 보여줍니다. "특수 로봇"과 "일반적인 인간과 같은 지각" 사이의 격차는 줄어들고 있지만, 결승선은 아직 조금 더 멀리 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →