← 최신 논문
💻 computer science

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

기존의 단일 턴 비디오 이해 벤치마크의 포화 상태를 해결하기 위해, 본 논문은 현재의 프런티어 멀티모달 거대 언어 모델들이 가진 상당한 성능 격차를 드러내고 이 분야를 에이전트 기반의 비디오 이해로 이끄는 것을 목표로 하는, 271개의 전문가 검증 태스크를 특징으로 하는 엄격한 멀티 턴 도구 증강 벤치마크인 VideoGAIA를 소개한다.

원저자: Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수년 동안 인공지능을 테스트하는 방식은 단순한 게임에 의존해 왔습니다. 컴퓨터에게 영상을 보여주고, 단 하나의 질문을 던진 뒤, 답이 나오기를 기다리는 것입니다. 비디오 이해(video understanding)라고 알려진 이 접근 방식은 기계가 움직이는 세상을 얼마나 잘 보고 추론할 수 있는지를 측정하는 표준 척도가 되었습니다. 최근 들어 가장 진보된 AI 시스템들은 이 작업에 매우 능숙해져서 거의 모든 질문에 정확히 답할 수 있게 되었으며, 이는 기존의 테스트가 더 이상 그들의 진정한 한계를 드러내지 못하는 지점에 도달했음을 의미합니다. 이는 마치 학생이 교과서 전체를 암기하여 어떤 사실이든 암송할 수 있게 되었지만, 여전히 그 학생이 실제 세상에서 새로운 문제를 해결할 수 있는지는 알 수 없는 것과 같습니다. 이 정체기를 극와하기 위해 연구자들은 단순히 사실을 묻는 것이 아니라, 기계가 호기심 많은 인간 조사관처럼 행동하도록 요구하는 새로운 지능 측정법이 필요했습니다.

중국의 대학과 기술 기업 연구진은 이러한 새로운 테스트인 VideoGAIA를 도입했습니다. 모델에게 영상을 보고 단 하나의 질문에 답하라고 요구하는 대신, 이 새로운 벤치마크는 영상을 훨씬 더 긴 조사의 시작점으로 취급합니다. 이 설정에서 인공지능은 에이전트, 즉 자신이 무엇을 모르는지 파악하고, 누락된 정보를 찾아 나서며, 그 모든 것을 모아 복잡한 과제를 해결해야 하는 디지털 비서 역할을 수행합니다. 영상은 특정 휴대폰을 들고 있는 사람이나 도시를 달리는 자동차를 보여줄 수 있지만, 질문에 대한 답은 종종 영상 외부 전체에 존재합니다. 시스템은 영상 속의 단서를 포착하고, 인터넷에서 더 자세한 내용을 검색하기로 결정하고, 검색 결과를 읽은 다음, 다시 영상으로 돌아와 새로운 정보가 기존 정보와 일치하는지 확인해야 합니다. 관찰하고, 검색하고, 읽고, 확인하는 이 과정은 인간이 주제를 조사하는 방식과 유사하게 여러 차례 반복됩니다.

연구진은 인터넷에서 10만 개의 방대한 영상 컬렉션을 수집하며 이 테스트를 구축했습니다. 그들은 강력한 AI 모델을 사용하여 흥-미로운 클립을 선정하고, 영상만 봐서는 답을 낼 수 없는 질문들을 생성했습니다. 예를 들어, 영상에는 스튜디오의 진행자가 많은 휴대폰을 보여주며 초록색 제품 스탠드 옆에 투명한 뒷면을 가진 은색 기기를 들고 있는 모습이 나올 수 있는데, 질문은 해당 모델을 구동하는 구체적인 칩셋 변형 모델을 물을 수 있습니다. 영상 자체에는 칩셋의 이름이나 마케팅 상세 정보가 나타나지 않습니다. 정답을 맞히기 위해서 AI는 먼저 영상 속의 휴대폰을 포착한 다음, 검색 도구를 사용하여 온라인에서 제품 사양을 찾아 웹페이지의 세부 정보를 읽고, 마지막으로 그 칩셋이 시각적 증거와 일치하는지 확인해야 합니다. 연구팀은 이 잠재적 질문들을 엄격한 과정을 통해 필터링했으며, 모든 과제가 공정하고 어렵고 진정한 추론을 요구하는지 확인하기 위해 인간 전문가들이 모든 과제를 검토하게 했습니다. 100시간 이상의 인간 검토를 거친 끝에, 그들은 기술, 역사, 지리, 일상생활, 문화, 경제를 포함한 6가지 실세계 영역을 아우르는 최종 271개의 과제를 확정했습니다.

연구진이 오늘날 가장 진보된 20개의 AI 모델을 이 새로운 벤치마크로 테스트했을 때, 결과는 극명했습니다. 기존 테스트에서 90%에 가까운 점수를 기록했던 가장 강력한 시스템들조차 VideoGAIA에서는 60%의 정확도에 도달하는 데 어려움을 겪었습니다. 가장 성적이 좋았던 모델인 Seed2.0-Pro는 58.30%의 정확도를 달성한 반면, 다른 모델들은 현저히 낮은 점수를 기록했습니다. 이러한 격차는 이 기계들이 눈앞에 있는 것을 인식하는 데는 탁월하지만, 빈틈을 메우기 위해 도구를 효과적으로 사용하는 방법은 여전히 배우는 중임을 보여줍니다. 연구는 가장 큰 실패 원인이 지식의 부족이나 웹을 읽는 능력의 부재가 아니라, 영상 속의 시각적 단서를 처음에 올바르게 식별하지 못한 데 있다는 것을 발견했습니다. 만약 AI가 영상 속의 물체나 세부 사항을 잘못 식별했다면, 잘못된 정보를 검색하게 되어 결국 틀린 답으로 이어지게 됩니다.

연구진은 또한 단순히 AI가 더 많이 검색하거나 더 오래 읽는다고 해서 성공이 보장되지 않는다는 점을 관찰했습니다. 어떤 모델들은 웹을 반복적으로 검색하며 수백 번의 도구 호출을 했음에도 불구하고 과제 해결에 실패했습니다. 반면 어떤 모델들은 호출 횟수는 적었지만 더 정밀하게 작동하여, 충분한 증거를 수집하자마자 멈추기도 했습니다. 가장 성공적인 에이전트들은 불확실성을 유지할 줄 아는 모델들이었습니다. 즉, 정보가 충분하지 않다는 것을 깨닫고 다음에 무엇을 찾아야 할지 정확히 아는 모델들입니다. 이들은 특정 부분을 다시 확인하기 위해 영상을 재방문하고, 이를 웹페이지와 교차 검증한 다음, 비로소 결론을 내렸습니다. 이러한 행동은 결론을 내리기 전 사실을 신중하게 검증하는 인간 전문가의 방식에 더 가깝습니다.

이러한 결과는 차세대 인공지능이 단일 이미지나 영상으로부터 질문에 얼마나 잘 답할 수 있느냐가 아니라, 답을 찾기 위해 세상을 얼마나 잘 탐색할 수 있느냐에 의해 정의될 것임을 시사합니다. VideoGAIA 벤치마크는 이러한 새로운 능력을 위한 엄격한 테스트로서, 진정한 지능형 비서로 가는 길이 단순히 더 나은 시각 기능이나 더 큰 데이터베이스만을 요구하는 것이 아님을 보여줍니다. 그것은 연속적인 루프 안에서 생각하고, 검색하고, 검증하는 능력을 요구합니다. 현재의 모델들이 큰 발전을 이루었음에도 불구하고, 그들 중 누구도 이 새로운 테스트를 완벽히 마스터하지 못했다는 사실은 기계가 우리의 복잡하고 개방적인 일상 과제들을 진정으로 도울 수 있기까지 아직 갈 길이 멀다는 것을 나타냅니다. 이 연구는 미래 발전의 명확한 로드맵을 제공하며, 발전의 핵심이 이러한 시스템을 단순한 관찰자가 아닌 능동적인 조사관으로 가르치는 데 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →