← 최신 논문
💻 computer science

MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

이 논문은 멀티모달 거대 언어 모델의 광학 문자 인식(OCR) 능력을 평가하기 위해 44개의 비디오 시나리오에 걸친 25개의 태스크를 특징으로 하는 포괄적인 벤치마크인 MME-VideoOCR을 소개하며, 현재의 최첨단 모델들이 최고 성능의 시스템을 사용하더라도 단 73.7%의 정확도만을 달축성했다는 점을 통해 전반적인 비디오 이해, 시공간적 추론, 그리고 프레임 간 통합 능력에서 어려움을 겪고 있음을 밝혀낸다.

원저자: Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zh
게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zhang, Liang Wang, Haoxuan Li, Zhouchen Lin, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Wenjing Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대적인 컴퓨터의 조용한 웅성거림 속에서, 새로운 종류의 지능이 보는 법을 배우고 있다. 멀티모달 거대 언어 모델(multimodal large language models)로 알려진 이 시스템들은 단어뿐만 아니라 이미지와 비디오까지 처리하도록 설계되어, 이를 하나의 이해의 흐름으로 결합한다. 이들은 정지된 사진에서 텍스트를 읽어내는 데 매우 능숙해졌으며, 거리 표지판이나 문서의 사진을 높은 정밀도로 디지털 단어로 변환해 낸다. 이러한 능력은 기계가 세상을 탐색하고, 지시 사항을 읽고, 정보를 정리할 수 있는 문을 열어주었다. 하지만 현실 세계는 좀처럼 정지해 있지 않다. 세상은 움직이고, 변화하며, 바뀐다. 이와 동일한 지능형 시스템에 움직이는 비디오에서 텍스트를 읽도록 요청하면, 그 작업은 훨씬 더 어려워진다. 자동차가 빠르게 지나갈 때 텍스트가 흐릿해지거나, 아주 짧은 순간 동안만 나타나거나, 서로 다른 시간대에 흩어져 있을 수 있기 때문이다. 움직이는 텍스트를 이해하는 것은 단순히 보는 것 이상의 것을 요구한다. 그것은 일련의 사건들에 걸쳐 기억하고, 연결하고, 추론할 것을 요구한다.

한 연구팀이 이제 이러한 첨단 시스템들이 역동적인 비디오 세계에서 텍스트를 얼마나 잘 다루는지 면밀히 살펴보았다. 그들은 기계가 움직이는 텍스트를 마주할 때 인간의 눈과 마음이 어려움을 겪는 방식과 유사하게 도전할 수 있도록 설계된 종합적인 비디오 클립 모음인 MME-VideoOCR이라는 새로운 테스트 환경을 구축했다. 이 벤치마크는 단순히 컴퓨터에게 단어를 읽으라고 요구하지 않는다. 대신 레이싱 카에 적힌 특정 숫자를 찾거나, 차량이 차선을 변경할 때 번호판을 추적하거나, 여러 초에 걸쳐 끊어지고 흩어진 문장을 구성해 내라고 요구한다. 연구진은 운전, 요리, 뉴스 시청, 강의 참석과 같은 44가지의 다양한 실제 상황을 아우르는, 짧은 클립부터 긴 시퀀스에 이르는 1,464개의 비디오를 수집했다. 각 비디오에 대해 연구진은 2,000개의 정교하게 제작된 질문과 답변을 만들었으며, 정확성과 공정성을 보장하기 위해 모두 인간 전문가의 검증을 거쳤다.

이들이 18개의 가장 진보된 비디오 판독 모델을 테스트에 투입했을 때, 결과는 현재의 역량과 현실 세계의 요구 사이의 상당한 격차를 드러냈다. 가장 뛰어난 성능을 보인 모델인 강력한 Gemini-2.5 Pro조차도 정답률이 73.7퍼센트에 불과했다. 이것이 높은 점수처럼 보일 수도 있지만, 연구진은 모델들이 비디오 전체를 바라보고 시간에 걸쳐 정보를 연결해야 하는 과제에서 처참하게 실패했다는 것을 발견했다. 예를 들어, 움직이는 물체의 경로로 형성된 글자를 인식하거나, 여러 프레임에 걸쳐 무작위 순서로 나타난 글자들로부터 단어를 재구성하라는 요청을 받았을 때, 상위 모델들은 거의 0점에 가까운 점수를 기록했다. 그들은 단일 프레임에서 명확하게 보이는 표지판은 읽을 수 있었지만, 정보가 분산되어 있을 때는 맥락을 놓치는 경우가 많았다.

연구는 또한 이 기계들이 생각하는 방식에 있는 기묘한 습관을 밝혀냈다. 흐릿하거나 철자가 틀린 텍스트에 직면했을 때, 모델들은 화면에 실제로 있는 내용을 무시하고 대신 일반적인 언어 패턴에 기반하여 텍스트가 무엇이어야 하는지를 추측하는 경향이 빈번하게 나타났다. 만약 비디오 속 표지판이 글자 하나가 빠진 채 "OFF COURS"라고 명확히 적혀 있다면, 모델은 시각적 증거보다 일반적인 단어 철자 규칙에 대한 내부 지식을 우선시하여 자신 있게 "OFF COURSE"라고 보고하곤 했다. 실제 보이는 것보다 기대되는 것을 보려는 이러한 경향은, 이 시스템들이 여전히 쓰인 언어에 대한 학습에 크게 영향을 받고 있으며, 때로는 시각적 정확성을 희생하면서까지 그렇다는 것을 시사한다.

나아가, 연구진은 비디오 입력의 품질이 엄청나게 중요하다는 사실을 발견했다. 모델에 저해상도 이미지를 입력하거나 비디오의 프레임을 적게 제공했을 때, 성능은 급격히 떨어졌다. 기계들은 이야기를 구성하기 위해 고해상도의 선명함과 충분한 시간적 순간들을 필요로 했다. 이 발견은 단순히 모델을 더 크게 만들거나 더 똑똑하게 만드는 것만으로는 충분하지 않다는 점을 강조한다. 모델이 세상을 보는 방식은 날카롭고 연속적이어야 한다. 연구는 인공지능이 정지된 이미지 읽기에서는 큰 진전을 이루었지만, 움직이는 텍스트의 유동적이고 파편화되며 종종 무질서한 본질을 완전히 이해하는 데에는 여전히 부족하다는 결론을 내린다. 앞으로 나아갈 길은 더 나은 알고리즘뿐만 아니라, 시각적 기억의 더 깊은 통합과 습관에 기반해 추측하려는 충동에 대한 저항력을 요구한다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →