← Derniers articles
💻 computer science

MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

Cet article présente MME-VideoOCR, un benchmark complet comprenant 25 tâches à travers 44 scénarios vidéo pour évaluer les capacités de reconnaissance optique de caractères dans les modèles de langage multimodaux de grande taille, révélant que les modèles de pointe actuels éprouvent des difficultés avec la compréhension vidéo holistique, le raisonnement spatio-temporel et l'intégration inter-images malgré une précision de seulement 73,7 % même avec les systèmes les plus performants.

Auteurs originaux : Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zh
Publié 2026-08-18
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zhang, Liang Wang, Haoxuan Li, Zhouchen Lin, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Wenjing Yang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le bourdonnement discret d'un ordinateur moderne, une nouvelle forme d'intelligence apprend à voir. Ces systèmes, connus sous le nom de modèles de langage de grande taille multimodaux, sont conçus pour traiter non seulement des mots, mais aussi des images et des vidéos, les fusionnant en un flux unique de compréhension. Ils sont devenus remarquablement habiles pour lire du texte à partir d'images statiques, transformant la photographie d'un panneau de signalisation ou d'un document en mots numériques avec une grande précision. Cette capacité a ouvert des portes pour que les machines puissent naviguer dans le monde, lire des instructions et organiser l'information. Cependant, le monde réel est rarement immobile. Il bouge, change et se transforme. Lorsque ces mêmes systèmes intelligents sont sollicités pour lire du texte dans une vidéo en mouvement, la tâche devient bien plus difficile. Le texte peut devenir flou alors qu'une voiture passe rapidement, n'apparaître que pendant une fraction de seconde, ou être dispersé à travers différents moments dans le temps. Comprendre le texte en mouvement exige plus que de simplement voir ; cela demande de se souvenir, de connecter et de raisonner à travers une séquence d'événements.

Une équipe de chercheurs a maintenant examiné de près la capacité de ces systèmes avancés à gérer le texte dans le monde dynamique de la vidéo. Ils ont construit un nouveau terrain d'essai appelé MME-VideoOCR, une collection complète de clips vidéo conçue pour défier les machines de la même manière que les yeux et les esprits humains peinent face au texte en mouvement. Ce test ne demande pas simplement à un ordinateur de lire un mot ; il demande à l'ordinateur de trouver un nombre spécifique sur une voiture de course, de suivre une plaque d'immatriculation tandis qu'un véhicule change de voie, ou de reconstituer une phrase qui est découpée et éparpillée sur plusieurs secondes de séquences. Les chercheurs ont rassemblé 1 464 vidéos, allant de courts clips à des séquences plus longues, couvrant quarante-quatre scénarios différents du monde réel comme la conduite, la cuisine, le visionnage de journaux télévisés et l'assistance à des conférences. Pour chaque vidéo, ils ont créé deux mille questions et réponses soigneusement élaborées, toutes vérifiées par des experts humains pour garantir l'exactitude et l'équité.

Lorsqu'ils ont mis à l'épreuve dix-huit des modèles de lecture vidéo les plus avancés, les résultats ont révélé un écart significatif entre les capacités actuelles et les exigences du monde réel. Même le système le plus performant, un modèle puissant connu sous le nom de Gemini-2.5 Pro, n'a réussi à répondre correctement que 73,7 % du temps. Bien que ce score puisse sembler élevé, les chercheurs ont constaté que les modèles échouaient de manière spectaculaire sur les tâches qui exigeaient qu'ils regardent l'ensemble de la vidéo et connectent les informations à travers le temps. Par exemple, lorsqu'on leur demandait de reconnaître une lettre formée par la trajectoire d'un objet en mouvement, ou de reconstruire un mot à partir de lettres apparaissant dans un ordre aléatoire à travers différentes images, les meilleurs modèles obtenaient un score proche de zéro. Ils pouvaient lire un panneau clairement visible dans une seule image, mais ils perdaaient souvent le fil lorsque l'information était dispersée.

L'étude a également mis au jour une habitude particulière dans la façon dont ces machines pensent. Face à un texte flou ou mal orthographié, les modèles ignoraient fréquemment ce qui se trouvait réellement à l'écran pour deviner ce que le texte devrait dire en se basant sur des schémas linguistiques courants. Si un panneau dans une vidéo indiquait clairement « OFF COURS » avec une lettre manquante, le modèle le rapportait souvent avec assurance comme étant « OFF COURSE », privilégiant sa connaissance interne de l'orthographe habituelle des mots sur l'évidence visuelle. Cette tendance à se fier à ce qu'il s'attend à voir, plutôt qu'à ce qui est réellement présent, suggère que ces systèmes sont encore fortement influencés par leur entraînement sur le langage écrit, parfois au détriment de la précision visuelle.

De plus, les chercheurs ont découvert que la qualité de l'entrée vidéo importe énormément. Lorsqu'ils alimentaient les modèles avec des images de résolution inférieure ou moins d'images issues de la vidéo, la performance chutait brutalement. Les machines avaient besoin d'une clarté haute définition et d'un nombre suffisant de moments dans le temps pour reconstituer l'histoire. Cette conclusion souligne que rendre un modèle simplement plus grand ou plus intelligent ne suffit pas ; la façon dont il voit le monde doit être nette et continue. L'étude conclut que, bien que ces intelligences artificielles aient fait de grands progrès dans la lecture d'images statiques, elles manquent encore de la capacité à comprendre pleinement la nature fluide, fragmentée et souvent désordonnée du texte en mouvement. La voie à suivre nécessite non seulement de meilleurs algorithmes, mais une intégration plus profonde de la mémoire visuelle et une résistance à l'envie de deviner par habitude.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →