MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
Este artigo apresenta o MME-VideoOCR, um benchmark abrangente que apresenta 25 tarefas em 44 cenários de vídeo para avaliar as capacidades de Reconhecimento Óptico de Caracteres em Grandes Modelos de Linguagem Multimodais, revelando que os atuais modelos de última geração têm dificuldades com a compreensão holística de vídeo, o raciocínio espaço-temporal e a integração entre quadros, apesar de alcançarem apenas 73,7% de precisão mesmo com os sistemas de melhor desempenho.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
No zumbido silencioso de um computador moderno, um novo tipo de inteligência está aprendendo a enxergar. Esses sistemas, conhecidos como modelos de linguagem de grande escala multimodais, são projetados para processar não apenas palavras, mas também imagens e vídeos, fundindo-os em um único fluxo de compreensão. Eles tornaram-se notavelmente habilidosos em ler texto de imagens estáticas, transformando uma fotografia de uma placa de rua ou de um documento em palavras digitais com alta precisão. Essa capacidade abriu portas para que as máquinas naveguem pelo mundo, leiam instruções e organizem informações. No entanto, o mundo real raramente está parado. Ele se move, muda e se transforma. Quando esses mesmos sistemas inteligentes são solicitados a ler texto de um vídeo em movimento, a tarefa torna-se muito mais difícil. O texto pode borrar conforme um carro passa em alta velocidade, aparecer apenas por uma fração de segundo ou estar espalhado por diferentes momentos no tempo. Compreender o texto em movimento exige mais do que apenas ver; exige lembrar, conectar e raciocinar através de uma sequência de eventos.
Uma equipe de pesquisadores agora analisou de perto o quão bem esses sistemas avançados lidam com o texto no mundo dinâmico do vídeo. Eles construíram um novo campo de testes chamado MME-VideoOCR, uma coleção abrangente de clipes de vídeo projetada para desafiar as máquinas das formas específicas em que os olhos e as mentes humanas têm dificuldade com textos em movimento. Este benchmark não pede simplesmente que um computador leia uma palavra; ele pede ao computador que encontre um número específico em um carro de corrida, rastreie uma placa de licença enquanto um veículo muda de faixa ou monte uma frase que está fragmentada e espalhada por vários segundos de filmagem. Os pesquisadores reuniram 1.464 vídeos, variando de clipes curtos a sequências mais longas, cobrindo quarenta e quatro diferentes cenários do mundo real, como dirigir, cozinhar, assistir a notícias e assistir a palestras. Para cada vídeo, eles criaram duas mil perguntas e respostas cuidadosamente elaboradas, todas verificadas por especialistas humanos para garantir precisão e justiça.
Quando colocaram dezoito dos modelos de leitura de vídeo mais avançados à prova, os resultados revelaram uma lacuna significativa entre as capacidades atuais e as exigências do mundo real. Mesmo o sistema de melhor desempenho, um modelo poderoso conhecido como Gemini-2.5 Pro, conseguiu responder corretamente apenas 73,7 por cento das vezes. Embora isso possa parecer uma pontuação alta, os pesquisadores descobriram que os modelos falharam dramaticamente em tarefas que exigiam que eles olhassem para o vídeo como um todo e conectassem informações ao longo do tempo. Por exemplo, ao serem solicitados a reconhecer uma letra formada pelo trajeto de um objeto em movimento, ou a reconstruir uma palavra a partir de letras que apareceram em ordem aleatória em diferentes quadros, os melhores modelos pontuaram próximo de zero. Eles consegiam ler uma placa claramente visível em um único quadro, mas frequentemente perdiam o fio da meada quando a informação estava espalhada.
O estudo também descobriu um hábito peculiar na forma como essas máquinas pensam. Diante de um texto borrado ou com erro de ortografia, os modelos frequentemente ignoravam o que estava realmente na tela e, em vez disso, supunham o que o texto deveria dizer com base em padrões comuns de linguagem. Se uma placa em um vídeo lia claramente "OFF COURS" com uma letra faltando, o modelo frequentemente a relatava confiantemente como "OFF COURSE", priorizando seu conhecimento interno de como as palavras são usualmente escritas sobre a evidência visual. Essa tendência de confiar no que se espera ver, em vez do que realmente está lá, sugere que esses sistemas ainda são fortemente influenciados por seu treinamento em linguagem escrita, às vezes em detrimento da precisão visual.
Além disso, os pesquisadores descobriram que a qualidade da entrada de vídeo importa imensamente. Quando alimentaram os modelos com imagens de baixa resolução ou menos quadros do vídeo, o desempenho caiu drasticamente. As máquinas precisavam de clareza de alta definição e de um número suficiente de momentos no tempo para montar a história. Essa descoberta destaca que simplesmente tornar um modelo maior ou mais inteligente não é o suficiente; a maneira como ele vê o mundo deve ser nítida e contínua. O estudo conclui que, embora essas inteligências artificiais tenham feito grandes progressos na leitura de imagens estáticas, elas ainda carecem da capacidade de compreender plenamente a natureza fluida, fragmentada e muitas vezes caótica do texto em movimento. O caminho a seguir requer não apenas melhores algoritmos, mas uma integração mais profunda da memória visual e uma resistência ao impulso de adivinhar com base no hábito.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.