← Últimos artigos
🤖 machine learning

VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs

O benchmark VRIQ revela que os atuais Modelos de Linguagem e Visão apresentam um desempenho insatisfatório em tarefas de raciocínio visual, principalmente devido a limitações de percepção em vez de déficits de raciocínio, com uma precisão variando de 28% em quebra-cabeças abstratos a 45% em imagens naturais.

Autores originais: Tina Khezresmaeilzadeh, Jike Zhong, Konstantinos Psounis

Publicado 2026-02-06
📖 4 min de leitura☕ Leitura rápida

Autores originais: Tina Khezresmaeilzadeh, Jike Zhong, Konstantinos Psounis

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma equipe de robôs incrivelmente inteligentes que conseguem ler livros e olhar para imagens. Você quer saber se eles são verdadeiramente "inteligentes" ou se são apenas muito bons em adivinhar. Para descobrir, os autores deste artigo construíram um teste especial chamado VRIQ (QI de Raciocínio Visual).

Pense no VRIQ como uma gigante "caixa de quebra-cabeças" digital projetada para enganar esses robôs. A caixa contém dois tipos de quebra-cabeças:

  1. Quebra-cabeças Abstratos: Estes são como cartões clássicos de testes de QI com formas, linhas e padrões estranhos. Não há objetos do mundo real aqui, apenas símbolos.
  2. Quebra-cabeças Naturais: Estes usam fotos reais de coisas cotidianas, como maçãs, carros ou pessoas, mas fazem as mesmas perguntas de lógica complicadas.

A Grande Surpresa: Os Robôs São "Cegos"

Quando os pesquisadores testaram os modelos de IA mais inteligentes disponíveis (incluindo os famosos da OpenAI e do Google), eles descobriram algo chocante.

  • Nos Quebra-cabeças Abstratos: Os robôs tiveram um desempenho quase tão ruim quanto se estivessem apenas adivinhando aleatoriamente. A pontuação média deles foi de cerca de 28% (onde 25% é pura sorte). É como um aluno que memorizou o dicionário, mas não consegue ler uma única frase.
  • Nos Quebra-cabeças Naturais: Eles foram um pouco melhor (cerca de 45%), mas ainda estavam longe de serem perfeitos.

O artigo revela que o problema não é que os robôs sejam ruins em pensar (raciocinar). O problema é que eles são ruins em ver (percepção).

O Trabalho de Detetive: Por Que Eles Falharam?

Para descobrir exatamente onde os robôs estavam falhando, os pesquisadores agiram como detetives. Eles não apenas perguntaram: "Qual é a resposta?". Eles quebraram cada quebra-cabeça em etapas minúsculas usando "perguntas de sondagem".

Imagine um robô falhando em um quebra-cabeça onde ele tem que encontrar a forma diferente. Os pesquisadores perguntaram:

  • Sondagem de Percepção: "Quantos círculos vermelhos você vê?"
  • Sondagem de Raciocínio: "Se existem 3 círculos vermelhos e a regra é 'remover um', o que sobra?"

Os Resultados da Investigação:

  • 56% das vezes: O robô falhou porque não conseguiu ver o básico (ex: não conseguiu contar os círculos ou dizer para que lado uma forma estava apontando).
  • 43% das vezes: O robô não conseguiu ver o básico e não conseguiu entender a lógica.
  • Apenas 1% das vezes: O robô viu tudo perfeitamente, mas errou a lógica.

A Metáfora: É como dar uma receita de bolo para um chef. O chef (a IA) conhece perfeitamente a lógica de cozinhar. Mas se o chef estiver vendado e não conseguir ver que existem apenas 2 ovos em vez de 4, o bolo vai falhar. A falha não foi a lógica da culinária; foi a incapacidade de ver os ingredientes.

A Reviravolta da "Ferramenta"

Os pesquisadores tentaram mais uma coisa. Eles deram a um modelo de IA específico (o o3 da OpenAI) um conjunto de ferramentas digitais, como uma lupa, uma tesoura (para recortar imagens) e uma calculadora. Esse modelo teve permissão para "pensar com imagens", manipulando ativamente a foto antes de responder.

O Resultado: Esse robô que usa ferramentas disparou. Ele saltou de uma pontuação de 28% para mais de 50% em quebra-cabeças abstratos e até 80-100% em quebra-cabeças naturais. Isso prova que, se você der aos robôs "olhos" melhores (ferramentas para ver claramente), o "cérebro" (raciocínio) deles funciona muito melhor.

A Conclusão

O artigo conclui que os modelos de IA atuais não estão falhando por falta de inteligência ou lógica. Eles estão falhando porque têm dificuldade em perceber o mundo visual de forma precisa. Eles não conseguem contar objetos de forma confiável, entender a profundidade 3D ou dizer para que lado algo está rotacionado.

Para tornar a IA verdadeiramente inteligente no raciocínio visual, não precisamos apenas de cérebros maiores; precisamos dar a eles olhos melhores.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →