← Últimos artigos
💬 NLP

M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models

Este artigo apresenta o M3Kang, o primeiro conjunto de dados de raciocínio matemático massivamente multilíngue e multimodal derivado da Competição de Matemática Kangaroo, que avalia modelos de visão-linguagem de última geração em comparação com o desempenho humano e revela suas limitações atuais em matemática básica e raciocínio baseado em diagramas em 108 idiomas.

Autores originais: Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, Jordi Ros-Giralt

Publicado 2026-01-26
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, Jordi Ros-Giralt

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um concurso de matemática gigante e global chamado "Kangaroo Math Competition". Todos os anos, mais de seis milhões de crianças menores de 18 anos de mais de 90 países participam. Elas resolvem enigmas matemáticos complicados, alguns dos quais são apenas palavras, mas muitos exigem olhar para diagramas, formas e imagens para descobrir a resposta.

Agora, imagine uma equipe de pesquisadores da Qualcomm AI Research decidindo transformar este concurso em um teste massivo para Inteligência Artificial. Eles construíram uma nova ferramenta chamada M3Kang. Pense no M3Kang como um "tradutor universal e professor de matemática" tudo em um único conjunto de dados.

Aqui está a divisão simples do que eles fizeram e do que descobriram:

1. O Grande Projeto: Construindo o Teste de Matemática Definitivo

Os pesquisadores pegaram os problemas de matemática originais (que eram majoritariamente em catalão e inglês) e os traduziram para 108 idiomas diferentes.

  • A Escala: Eles não apenas traduziram as palavras; eles mantiveram as imagens e diagramas anexados às perguntas. Isso resultou em mais de 111.000 problemas matemáticos únicos.
  • O Objetivo: Eles queriam ver se os modelos de IA (os "cérebros" por trás de chatbots e geradores de imagens) conseguiam resolver problemas de matemática em outras línguas além do inglês e se eles conseguiam realmente "ver" e entender os diagramas, não apenas ler o texto.

2. Como Eles Construíram Isso (A Linha de Montagem)

Criar um conjunto de dados deste tamanho é como construir uma linha de montagem de uma fábrica.

  • Passo 1: Eles pegaram os PDFs originais do concurso de matemática e os transformaram em imagens limpas com texto.
  • Passo 2: Eles usaram IA para traduzir as perguntas para o inglês primeiro, verificando duas vezes se a tradução não quebrava a lógica matemática.
  • Passo 3: Eles usaram um truque inteligente de "retrotradução" para verificar os outros 108 idiomas. Imagine traduzir uma frase do espanhol para o inglês e, em seguida, traduzi-la imediatamente de volta para o espanhol. Se o resultado parecer diferente do original, a tradução é ruim. Eles usaram este método para filtrar automaticamente as traduções ruins.

3. Os Resultados: Como a IA se Saiu?

Eles testaram os modelos de IA mais inteligentes disponíveis (tanto gratuitos/abertos quanto caros/fechados) contra este novo teste. Aqui está o que descobriram:

  • A "Vantagem do Inglês" é Real: Assim como um aluno que estuda apenas em inglês pode ter dificuldades em uma sala de aula francesa, os modelos de IA foram muito melhores em resolver problemas de matemática em inglês. À medida que o idioma se tornava menos comum na internet (como o suaíli ou o maltês), o desempenho da IA caía significamente. É como se a IA esquecesse como fazer matemática quando a língua mudava.
  • Tamanho Importa (Mas Não para Tudo): Modelos de IA maiores geralmente tiveram um desempenho melhor. No entanto, mesmo os modelos maiores e mais inteligentes tiveram dificuldades com lógica básica e diagramas.
  • O Problema da "Cegueira": Esta foi a descoberta mais surpreendente. Quando humanos fazem o teste, eles na verdade acham os problemas com imagens mais fáceis do que os que possuem apenas texto. Mas para a IA, é o oposto! Os modelos de IA ficaram significativamente piores quando uma imagem estava envolvida. É como um aluno que é ótimo em ler um problema de texto, mas trava quando precisa olhar para um gráfico. A IA parece ter dificuldade em conectar os pontos entre o texto e a imagem.
  • IA vs. Humanos: Eles compararam as pontuações da IA com as pontuações reais de 68.000 estudantes humanos.
    • A melhor IA (Gemini-2.5-Pro) teve um desempenho de um aluno de alto nível em inglês, mas seu desempenho caiu para "médio" ou "abaixo da média" em idiomas de poucos recursos.
    • Curiosamente, a IA não melhorou à medida que a matemática ficava mais difícil da mesma forma que os humanos fazem. Às vezes, a IA gabaritava os problemas mais difíceis, mas falhava nos mais fáceis, sugerindo que ela está "adivinhando" ou usando um tipo de raciocínio diferente do de uma criança humana.

4. Podemos Consertar Isso?

Os pesquisadores testaram alguns "truques de treinamento" para ajudar a IA a falar melhor outros idiomas.

  • O Truque do "Tradutor": Eles descobriram que, se dissessem à IA: "Primeiro, traduza esta pergunta para o inglês em sua mente, resolva-a e depois dê a resposta", a IA ficava muito melhor em resolver problemas em outros idiomas. É como dar um dicionário a um aluno logo antes do teste.
  • O Truque do "Direcionamento": Eles tentaram direcionar o processo de pensamento interno da IA para ser mais "parecido com o inglês", mesmo ao falar outros idiomas. Isso ajudou um pouco, mas o truque do "Tradutor" foi o vencedor.

A Conclusão Final

O artigo conclui que, embora a IA esteja ficando incrivelmente inteligente, ela ainda tem um ponto cego importante: ela tem dificuldade em combinar leitura, visão e pensamento através de diferentes idiomas.

Os pesquisadores tornaram todos os seus dados e códigos públicos (open-source) para que outros cientistas possam usar este "Teste Kangaroo" para construir uma IA melhor e mais inclusiva, que não apenas fale inglês, mas que possa realmente fazer matemática em qualquer idioma, com ou sem uma imagem. Eles esperam que isso ajude a criar uma IA que seja verdadeiramente global e justa para todos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →