← Últimos artigos
💻 computer science

Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems

Este artigo apresenta o Sci-Rho, um benchmark simbólico multilingue e visualmente fundamentado que compreende 4.242 modelos de problemas de STEM executáveis em cinco disciplinas e sete idiomas, o qual revela lacunas significativas de robustez em Modelos de Linguagem-Visão de última geração quando avaliados contra variações de pior caso em vez de médias estáticas.

Autores originais: Muhammad Falensi Azmi, Ikhlasul Akmal Hanif, Vallerie Alexandra Putra, Adi Yeltay, Abdullah Mubarak, Fajri Koto

Publicado 2026-06-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Muhammad Falensi Azmi, Ikhlasul Akmal Hanif, Vallerie Alexandra Putra, Adi Yeltay, Abdullah Mubarak, Fajri Koto

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está testando a habilidade de um novo aluno para resolver problemas de ciências. No passado, os pesquisadores entregavam ao aluno uma folha de exercícios única e estática, com uma imagem e uma pergunta. Se o aluno acertasse, ele passava. Mas este artigo argumenta que isso é como testar um motorista apenas em uma estrada reta e vazia. Isso não diz se ele consegue lidar com um buraco repentino, um desvio ou uma condição climática diferente.

Os autores deste artigo, Sci-ρ, decidiram construir um teste de condução muito mais difícil e dinâmico para alunos de IA (especificamente, Modelos de Linguagem-Visão ou VLMs).

Aqui está uma divisão simples do que eles fizeram e do que descobriram:

1. O Teste de "Mudança de Forma" (O Conjunto de Dados)

Em vez de dar à IA 606 perguntas estáticas de ciências, os pesquisadores construíram uma fábrica digital.

  • O Projeto: Eles criaram 606 "templates" de problemas em Matemática, Física, Química, Biologia e Ciência da Computação. Pense neles como projetos mestres.
  • A Fábrica: Eles escreveram um código de computador (Python) que pega esses projetos e imprime instantaneamente 10 versões ligeiramente diferentes de cada problema.
    • Exemplo: Se um problema de matemática pede a área de um quadrado, a fábrica pode imprimir uma versão com um lado de 5, outra com 7, outra com uma cor diferente ou até mesmo com uma forma diferente.
  • O Toque Multilíngue: Eles não fizeram isso apenas em inglês. Eles traduziram as instruções para 7 idiomas (incluindo Suaíli, Hindi e Árabe), mantendo as imagens iguais.
  • O Resultado: Eles acabaram com 42.420 problemas únicos. É como dar à IA uma biblioteca enorme onde cada livro tem 10 edições diferentes, todas perguntando a mesma lógica central, mas parecendo ligeiramente diferentes.

2. A Armadilha do "Média" vs. "Pior Caso"

Os pesquisadores testaram 17 modelos de IA diferentes nesta biblioteca massiva. Eles observaram duas pontuações:

  • Precisão Média: Com que frequência a IA acertou a resposta em todas as 10 versões de um problema.
  • Precisão do Pior Caso: Com que frequência a IA acertou todas as 10 versões de um problema.

A Grande Descoberta:
Os modelos de IA pareceram ótimos na pontuação de "Média". Mas quando os pesquisadores olharam para a pontuação do "Pior Caso", os modelos desmoronaram.

  • A Analogia: Imagine um aluno que acerta 9 de 10 problemas de matemática. Ele parece inteligente. Mas se você pedir para ele resolver os mesmos 10 problemas novamente com números ligeiramente diferentes, e ele errar 4 deles desta vez, ele não está realmente "raciocinando" através da matemática. Ele provavelmente está apenas memorizando padrões ou adivinhando com base em como os números parecem.
  • O Achado: Mesmo os modelos de IA mais inteligentes e caros (como o GPT-5.4) mostraram um grande abismo. Eles podiam resolver um problema facilmente, mas se você mudasse a cor de um gráfico ou os números levemente, eles frequentemente falhavam. Modelos menores e mais baratos falhavam ainda mais.

3. A Barreira Linguística

Os pesquisadores verificaram se a IA tinha mais dificuldade quando as instruções estavam em um idioma diferente do inglês.

  • Os Grandes Modelos: Os modelos gigantes e caros eram como poliglotas; eles lidavam com inglês, chinês e suaíli quase tão bem quanto.
  • Os Pequenos Modelos: Os modelos menores e de código aberto eram como turistas que só falam inglês. Quando as instruções mudavam para um idioma menos comum (como o suaíli), o desempenho deles caía significamente. Eles pareciam ficar confusos apenas pela mudança de idioma, embora o problema científico fosse o mesmo.

4. O Problema dos "Olhos vs. Cérebro"

Os pesquisadores espiaram dentro de um dos modelos de IA para ver como ele "pensava". Eles mediram quanta atenção o modelo prestava à imagem versus ao texto.

  • O Achado: A atenção do modelo mudava dependendo do idioma.
    • Quando o texto estava em chinês, o modelo dependia menos da imagem e mais do texto.
    • Quando o texto estava em cazaque ou hindi, o modelo dependia fortemente da imagem.
  • A Metáfora: É como se a IA pensasse: "Eu não entendo bem este idioma, então vou apenas adivinhar com base no desenho". Quando ela entende o idioma perfeitamente, ela confia mais nas palavras. Isso sugere que a IA não está realmente "vendo" a imagem de uma forma humana; ela está apenas usando a imagem como uma muleta quando o texto está confuso.

5. Onde a IA Travou

Quando a IA falhou, os pesquisadores categorizaram os erros:

  1. Leitura Errada da Imagem (63%): A IA não conseguiu contar os pontos em um diagrama ou ler os números em um gráfico corretamente.
  2. Má Lógica (29%): A IA sabia a fórmula correta, mas a aplicou à coisa errada, ou inventou fatos que não estavam lá.
  3. Erros de Matemática (8%): A IA acertou a lógica, mas errou a aritmética simples.

A Conclusão Final

O artigo conclui que testes estáticos estão nos enganando. Só porque uma IA consegue resolver um problema de ciências específico uma vez, não significa que ela entenda a ciência. Ela pode estar apenas reconhecendo um padrão que viu durante o treinamento.

Para saber verdadeiramente se uma IA é inteligente, precisamos balançar a mesa, mudar os números, trocar os idiomas e ver se ela ainda consegue resolver o problema. Se não conseguir, ela não está raciocinando; está apenas adivinhando. O Sci-ρ é a ferramenta projetada para balançar essa mesa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →