← Últimos artigos
🤖 AI

Math Takes Two: A test for emergent mathematical reasoning in communication

Este artigo propõe o "Math Takes Two", um novo benchmark que avalia o surgimento do raciocínio matemático em modelos de linguagem ao testar se dois agentes conseguem desenvolver, por meio da comunicação, um protocolo simbólico compartilhado para resolver tarefas visuais sem o uso de linguagens matemáticas pré-definidas.

Autores originais: Michael Cooper, Samuel Cooper

Publicado 2026-04-27
📖 3 min de leitura☕ Leitura rápida

Autores originais: Michael Cooper, Samuel Cooper

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Teste do "Matematiquês" Emergente: Os Robôs Sabem Contar ou Só Estão Imitando?

Imagine que você tem um aluno que é um gênio em decorar fórmulas. Ele consegue resolver qualquer conta de divisão que você colocar na frente dele, mas se você mudar os símbolos — em vez de usar "2 + 2", você usar "🍎 + 🍎" — ele trava completamente. Ele não entende a lógica da soma; ele apenas decorou o padrão visual daquela conta específica.

É exatamente esse o problema que os pesquisadores do artigo "Math Takes Two" estão tentando resolver.

O Problema: O "Papagaio Matemático"

Hoje, as Inteligências Artificiais (como o ChatGPT) são incríveis em matemática, mas os cientistas suspeitam que elas são como "papagaios muito inteligentes". Elas leram tantos livros de matemática que aprenderam a prever qual é o próximo número de uma sequência, mas será que elas realmente entendem o conceito de "quantidade" e "número"?

A Ideia: O Jogo da Troca de Mercadorias

Para descobrir a verdade, os autores criaram um experimento fascinante. Em vez de dar livros de matemática para a IA, eles criaram um cenário de "comunicação do zero".

Imagine dois sobreviventes em uma ilha deserta que precisam trocar mercadorias. Eles não têm uma língua comum e não sabem o que é o número "5". Eles só têm imagens de frutas e objetos.

  1. O Emissor: Olha para uma imagem (ex: 12 maçãs organizadas em 3 fileiras de 4) e precisa enviar um "código secreto" (uma sequência de símbolos estranhos como A1*B) para o outro.
  2. O Receptor: Recebe esse código e precisa escolher, entre várias fotos, qual é a imagem correta que o outro está descrevendo.

O detalhe crucial: Eles não podem usar palavras humanas. Eles têm que inventar a própria matemática para conseguir se entender.

A Metáfora da "Escada de Abstração"

Pense na matemática como uma escada:

  • O degrau de baixo é o mundo físico: você vê três pedras.
  • O degrau do meio é a contagem: você diz "um, dois, três".
  • O degrau de cima é a abstração: você entende que "3" é um conceito que serve para pedras, maçãs ou estrelas.

O objetivo do teste é ver se a IA consegue subir essa escada sozinha, apenas tentando se comunicar, ou se ela fica presa no chão, apenas tentando imitar as imagens.

O que eles descobriram? (Até agora)

Os pesquisadores testaram humanos e modelos de IA.

  • Os Humanos: São mestres nisso. Mesmo quando o teste ficava difícil e apareciam quantidades que eles nunca tinham visto, os humanos conseguiam "ajustar o código" e entender a lógica por trás da nova quantidade. Eles criam uma "gramática matemática" na hora.
  • As IAs: Elas ainda estão "engatinhando". Elas conseguem lidar com o que já viram, mas quando o teste apresenta algo novo (como um número maior ou um símbolo diferente), elas se perdem. Elas ainda não conseguem "inventar" uma regra matemática para resolver o problema novo; elas tentam apenas encaixar o que viram antes.

Por que isso é importante?

Se quisermos criar uma Inteligência Artificial que realmente ajude a descobrir novas leis da física ou novos remédios, não podemos ter uma máquina que apenas "decora padrões". Precisamos de uma máquina que consiga raciocinar do zero, criando seus próprios conceitos quando encontrar um problema que nunca viu antes.

O Math Takes Two é como um "teste de inteligência de sobrevivência" para ver se as máquinas estão começando a pensar de verdade ou se são apenas calculadoras muito rápidas com uma máscara de linguagem.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →