← Últimos artigos
🤖 AI

Bongards at the Boundary of Perception and Reasoning: Programs or Language?

Este artigo introduz uma abordagem neurosimbólica que combina Grandes Modelos de Linguagem para gerar programas parametrizados com otimização bayesiana para o ajuste de parâmetros para resolver problemas de Bongard, estabelecendo assim uma ponte entre a percepção visual e o raciocínio abstrato.

Autores originais: Cassidy Langenfeld, Claas Beger, Gloria Geng, Wasu Top Piriyakulkij, Keya Hu, Yewen Pu, Kevin Ellis

Publicado 2026-02-04
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Cassidy Langenfeld, Claas Beger, Gloria Geng, Wasu Top Piriyakulkij, Keya Hu, Yewen Pu, Kevin Ellis

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Panorama Geral: O Desafio do "Enigma Visual"

Imagine que você recebe um conjunto de 12 desenhos. Seis deles são "bons" (positivos) e seis são "ruins" (negativos). Seu trabalho é descobrir a regra secreta que separa os bons dos ruins.

Isso é chamado de Problema de Bongard. Estes não são apenas simples enigmas de "encontre o intruso". As regras podem ser incrivelmente complexas.

  • Exemplo: Talvez os desenhos "bons" tenham uma forma com um "pescoço" que é horizontal, enquanto os "ruins" têm um pescoço vertical. Ou talvez os desenhos "bons" tenham formas "onduladas", enquanto os "ruins" são "lisas".

O artigo faz uma grande pergunta: A Inteligência Artificial (IA) consegue resolver esses enigmas como os humanos fazem? Os humanos são ótimos em olhar para uma situação inédita, inventar um novo conceito na hora (como "pescoço horizontal") e aplicá-lo. A IA atual é ótima em reconhecer coisas que já viu antes (como "isso é um gato"), mas muitas vezes tem dificuldade quando precisa inventar um novo conceito do zero.

O Problema: A IA é Muito Rígida ou Muito Vaga

Os pesquisadores descobriram que a IA tem duas principais formas de pensar, e ambas possuem falhas ao resolver esses enigros:

  1. A Abordagem "Chatbot" (Linguagem Natural):

    • Como funciona: A IA olha para as imagens e tenta descrever a regra em palavras, como um detetive escrevendo um relatório.
    • A Falha: Ela é boa em ideias amplas, mas ruim em precisão. Ela pode dizer: "As formas boas são meio pontiagudas", mas não consegue distinguir entre uma forma "levemente pontiaguda" e uma "muito pontiaguda". É como um chef que sabe que a receita diz "adicione uma pitada de sal", mas não sabe exatamente quanto isso é.
  2. A Abordagem "Programador" (Código):

    • Como como funciona: A IA escreve um programa de computador para verificar as imagens. Ela pode medir distâncias exatas, ângulos e contagens.
    • A Falha: Ela é ótima em precisão, mas ruim em criatividade. Se a regra for "a forma parece um rosto triste", um programa de computador tem dificuldade em definir "tristeza" matematicamente. É como um robô que consegue medir uma sala até o milímetro, mas não consegue entender o conceito de "aconchegante".

A Solução: A Equipe de "Tradutores"

Os autores construíram um novo sistema que atua como uma equipe de dois especialistas trabalhando juntos. Eles chamam isso de uma abordagem "neurosimbólica" (combinando redes neurais/IA com lógica simbólica/programas).

Veja como essa equipe trabalha, passo a passo:

Passo 1: O Gerador de Ideias (O "Chatbot")

Primeiro, eles pedem a uma IA poderosa (um Modelo de Visão-Linguagem) para olhar para o enigma e sugerir algumas regras possíveis em inglês simples.

  • Analogia: Imagine uma sessão de brainstorming onde um escritor criativo sugere: "Talvez a regra seja sobre o 'pescoço' da forma!"

Passo 2: O Tradutor (O "Programador")

Em seguida, o sistema pega essas sugestões em inglês e tenta transformá-las em código de computador.

  • A Reviravolta: A IA não apenas escreve o código; ela deixa "espaços em branco" para os números complicados. Por exemplo, se a regra for "formas com um pescoço mais longo que X", a IA escreve o código, mas deixa X como uma variável misteriosa.
  • Analogia: O escritor diz: "O pescoço deve ser mais longo que [ESPAÇO EM BRANCO]". O programador prepara a máquina para medir o pescoço, mas espera pelo número exato.

Passo 3: O Ajustador (Otimização Bayesiana)

Este é o ingrediente secreto. O sistema executa um processo de "tentativa e erro" para encontrar o número perfeito para esses espaços em branco. Ele testa diferentes números (como 5 pixels, 10 pixels, 15 pixels) para ver qual deles separa perfeitamente as imagens "boas" das "ruins".

  • Analogia: Imagine que você está sintonizando um rádio. Você sabe que a estação está em algum lugar entre 90 e 100, mas não sabe a frequência exata. Você gira o dial lentamente até que o ruído desapareça e a música fique perfeita. O sistema faz isso matematicamente para encontrar o ponto de "corte" exato da regra.

Passo 4: O Juiz (O Verificador)

Finalmente, o sistema verifica: "Este código realmente funciona em todas as imagens de treinamento?"

  • Se o código funcionar perfeitamente, o sistema aceita a regra.
  • Se o código falhar, o sistema volta ao "Chatbot", diz: "Essa ideia não funcionou, tente novamente", e o ciclo se repita.

O Que Eles Descobriram?

Os pesquisadores testaram essa "Abordagem de Equipe" contra os melhores modelos de IA disponíveis (como GPT-4o e Claude 3.7) e até mesmo contra o desempenho humano médio.

  1. A Equipe Vence: Ao combinar a criatividade do Chatbot com a precisão do Programador, o sistema deles resolveu 51 de 100 problemas de Bongard.
  2. Superando Humanos: O humano médio em estudos anteriores resolveu cerca de 47 problemas. A equipe de IA deles resolveu 51, marcando a primeira vez que uma IA superou o desempenho humano médio neste teste específico.
  3. Forças Diferentes:
    • Quando o problema era sobre geometria e matemática (como "estas linhas são paralelas?"), a parte do "Programador" da equipe foi a heroína.
    • Quando o problema era sobre conceitos abstratos (como "esta forma é 'aberta' ou 'fechada'?"), a parte do "Chatbot" foi a heroína.
    • Quando usaram apenas o Chatbot ou apenas o Programador, eles tiveram um desempenho inferior. Eles precisavam de ambos.

A Verificação de "Memorização"

Os pesquisadores estavam preocupados que a IA pudesse estar apenas "trapaceando" ao memorizar as respostas da internet (já que esses enigmas são antigos e populares). Para testar isso, eles inverteram as regras: disseram à IA que as imagens "ruins" eram, na verdade, as "boas". A IA ainda teve um bom desempenho, provando que não estava apenas recitando respostas memorizadas; ela estava realmente decifrando a lógica.

A Conclusão

Este artigo mostra que, para resolver enigmas visuais difíceis, a IA não deve apenas tentar "pensar" como um humano ou "calcular" como um computador. Ela precisa fazer ambos. Ao permitir que uma IA criativa sugira ideias e um computador preciso as verifique com matemática exata, podemos construir sistemas que aprendem novos conceitos visuais quase tão bem quanto, e às vezes melhor que, os humanos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →