← Últimos artículos
🤖 AI

Bongards at the Boundary of Perception and Reasoning: Programs or Language?

Este artículo presenta un enfoque neurosimbólico que combina Modelos de Lenguaje de Gran Tamaño para la generación de programas parametrizados con la optimización bayesiana para el ajuste de parámetros con el fin de resolver problemas de Bongard, cerrando así la brecha entre la percepción visual y el razonamiento abstracto.

Autores originales: Cassidy Langenfeld, Claas Beger, Gloria Geng, Wasu Top Piriyakulkij, Keya Hu, Yewen Pu, Kevin Ellis

Publicado 2026-02-04
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Cassidy Langenfeld, Claas Beger, Gloria Geng, Wasu Top Piriyakulkij, Keya Hu, Yewen Pu, Kevin Ellis

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La visión general: El desafío del "Acertijo Visual"

Imagina que te dan un conjunto de 12 dibujos. Seis de ellos son "buenos" (positivos) y seis son "malos" (negativos). Tu trabajo es descubrir la regla secreta que separa a los buenos de los malos.

Esto se llama un Problema de Bongard. Estos no son simples acertijos de "encuentra el elemento diferente". Las reglas pueden ser increíblemente complicadas.

  • Ejemplo: Tal vez las imágenes "buenas" tienen una forma con un "cuello" que es horizontal, mientras que las "malas" tienen un cuello vertical. O tal vez las imágenes "buenas" tienen formas "onduladas", mientras que las "malas" son "lisas".

El artículo plantea una gran pregunta: ¿Puede la Inteligencia Artificial (IA) resolver estos acertijos de la misma manera que lo hacen los humanos? Los humanos somos excelentes para observar una situación nueva, inventar un concepto nuevo sobre la marcha (como "cuello horizontal") y aplicarlo. La IA actual es excelente reconociendo cosas que ya ha visto antes (como "esto es un gato"), pero suele tener dificultades cuando tiene que inventar un concepto nuevo desde cero.

El problema: La IA es demasiado rígida o demasiado vaga

Los investigadores descubrieron que la IA tiene dos formas principales de pensar, y ambas tienen fallos al resolver estos acertijos:

  1. El enfoque del "Chatbot" (Lenguaje Natural):

    • Cómo funciona: La IA observa las imágenes e intenta describir la regla con palabras, como un detective escribiendo un informe.
    • El fallo: Es buena con las ideas generales, pero mala con la precisión. Puede decir: "Las formas buenas son algo puntiagudas", pero no puede distinguir entre una forma "ligeramente puntiaguda" y una "muy puntiaguda". Es como un chef que sabe que la receta dice "añadir una pizca de sal", pero no sabe exactamente cuánto es eso.
  2. El enfoque del "Programador" (Código):

    • Cómo funciona: La IA escribe un programa de computadora para comprobar las imágenes. Puede medir distancias exactas, ángulos y conteos.
    • El fallo: Es excelente con la precisión, pero mala con la creatividad. Si la regla es "la forma parece una cara triste", un programa de computadora tiene dificultades para definir la "tristeza" matemáticamente. Es como un robot que puede medir una habitación al milímetro, pero no puede entender el concepto de "acogedor".

La solución: El equipo de "Traductores"

Los autores construyeron un nuevo sistema que actúa como un equipo de dos especialistas trabajando juntos. Lo llaman un enfoque "neurosimbólico" (combinando redes neuronales/IA con lógica simbólica/programas).

Así es como trabaja su equipo, paso a paso:

Paso 1: El Generador de Ideas (El "Chatbot")

Primero, le piden a una IA potente (un Modelo de Visión-Lenguaje) que observe el acertijo y sugiera algunas reglas posibles en lenguaje sencillo.

  • Analogía: Imagina una sesión de lluvia de ideas donde un escritor creativo sugiere: "¡Tal vez la regla tiene que ver con el 'cuello' de la forma!".

Paso 2: El Traductor (El "Programador")

A continuación, el sistema toma esas suposiciones en inglés (lenguaje natural) e intenta convertirlas en código de computadora.

  • El giro: La IA no solo escribe el código, sino que deja "espacios en blanco" para los números complicados. Por ejemplo, si la regla es "formas con un cuello más largo que X", la IA escribe el código pero deja X como una variable misteriosa.
  • Analogía: El escritor dice: "El cuello debe ser más largo que [ESPACIO EN BLANCO]". El programador configura la máquina para medir el cuello, pero espera por el número exacto.

Paso 3: El Sintonizador (Optimización Bayesiana)

Esta es la salsa secreta. El sistema ejecuta un proceso de "ensayo y error" para encontrar el número perfecto para esos espacios en blanco. Prueba diferentes números (como 5 píxeles, 10 píxeles, 15 píxeles) para ver cuál separa perfectamente las imágenes "buenas" de las "malas".

  • Analogía: Imagina que estás sintonizando una radio. Sabes que la estación está en algún lugar entre 90 y 100, pero no sabes la frecuencia exacta. Giras lentamente el dial hasta que la estática desaparece y la música es perfecta. El sistema hace esto matemáticamente para encontrar el punto de "corte" exacto de la regla.

Paso 4: El Juez (El Verificador)

Finalmente, el sistema comprueba: "¿Funciona realmente este código en todas las imágenes de entrenamiento?".

  • Si el código funciona perfectamente, el sistema acepta la regla.
  • Si el código falla, el sistema vuelve al "Chatbot", le dice: "Esa idea no funcionó, inténtalo de nuevo", y el ciclo se repite.

¿Qué descubrieron?

Los investigadores probaron este "Enfoque de Equipo" contra los mejores modelos de IA disponibles (como GPT-4o y Claude 3.7) e incluso contra el rendimiento humano promedio.

  1. El Equipo gana: Al combinar la creatividad del Chatbot con la precisión del Programador, su sistema resolvió 51 de 100 problemas de Bongard.
  2. Superando a los humanos: El humano promedio en estudios previos resolvió unos 47 problemas; su equipo de IA resolvió 51, marcando la primera vez que una IA supera el rendimiento humano promedio en esta prueba específica.
  3. Diferentes fortalezas:
    • Cuando el problema era de geometría y matemáticas (como "¿son estas líneas paralelas?"), la parte del "Programador" del equipo fue la heroína.
    • Cuando el problema era de conceptos abstractos (como "¿es esta forma 'abierta' o 'cerrada'?"), la parte del "Chatbot" fue la heroína.
    • Cuando usaron solo el Chatbot o solo el Programador, obtuvieron peores resultados. Necesitaban ambos.

La comprobación de "Memorización"

Los investigadores temían que la IA pudiera estar simplemente "haciendo trampa" memorizando las respuestas de internet (ya que estos acertijos son antiguos y populares). Para probar esto, invirtieron las reglas: le dijeron a la IA que las imágenes "malas" eran en realidad las "buenas". La IA siguió funcionando bien, lo que demuestra que no estaba simplemente recitando respuestas memorizadas, sino que realmente estaba descifrando la lógica.

La conclusión fundamental

Este artículo muestra que para resolver acertijos visuales difíciles, la IA no debería intentar solo "pensar" como un humano o "calcular" como una computadora. Debe hacer ambas cosas. Al permitir que una IA creativa sugiera ideas y que una computadora precisa las verifique con matemáticas exactas, podemos construir sistemas que aprenden nuevos conceptos visuales casi tan bien como, y a veces mejor que, los humanos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →