Human-Level Reasoning: A Comparative Study of Large Language Models on Logical and Abstract Reasoning
Este estudio evalúa y compara las capacidades de razonamiento lógico y abstracto de nueve destacados modelos de lenguaje de gran tamaño frente al desempeño humano mediante ocho preguntas diseñadas a medida, revelando brechas significativas en las habilidades deductivas de los modelos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes una sala llena de bibliotecarios increíblemente talentosos. Estos bibliotecarios (los Modelos de Lenguaje de Gran Tamaño, o LLM) han leído casi todos los libros del mundo. Pueden recitar hechos, escribir poemas y traducir idiomas más rápido que nadie. Pero la pregunta que este artículo plantea es: ¿Realmente entienden lo que están leyendo, o solo son muy buenos adivinando la siguiente palabra en una oración?
Para averiguarlo, el autor, Benjamin Grando Moreira, preparó un "gimnasio de lógica" e invitó a 15 de estos bibliotecarios digitales a competir contra un grupo de estudiantes y profesores humanos.
Aquí hay un desglose sencillo de lo que sucedió, utilizando algunas metáforas cotidianas.
La Prueba: Una caja de acertijos, no un concurso de trivia
En lugar de preguntar a los modelos "¿Quién fue el primer presidente?" (lo cual pueden responder por memoria), el investigador les dio 8 acertijos complicados. Estos acertijos eran como acertijos que requerían que los modelos descubrieran reglas ocultas, no solo que recordaran hechos.
Piénsalo de esta manera:
- El Cerebro Humano es como un detective que busca pistas, conecta puntos y dice: "¡Ajá! ¡Veo el patrón!".
- El Cerebro de la IA es como una máquina de emparejamiento de patrones superrápida que dice: "He visto esta palabra antes, así que adivinaré la siguiente palabra basándome en lo que suele seguirla".
Los 8 Desafíos (La "pista de obstáculos")
El artículo probó los modelos en cosas como:
- El Acertijo del Día de la Semana: Si "SUN + 1 = MON", ¿qué es "TUE + 2?" (La mayoría de los modelos lo lograron, pero algunos se confundieron con las abreviaturas).
- La Canción del Elefante: Un patrón absurdo donde el número de veces que se dice "bother" cambia según si el número de elefantes es impar o par. Los humanos vieron el patrón fácilmente; muchas IA se quedaron estancadas en la repetición.
- El Código Secreto: Un simple desplazamiento de letras (como que la A se convierte en B). La mayoría de los modelos descifraron esto, pero algunos se equivocaron con las mayúsculas.
- La Pregunta Matemática Tramposa: "¿Cuánto es 3 + 3 x 5?". La respuesta correcta es 18. Pero la prueba daba opciones como 16, 20, 30 y 45. ¡18 ni siquiera era una opción!
- El Giro: Muchos modelos (y algunos humanos) se confundieron. Vieron que la matemática era correcta pero las opciones eran incorrectas, y algunos simplemente eligieron la respuesta incorrecta más "cercana" en lugar de decir: "Oye, ninguna de estas es correcta".
- El Misterio del Mes: Este fue el más difícil. Pedía encontrar un código oculto para el mes de "May" (Mayo). El código consistía en elevar al cuadrado el número del mes (5 al cuadrado = 25) y contar las letras de la palabra "May" (4 letras), luego pegar ambos números para obtener 254.
- El Resultado: Los humanos estuvieron bien en esto, pero las IA fallaron la mayoría de las veces. Intentaron usar fórmulas matemáticas complejas que no encajaban, en lugar de ver el truco simple de "pegar los números".
- El Cambio de Idioma: Emparejar las abreviaturas de los meses en portugués con los nombres en español. Los humanos tuvieron dificultades aquí si no sabían español, pero las IA (que conocen muchos idiomas) lo lograron con éxito.
- El Día Bilingüe: Una mezcla de días de la semana en inglés y portugués con una regla oculta sobre cuándo cambiar de idioma. Tanto humanos como IA encontraron esto difícil.
- El Código Binario: Sumar números que parecen estar en base 10 (como 1000) pero que en realidad están en base 2 (binario). Solo los modelos más inteligentes se dieron cuenta de: "Espera, ¡estos no son números normales!" y lo resolvieron.
El Marcador: ¿Quién ganó?
El investigador otorgó puntos por:
- 10 puntos: Obtener la respuesta correcta.
- 5 puntos: Obtener la lógica correcta, incluso si el número final era erróneo.
- 0 puntos: Equivocarse o rendirse.
Los Resultados:
- Los Humanos: Los profesores (los expertos) fueron los que mejor lo hicieron en general, especialmente en los acertijos más complicados. Los estudiantes lo hicieron bien, pero tuvieron más dificultades con los acertijos abstractos.
- Las IA: En promedio, las IA obtuvieron alrededor de 73 puntos de 100, mientras que los humanos obtuvieron alrededor de 70.
- ¿Esperamos que las IA ganaron? ¡Sí, ligeramente! Pero aquí está el detalle: las IA fueron geniales en las cosas fáciles (como conocer los meses en diferentes idiomas) y terribles en las cosas extrañas y abstractas (como la canción del elefante o el código numérico oculto).
- Los mejores modelos de IA (como GPT-4o y Claude) obtuvieron puntuaciones casi perfectas, pero los modelos más débiles (como Sabiá 3) obtuvieron puntuaciones muy bajas.
La Gran Conclusión
El artículo concluye que estos modelos de IA son como loros brillantes. Pueden imitar la conversación humana y resolver problemas estándar perfectamente. Sin embargo, cuando les pides que piensen fuera de la caja, detecten un patrón extraño o se den cuenta de que una pregunta es una trampa, suelen tropezar.
- Los humanos son mejores en la "inteligencia fluida": descifrar nuevas reglas sobre la marcha.
- Las IA son mejores en la "inteligencia cristalizada": utilizar la enorme cantidad de datos que ya han memorizado.
El estudio muestra que, aunque la IA se está volviendo asombrosamente buena hablando, aún no ha logrado dominar el arte de pensar de la misma manera que lo hace un humano, especialmente cuando las reglas del juego son ocultas o inusuales. La IA sigue siendo, en su mayor parte, alguien que adivina basándose en lo que ha visto antes, en lugar de comprender verdaderamente la lógica detrás del acertijo.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.