Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models
Este estudio revela que, si bien los modelos BERT bidireccionales son inmunes a la "maldición de la reversión" que obstaculiza a los modelos GPT autorregresivos en la deducción lógica simétrica, ambas arquitecturas tienen dificultades con el razonamiento deductivo de multiconjuntos complejos, lo que sugiere que la selección del modelo debe adaptarse a las demandas lógicas específicas de tareas como la construcción de grafos de conocimiento biomédico.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Los Bots Cerebrales y el Laberinto de Espejos
Imagina que le estás enseñando a un robot a entender el mundo. Le muestras la foto de un gato y le dices: "Esto es un gato". Más tarde, le muestras la palabra "gato" y le preguntas: "¿Qué imagen va con esto?". Un cerebro humano maneja este cambio sin esfuerzo; sabemos que si "Gato" es igual a "Imagen", entonces "Imagen" es igual a "Gato". Pero durante mucho tiempo, los cerebros de computadora más avanzados, conocidos como Modelos de Lenguaje Extensos (LLM), tuvieron dificultades con este simple giro. Eran como estudiantes que memorizaron una lista de respuestas pero no podían descifrar la pregunta si se la hacían al revés. Este fallo específico se llama la "Maldición de la Reversión".
Para entender por qué esto importa, piensa en estos modelos de IA como dos tipos diferentes de lectores. Un tipo es el Decodificador (como la famosa serie GPT), que lee una historia de izquierda a derecha, prediciendo la siguiente palabra basándose solo en lo que vino antes. Es excelente escribiendo historias o terminando frases, pero no puede mirar hacia adelante para ver la imagen completa. El otro tipo es el Codificador (como BERT), que lee una oración de golpe, mirando cada palabra en relación con todas las demás simultáneamente. Es como leer una oración con una lupa que te muestra el contexto de cada palabra al mismo tiempo. Los científicos se han estado preguntando: si enseñamos a estos robots a hacer matemáticas básicas con grupos de cosas —como combinar listas de amigos o encontrar los amigos que tienen en común—, ¿pueden realmente pensar a través de la lógica, o solo están adivinando basándose en patrones que han visto antes? Esta pregunta es crucial porque, si queremos usar a estos robots para construir mapas complejos de conocimiento (como para la medicina o la ciencia), necesitan ser capaces de razonar, no solo de repetir.
La historia del artículo: ¿Quién puede cambiar los papeles?
En este estudio, los investigadores Da Wu, Jingye Yang y Kai Wang decidieron poner a prueba estos diferentes cerebros robóticos. Querían ver si la "Maldición de la Reversión" era un error permanente o solo una peculiaridad de cómo están construidos ciertos modelos, y si estos modelos podían realmente manejar acertijos lógicos más complicados que involucraran conjuntos de elementos.
La prueba del espejo: La Maldición de la Reversión
Primero, abordaron la "Maldición de la Reversión". Imagina que le enseñas a un robot que "Jimmy Carter es el 39º Presidente". Si le preguntas al robot: "¿Quién es el 39º Presidente?", un robot estándar (como GPT-3) a menudo se queda bloqueado. Conoce el hecho en una dirección, pero no puede darle la vuelta para responder a la pregunta inversa. Los investigadores descubrieron que los modelos Decodificadores (como GPT y Llama) realmente sufren de esta maldición; les cuesta deducir que "B es A" a partir de "A es B".
Sin embargo, el modelo Codificador (BERT) fue una historia diferente. Debido a que BERT lee en ambas direcciones a la vez, no se confundió. Cuando los investigadores le hicieron la pregunta inversa a BERT, respondió correctamente aproximadamente el 99% de las veces. Resulta que, si quieres que un robot entienda que una relación funciona en ambos sentidos, necesitas un cerebro que pueda ver el panorama completo, no solo el pasado.
El acertijo lógico: Mezclando y combinando grupos
A continuación, el equipo pasó a un desafío más difícil: las operaciones de conjuntos. Enseñaron a los robots a realizar una "Unión" (combinar dos listas de amigos en una gran lista) y una "Intersección" (encontrar los amigos que aparecen en ambas listas).
- El Nivel Fácil (Dos Conjuntos): Cuando se les pidió a los robots que combinaran o compararan solo dos grupos de nombres (como "Superhéroes" y "Dinosaurios"), tanto los modelos Decodificadores (Llama 2 y 3) como el modelo Codificador (BERT) hicieron un trabajo fantástico. Obtuvieron las respuestas correctas casi siempre. Parecía que habían dominado la lógica.
- El Nivel Difícil (Tres Conjuntos): Luego, los investigadores complicaron el acertijo. Pidieron a los robots que mezclaran tres grupos a la vez, o que hicieran una mezcla de operaciones, como "Encuentra los amigos comunes al Grupo A y al Grupo B, luego añade el Grupo C".
Aquí es donde el truco de magia se desmoronó. Mientras que los robots eran excelentes en las tareas simples de dos grupos, tropezaron gravemente cuando se involucraron tres grupos.
- El Problema de BERT: El modelo BERT parecía estar haciendo trampa. No estaba haciendo realmente las matemáticas; solo buscaba palabras que reconociera. Si una oración tenía un nombre nuevo que no había visto antes, inmediatamente decía "No, eso es incorrecto". Pero si la respuesta incorrecta usaba nombres que sí conocía, se confundía y decía "Sí, eso es correcto". Estaba memorizando el vocabulario, no la lógica.
- El Problema de Llama: Los modelos Llama (los modelos Decodificadores) también tuvieron dificultades. Al pedirles que encontraran los amigos comunes en tres grupos, a menudo simplemente enumeraban a todos los que conocían, ignorando las reglas específicas del acertijo. Parecían estar recordando una lista de nombres que habían visto durante su entrenamiento en lugar de calcular la intersección correcta.
El Comodín de GPT-4
Los investigadores también probaron al modelo más reciente y de código cerrado, GPT-4. Este robot era mucho mejor que los otros. Podía manejar la mayoría de los acertijos lógicos de tres conjuntos correctamente, a menudo descomponiendo el problema en pasos más pequeños para resolverlo. Sin embargo, incluso GPT-4 empezó a cometer errores cuando el número de grupos era demasiado alto (como siete u ocho conjuntos), lo que sugiere que incluso los modelos más inteligentes actuales tienen límites cuando se trata de deducción compleja de múltiples pasos.
La Gran Conclusión
La principal lección de este artículo es que no todos los cerebros de IA están construidos de la misma manera, y ningún robot es perfecto para cada trabajo. Si necesitas un modelo que entienda una relación en reversa (como invertir un hecho), un modelo bidireccional como BERT es el claro ganador. Pero si necesitas un modelo que escriba una historia o prediga la siguiente palabra en una oración, los modelos unidireccionales como GPT siguen siendo los reyes.
Lo más importante es que el estudio sugiere que, si bien estos modelos son increíbles detectando patrones y mimetizando el lenguaje humano, no necesariamente están "pensando" de la misma manera que los humanos. Cuando la lógica se vuelve demasiado compleja, tienden a recaer en la memorización de palabras en lugar de comprender las reglas. Por lo tanto, si estás construyendo un sistema para crear un grafo de conocimiento médico o resolver una difícil demostración matemática, no puedes simplemente confiar en que el robot lo resolverá por sí solo; tienes que ser muy cuidadoso con la forma en que haces las preguntas y con qué tipo de robot eliges para realizar el trabajo. Los robots se están volviendo más inteligentes, pero aún tienen mucho que aprender sobre el verdadero razonamiento lógico.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.