← Últimos artículos
💬 NLP

Human-Like Anaphor Resolution in Large Language Models

Este estudio evalúa cinco modelos de lenguaje de pesos abiertos para determinar si exhiben patrones de resolución de anáforas similares a los humanos, encontrando que, si bien algunos modelos muestran una sensibilidad a la estructura del discurso y a la distancia similar a la de los humanos, carecen de una sensibilidad comparable a los efectos de interferencia semántica.

Autores originales: Keane Zhang, Varshini Chinta, Raj Sanjay Shah, Sashank Varma

Publicado 2026-08-07
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Keane Zhang, Varshini Chinta, Raj Sanjay Shah, Sashank Varma

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás leyendo una novela de misterio. El autor presenta a un personaje llamado "El Panadero" en el primer capítulo. Diez páginas después, la historia menciona "él" nuevamente. Tu cerebro no solo adivina quién es "él"; instantáneamente regresa a tu memoria, agarra la imagen del Panadero y conecta los puntos. Este truco de magia mental se llama resolución de anáforas. Es la forma en que mantenemos el rastro de quién o qué estamos hablando a medida que la historia se desarrolla.

Los científicos han estudiado durante mucho tiempo cómo hacemos esto. Saben que si el Panadero era el foco principal de la historia (tópico), lo encuentras más rápido. Si "él" aparece justo después del Panadero, es fácil. Pero si "él" aparece después de un intervalo largo y confuso, o si hay otro panadero cerca para confundirte, tu cerebro tropieza. Ahora, entran los Modelos de Lenguaje Extensos (LLM). Estos son programas informáticos superinteligentes entrenados en montañas de texto que pueden escribir historias, responder preguntas y charlar como los humanos. Pero aquí está la gran pregunta: ¿estos cerebros de IA realmente piensen como los cerebros humanos cuando resuelven estos acertijos, o solo son muy buenos adivinando basándose en patrones? Este artículo se sumerge en este misterio para ver si la IA y los humanos están en la misma longitud de onda mental.


El Gran Test de Memoria de la IA

Los investigadores decidieron someter a cinco modelos de IA diferentes —GPT-2-XL, Llama-3.1-8B, Pythia-12B, Mistral-7B y Mistral-24B— a una serie de juegos de memoria diseñados específicamente para humanos. Querían ver si la IA se cansaría, se confundiría o se ralentizaría de la misma manera que lo haría un lector humano.

Para medir esto, utilizaron dos trucos ingeniosos. Primero, observaron la sorpresa (surprisal). Piensa en esto como el "sudor cerebral" de la IA. Cuando una computadora lee una palabra que no esperaba, su "sorpresa" aumenta. En los humanos, una alta sorpresa suele significar que nos detenemos más tiempo para pensar. Por lo tanto, si la IA se pone "sudorosa" (alta sorpresa) en los mismos momentos en que los humanos se traban, es una buena señal de que están procesando la historia de manera similar. Segundo, hicieron preguntas de comprensión a la IA, como "¿Quién pateó la silla?", para ver si realmente recordaban a la persona correcta.

Los Juegos de Memoria

El equipo realizó tres experimentos diferentes, cada uno probando una regla específica de la memoria humana:

1. La prueba de "Foco" y "Distancia"
Imagina un reflector. Si un personaje está bajo el reflector (el título de la historia lo menciona), los humanos lo encuentran fácilmente. Si está en la oscuridad, es más difícil. Además, si el personaje está a una sola oración de distancia, es fácil. Si está a diez oraciones de distancia, es más difícil.

  • El Resultado: ¡La mayoría de los modelos de IA actuaron como los humanos aquí! Cuando el personaje era resaltado por el título y estaba cerca, la "sorpresa" de la IA era baja y respondían correctamente. Cuando el personaje estaba oculto y lejos, la IA se confundía. Es como si la capacidad de atención de la IA se estirara y encogiera tal como la nuestra.

2. La prueba de "Espacio y Tiempo"
Esto era más complicado. Imagina que la historia tiene lugar en un castillo gigante. Si el personaje se mueve de la cocina a la siguiente habitación (distancia corta) o de la cocina a la torre (distancia larga), ¿importa? ¿Qué pasa si esperan 10 minutos o 2 horas? Los humanos se vuelven más lentos y cometen más errores cuando la brecha en espacio o tiempo es enorme.

  • El Resultado: Los resultados fueron mixtos. Algunos modelos, como Llama-3.1-8B y Mistral-7B, parecían sentir el peso de la distancia y el tiempo, poniéndose "sudorosos" cuando la brecha era larga. Otros no parecían importarles mucho las brechas de tiempo o espacio. Esto sugiere que, mientras algunas IA están empezando a entender el "sentimiento" de la línea de tiempo de una historia, otras simplemente se la están saltando.

3. La prueba del "Pista Confusa"
Esta es la parte más difícil. Imagina que la historia menciona una "silla de metal". Más tarde, dice "el mueble de metal". Eso es fácil. Pero, ¿qué pasa si la historia también menciona un "escritorio de madera" (un tipo diferente de mueble) justo antes? Los humanos nos confundimos porque "mueble" podría ser la silla o el escritorio. Si el objeto incorrecto es un ejemplo muy típico de la categoría (como un escritorio para muebles), nos ralentiza.

  • El Resultado: Aquí es donde la IA falló mayormente en actuar como un humano. Cuando los investigadores añadieron un elemento "distractor" confuso, los modelos de IA no se volvieron más lentos o confundidos de la manera en que lo hacen los humanos. Parecieron pasar de largo sin problemas ante la confusión. Esto sugiere que, aunque la IA puede rastrear dónde están las cosas en una historia, no entiende del todo la competencia desordenada y superpuesta que ocurre en nuestros cerebros cuando intentamos elegir el recuerdo correcto.

El Veredicto: Una Coincidencia Parcial

Entonces, ¿cuál es la puntuación final? El artículo sugiere que estos modelos de IA son selectivamente similares a los humanos. Son excelentes para entender cómo la estructura de una historia (como qué tan lejos está una palabra o qué dice el título) afecta la memoria. Si haces la historia más larga o escondes al personaje, la IA se pone un poco más "sudorosa", al igual que un lector cansado.

Sin embargo, no son clones perfectos de la mente humana. Cuando se trata del desordenado malabarismo semántico —don donde palabras similares luchan por la atención en nuestra memoria— la IA no tropieza de la misma forma que nosotros. Parecen carecer del tipo específico de "fricción mental" que ocurre cuando nuestros cerebros tienen que elegir entre dos recuerdos muy similares.

Los autores son cuidadosos al decir que esto no es un problema "resuelto". El estudio utilizó un número relativamente pequeño de historias (16 a 19), por lo que los resultados son más como indicios fuertes que como pruebas absolutas. Además, la precisión general de la IA en las preguntas fue a veces bastante baja, lo que significa que podrían estar adivinando correctamente por las razones equivocadas. Pero la conclusión es emocionante: estos cerebros digitales están empezando a mostrar los mismos patrones de dificultad que los cerebros humanos, al menos en lo que respecta a la distancia y el foco de una historia. No son solo máquinas de emparejar palabras; están comenzando a mostrar los primeros signos de un "modelo de situación": un mapa mental del mundo de la historia, tal como nosotros tenemos uno.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →