← Últimos artículos
💬 NLP

Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answering

Este artículo revela que los sistemas multimodales de Visual Question Answering basados en conocimiento sufren un fenómeno de "perdido al final" donde colocar el pasaje recuperado correcto al principio del contexto supera significativamente a colocarlo al final, un sesgo impulsado por el slot 0 del prompt del modelo lector más que por la calidad de la recuperación, desafiando así la adecuación de recall@k como métrica de rendimiento.

Autores originales: Jieyuan Liu, Jianyang Gu, Shijie Chen, Jefferson Chen, Zhen Wang

Publicado 2026-06-16
📖 4 min de lectura☕ Lectura para el café

Autores originales: Jieyuan Liu, Jianyang Gu, Shijie Chen, Jefferson Chen, Zhen Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La visión general: El problema de la "Zona Dorada" (Goldilocks)

Imagina que eres un detective (la IA) intentando resolver un misterio (responder una pregunta) sobre un objeto específico en una foto. Tienes una biblioteca de 50 libros (pasajes de texto recuperados) que podrían contener la respuesta.

En el mundo de la IA de puro texto, los investigadores descubrieron anteriormente un problema en forma de "U": si pones el libro correcto al principio o al final de la pila, el detective encuentra la respuesta. Pero si escondes ese libro en medio de la pila, el detective lo ignora por completo. Esto se llama el efecto "Perdido en el Medio" (Lost in the Middle).

Este artículo pregunta: ¿Ocurre este mismo problema cuando el detective está mirando una foto y leyendo los libros?

El experimento: La prueba de la "Posición Dorada"

Los investigadores organizaron un experimento controlado para averiguarlo. Tomaron una sola pregunta y una sola foto, y le dieron a la IA exactamente los mismos 10 libros cada vez. Lo único que cambiaron fue dónde se colocaba el "Libro Dorado" (el que tiene la respuesta correcta) en la lista:

  1. Primero: El Libro Dorado está en la parte superior de la pila.
  2. Medio: El Libro Dorado está en medio de la pila.
  3. Último: El Libro Dorado está en la parte inferior de la pila.

Hicieron esto con tres "detectives" de IA diferentes (modelos de lenguaje visual de gran tamaño) para ver cómo se desempeñaban.

El descubrimiento: "Perdido al Final" (Lost at the End)

Los resultados fueron sorprendentes. La forma de "U" desapareció. En su lugar, la IA desarrolló un fuerte "Sesgo de Primacía" (una preferencia por el principio).

  • La analogía: Imagina a un profesor leyendo una lista de nombres de estudiantes para elegir al representante de la clase. Si el profesor escucha el nombre correcto primero, lo elige. Si lo escucha al final, a menudo lo olvida por completo.
  • El resultado: Cuando el Libro Dorado estaba al principio, la IA acertaba la respuesta entre el 60 y el 65% de las veces. Cuando el Libro Dorado estaba al final, la precisión caía a aproximadamente el 35-45%.
  • El efecto "Perdido al Final": La IA no solo ignoró el medio; ignoró activamente el final. El "Libro Dorado" al final era efectivamente invisible. La IA tenía 2.2 a 4.5 veces más probabilidades de responder correctamente si la información correcta estaba al principio de la lista en comparación con el final.

¿Por qué está sucediendo esto? (La investigación)

Los investigadores querían saber por qué la IA ignoraba el final. Probaron tres teorías:

  1. ¿Es la foto? Movieron la foto al final del prompt. Resultado: No hubo cambios. La posición de la foto no era el principal culpable.
  2. ¿Es la calidad del libro? Mezclaron los libros para que el "mejor" libro (con la puntuación de relevancia más alta) no estuviera siempre al principio. Resultado: La IA seguía eligiendo el libro que estaba al principio de la lista, incluso si era un libro peor. Seguía la posición, no la calidad.
  3. ¿Es solo texto? Probaron a la IA solo con texto (sin foto). Resultado: La IA también prefería el primer libro, pero la brecha era menor. Conclusión: Añadir la foto amplificó el sesgo. La foto hizo que la IA fuera aún más obstinada en mirar solo el principio.

Los arreglos fallidos

Los investigadores intentaron solucionar esto cambiando la forma en que se recuperaban los libros (la parte del "motor de búsqueda" del sistema):

  • Intentaron que la lista fuera más diversa.
  • Intentaron forzar que el mejor libro estuviera en la parte superior.
  • Resultado: Ninguno de estos arreglos por parte de la recuperación funcionó. Mientras la IA (el lector) estuviera "congelada" (no reentrenada), seguiría ignorando el final de la lista.

La conclusión principal

El artículo concluye que, para estos sistemas de IA específicos, Recall@K (una métrica común que pregunta: "¿Apareció la respuesta correcta en algún lugar de los 50 libros superiores?") es la forma incorrecta de medir el éxito.

La analogía: Es como un bibliotecario diciendo: "¡Encontré el libro correcto en la biblioteca!", pero el lector solo tiene permitido mirar el primer libro del estante. Si el libro correcto está en el último estante, el lector falla, aunque el bibliotecario haya hecho bien su trabajo.

La solución: Para solucionar esto, no podemos simplemente mejorar el motor de búsqueda (recuperación). Tenemos que reentrenar al lector (la IA) para que preste atención a toda la lista, no solo al principio. Hasta entonces, si quieres que una IA responda una pregunta correctamente, debes poner la información más importante al principio de su prompt.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →