← Últimos artículos
💬 NLP

Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

Este trabajo expone una brecha crítica en los puntos de referencia de razonamiento de contexto largo al demostrar que las evaluaciones convencionales no controlan la posición de la tarea, lo que conduce a caídas significativas en el rendimiento cuando las tareas se sitúan en el medio de contextos largos debido a la interferencia de relleno, y propone el marco de Evaluación de Rotación de Contexto (CRE) para abordar este punto ciego estructural.

Autores originales: Chuyifei Zhang, Hongyu Cui, Xiaowen Huang, Jitao Sang

Publicado 2026-05-25
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Chuyifei Zhang, Hongyu Cui, Xiaowen Huang, Jitao Sang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: El Problema del "Asiento del Medio"

Imagina que le pides a un estudiante muy inteligente que resuelva un problema de matemáticas. Le entregas un libro de texto masivo (el "contexto") que tiene 64.000 páginas de largo.

  • La Vieja Forma: Si colocas el problema de matemáticas en la última página del libro, el estudiante lo resuelve correctamente casi todas las veces.
  • El Nuevo Descubrimiento: Este documento encontró que si mueves ese mismo problema de matemáticas al medio del libro, el estudiante de repente olvida cómo resolverlo. Su rendimiento puede desplomarse desde un 96% de aciertos hasta apenas un 8% de aciertos.

Los autores llaman a esto "Fallo Posicional". Argumentan que, aunque tenemos excelentes pruebas para verificar si un estudiante puede encontrar un hecho específico en un libro (como la "Aguja en un Pajonal"), no hemos estado probando si pueden razonar a través de un problema cuando está enterrado en medio de un texto largo.

La Investigación: Auditoría de las Pruebas

Los investigadores actuaron como detectives y examinaron 11 pruebas populares de "contexto largo" utilizadas para calificar modelos de IA.

  • El Hallazgo: Ninguna de estas pruebas controla dónde se coloca la pregunta. Simplemente utilizan documentos naturales donde la pregunta ocurre al azar al principio, en el medio o al final.
  • La Verificación de los Proveedores: También examinaron las "tarjetas de reporte" oficiales (model cards) de cuatro grandes empresas de IA (DeepSeek, MiMo, Kimi, GLM).
    • El Resultado: Estas empresas muestran con orgullo sus puntuaciones en tareas de codificación y agentes (como "¿puedes escribir un programa?") en tablas grandes y en negrita.
    • El Punto Ciego: Casi nunca muestran sus puntuaciones para el "razonamiento controlado por posición". Ocultan el hecho de que sus modelos podrían fallar miserablemente cuando una pregunta está en medio de un documento largo.

El Experimento: La Prueba de "Podredumbre del Contexto"

Para demostrar que esto no fue solo una casualidad, los autores construyeron una nueva prueba llamada CRE (Evaluación de Podredumbre del Contexto). Piensa en esto como una prueba de estrés para la capacidad de atención de la IA.

Tomaron dos tipos de preguntas:

  1. Problemas de matemáticas (GSM8K)
  2. Opción múltiple de ciencias (ARC-Challenge)

Luego crearon tres escenarios diferentes de "ruido de fondo" (contenido de relleno) para ver qué distraía a la IA:

  • El "Ayudante de Tareas" (with_solutions): El texto de fondo contenía otros problemas de matemáticas con sus respuestas escritas.
  • Las "Preguntas sin Responder" (questions_only_v2): El texto de fondo contenía otros problemas de matemáticas sin respuestas.
  • El "Ruido Aleatorio" (neutral_text): El texto de fondo eran simplemente artículos aleatorios de Wikipedia sobre gatos e historia.

Probaron 9 modelos de IA diferentes en tres diferentes "longitudes de libro": 8K, 32K y 64K tokens.

Los Resultados Sorprendentes

Los resultados mostraron que algunos modelos son increíblemente frágiles, mientras que otros son resistentes.

1. El Desplome del "Asiento del Medio"
Para algunos modelos (como MiMo-v2-Flash), mover la pregunta del final del libro al medio causó una caída masiva en el rendimiento.

  • Con una longitud de 64K y ruido de "Ayudante de Tareas", el modelo cayó 88 puntos porcentuales. Pasó de ser un genio (96% de precisión) a apenas aprobar (8% de precisión) solo porque la pregunta se movió al medio.
  • ¿Por qué? El documento encontró que cuando el modelo fallaba en el medio, a menudo copiaba la respuesta incorrecta del ruido de fondo. Era como si el estudiante se confundiera con los otros problemas de tareas sentados junto a la pregunta principal.

2. Los Modelos "Inmunes"
No todos los modelos fallaron. DeepSeek-V3.2 fue casi inmune a este problema cuando el ruido eran "Ayudantes de Tareas". Obtuvo la respuesta correcta tanto si estaba al final como en el medio. Sin embargo, cuando el ruido eran "Preguntas sin Responder", incluso este modelo fuerte comenzó a luchar.

3. Los Modelos "Más Nuevos"
Los autores probaron cuatro modelos nuevos y actualizados de las mismas empresas.

  • Buenas Noticias: Mejoraron ligeramente en manejar el ruido de "Ayudante de Tareas" en el medio.
  • Malas Noticias: Todavía luchaban terriblemente con "Preguntas sin Responder" en el medio. El problema no se solucionó; solo cambió de forma.

El Diagnóstico del "Truco de Magia"

Para demostrar que esto realmente trataba sobre la posición y no simplemente sobre que el modelo era "tonto", los investigadores hicieron un truco.

  • Colocaron el problema de matemáticas en el medio (donde el modelo suele fallar).
  • Luego, copiaron y pegaron el mismo problema exacto al final del libro.
  • Resultado: ¡De repente, el modelo obtuvo la respuesta correcta nuevamente!

Esto demuestra que el modelo sabe cómo resolver el problema. Simplemente no puede encontrarlo ni enfocarse en él cuando está enterrado en el medio. Es como una persona que puede resolver un rompecabezas si está en su escritorio, pero si lo escondes bajo una pila de papeles, olvida que lo tiene.

La Conclusión

El documento concluye que la forma actual en que probamos la IA está rota.

  • La Brecha: Solo estamos probando la IA en los "bordes" de documentos largos (donde se desempeñan bien). Estamos ignorando el "medio", donde a menudo fallan.
  • El Riesgo: Si una empresa dice: "Nuestra IA tiene un 95% de precisión en documentos largos", pero solo probaron las preguntas al final, ese número es engañoso. La IA podría ser inútil para tareas del mundo real donde la información importante está enterrada en el medio.

En resumen: Solo porque una IA pueda leer un libro largo no significa que pueda encontrar la respuesta en el medio. Necesitamos comenzar a probar el "medio" para obtener una imagen verdadera de lo inteligentes que son realmente estos modelos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →