← Últimos artículos
💬 NLP

Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale

Este artículo presenta un estudio sistemático de la recuperación en contexto a escala de un millón de tokens, identificando la dilución de la atención como un punto de falla clave y proponiendo modificaciones arquitectónicas que permiten que un modelo de lenguaje de 0.6B iguale o supere a los sistemas de recuperación densa en varios bancos de pruebas, al tiempo que demuestra una generalización de longitud superior.

Autores originales: Siddharth Gollapudi, Nilesh Gupta, Prasann Singhal, Sewon Min

Publicado 2026-07-03
📖 4 min de lectura☕ Lectura para el café

Autores originales: Siddharth Gollapudi, Nilesh Gupta, Prasann Singhal, Sewon Min

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca gigante con un millón de libros. Le haces una pregunta a un bibliotecario (la IA) y quieres que encuentre el libro específico que la responde, sin mirar un catálogo de fichas o una base de datos informática. En su lugar, le entregas al bibliotecario la biblioteca entera y él tiene que leerla toda en su mente para encontrar la respuesta.

Esto es lo que el artículo llama "Recuperación en Contexto" (In-Context Retrieval).

Durante mucho tiempo, las computadoras usaron un sistema de "catálogo de fichas" (llamado recuperación vectorial) para encontrar cosas rápidamente. Pero este artículo se pregunta: ¿Puede una IA inteligente simplemente leer toda la biblioteca y elegir el libro correcto por sí misma?

Aquí está la historia de su experimento, explicada de forma sencilla:

1. El problema: El bibliotecario se siente abrumado

Los investigadores construyeron un bibliotecario pequeño y listo (una IA de 0.6 mil millones de parámetros) y le dieron una biblioteca de documentos.

  • La buena noticia: Cuando la biblioteca era pequeña (unos pocos miles de libros), el bibliotecario era increíble. Podía encontrar el libro adecuado casi tan bien como las mejores computadoras de "catálogo de fichas".
  • La mala noticia: A medida que la biblioteca creció a un millón de libros, el bibliotecario empezó a fallar. No es que olvidara el libro correcto; es que se confundía y elegía el equivocado.

2. El diagnóstico: El efecto del "ruido de la cafetería"

Los investigadores descubrieron por qué fallaba el bibliotecario. No era que el bibliotecario no pudiera "ver" el libro correcto.

  • La analogía: Imagina que el bibliotecario intenta escuchar la voz de un amigo en una habitación silenciosa. ¡Fácil!
  • Ahora, imagina que ese mismo amigo está en un estadio con un millón de otras personas susurrando al mismo tiempo.
  • Aunque el amigo esté gritando la respuesta correcta, su voz se pierde en el "ruido" de los un millón de otros susurros.

En términos técnicos, la IA utiliza un proceso matemático llamado Softmax para decidir qué documento es más importante. A medida que el número de documentos crece, el "ruido" de los documentos irrelevantes inunda la señal del documento correcto. La atención de la IA se "diluye" (se aguada) hasta que la respuesta correcta es solo una gota diminuta en un océano masivo.

3. La solución: Dos trucos para despejar el ruido

Los investigadores probaron dos trucos nuevos para ayudar al bibliotecario a concentrarse:

Truco A: El "control de volumen" (SSMax)
Ajustaron la matemática para que, a medida que la biblioteca crece, la IA automáticamente suba el volumen de los documentos "importantes" y baja el volumen del "ruido". Es como darle al bibliotecario un audífono especial que sabe exactamente qué tan fuerte es la multitud y se ajusta en consecuencia.

Truco B: La "lista de selección" (Routing)
En lugar de hacer que el bibliotecario lea cada una de las páginas de el millón de libros, dejaron que el bibliotecario escaneara rápidamente los títulos y eligiera los 256 libros más prometedores. Luego, el bibliotecario solo lee esos 256 libros en detalle. Esto es como pedirle al bibliotecario que haga una lista de selección primero, en lugar de leer toda la biblioteca.

4. Los resultados: Un nuevo tipo de bibliotecario

Con estos trucos, los resultados fueron impresionantes:

  • En pruebas estándar: La IA pequeña (con los trucos) funcionó tan bien como las enormes computadoras de "catálogo de fichas", incluso con un millón de documentos. Era 7 veces más pequeña que una IA competidora que intentaba hacer lo mismo.
  • En pruebas "extrañas": Probaron la IA en una tarea donde las computadoras de "catálogo de fichas" suelen fallar (encontrar documentos basados en patrones de palabras específicos en lugar de significados generales). Aquí, la IA no solo igualó a la computadora; la superó por 3 veces.

5. La conclusión fundamental

El artículo concluye que la IA puede actuar como su propio bibliotecario y encontrar respuestas en una biblioteca masiva sin necesidad de una base de datos externa. Sin embargo, hay un inconveniente: la Dilución de la Atención.

A medida que la biblioteca crece infinitamente, la capacidad de la IA para enfocarse en lo correcto se desvanece naturalmente, como el haz de luz de una linterna que se vuelve demasiado ancho para ver algo con claridad. Los investigadores demostraron que podemos solucionar esto con algunos ajustes matemáticos ingeniosos, pero sigue siendo el mayor obstáculo para que esto funcione perfectamente a una escala masiva.

En resumen: La IA puede leer un millón de libros y encontrar la respuesta, pero necesita un poco de ayuda para ignorar el ruido para que no se pierda entre la multitud.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →