← Últimos artículos
💬 NLP

CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention

CoSA es un marco de atención dispersa de dos etapas y libre de entrenamiento que acopla un Proxy Sensible al Kernel con un Kernel de Omisión Ordenada para optimizar dinámicamente la selección y omisión de bloques, logrando aceleraciones significativas en la inferencia y una reducción de la latencia para LLMs de contexto largo mientras mantiene una alta precisión bajo presupuestos computacionales estrictos.

Autores originales: Yufei Xue, Lin Niu, Hong Liu, Siran Liu, Hanyong Shao, Wei Liu, Guanghua Yu, Jianchen Zhu, Jun Zhang

Publicado 2026-07-29
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yufei Xue, Lin Niu, Hong Liu, Siran Liu, Hanyong Shao, Wei Liu, Guanghua Yu, Jianchen Zhu, Jun Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando leer una enciclopedia masiva de 128.000 páginas para responder a una sola pregunta. En el mundo de la Inteligencia Artificial, estas "enciclopedias" se llaman Modelos de Lenguaje de Gran Tamaño (LLM, por sus siglas en inglés), y el proceso de "lectura" es cómo comprenden el contexto. El problema es que la forma estándar en que estos modelos leen es como un bibliotecario que insiste en leer cada una de las páginas del libro, desde la primera palabra hasta la última, antes de que siquiera puedan empezar a pensar en tu pregunta. A medida que el libro se hace más largo, este enfoque de "leerlo todo" se vuelve dolorosamente lento y costoso, como intentar correr un maratón cargando una mochila llena de ladrillos.

Para solucionar esto, los científicos han intentado enseñar al bibliotecario a ser un poco más selectivo, una técnica llamada "atención dispersa" (sparse attention). En lugar de leer cada página, el modelo intenta adivinar qué páginas son importantes y se salta el resto. Por lo general, esto implica dos pasos: primero, un "proxy" rápido (un adivinador veloz) examina el libro y marca las páginas importantes con una lista sencilla de "Sí" o "No". Segundo, un "kernel" (el trabajador real) sigue esa lista y realiza el trabajo pesado. Es un sistema decente, pero tiene un fallo: cuando el libro se vuelve enorme y necesitas ser muy estricto sobre qué páginas saltarte para ahorrar tiempo, el adivinador rápido empieza a cometer errores, y el trabajador simplemente sigue la mala lista ciegamente. El resultado es que el modelo se vuelve más rápido pero empieza a olvidar detalles importantes, como un bibliotecario que se salta el clímax de la historia porque pensó que era aburrido.

Aquí es donde entra en juego un nuevo método llamado CoSA (Atención Dispersa Co-Diseñada). Los investigadores detrás de CoSA se dieron cuenta de que el "adivinador" y el "trabajador" trabajaban de forma aislada, lo que causaba que el sistema colapsara bajo presión. Decidieron rediseñar todo el proceso para que ambos trabajen juntos como un equipo. En lugar de entregarle al trabajador una simple lista de "Sí/No", el nuevo "adivinador" (llamado Proxy Consciente del Kernel, o KAP) le entrega una lista de prioridad. No solo dice "lee esta página"; dice: "Lee esta página primero, luego esta, luego esta otra".

Este es el truco de magia: el trabajador (llamado Kernel de Salto Ordenado, o OSK) utiliza esta lista de prioridad para reorganizar el orden en el que lee las páginas. Al leer las páginas más críticas primero, el trabajador construye una "puntuación acumulada" de lo que es importante muy pronto. Debido a que conoce lo más importante desde el principio, puede saltarse con confianza incluso más páginas más adelante en el proceso sin confundirse. Es como si estuvieras leyendo una novela de misterio y el detective te dijera: "Lee los tres primeros capítulos para encontrar al asesino, luego puedes saltarte con seguridad los siguientes cincuenta capítulos de consejos de jardinería".

El artículo muestra que este enfoque de trabajo en equipo cambia las reglas del juego. Cuando se probó en modelos que leían contextos de hasta 128.000 tokens (aproximadamente el tamaño de una novela larga), CoSA logró acelerar la parte de la "atención" del proceso 4,93 veces y redujo el tiempo necesario para generar la primera palabra en 2,53 veces. Crucialmente, lo hizo sin que el modelo perdiera su capacidad de comprender la historia o resolver problemas de razonamiento complejos. Los investigadores descubrieron que, al permitir que el proxy y el kernel se comuniquen y compartan un orden de operaciones específico, podían ser mucho más agresivos al saltarse el trabajo sin que el modelo perdiera su inteligencia. Resulta que, en el mundo de la IA, saber cuándo leer una página es tan importante como saber qué página leer.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →