← Últimos artículos
🤖 AI

Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents

Vortex es un sistema que combina un frontend embebido en Python con un backend eficiente para permitir el prototipado y despliegue rápido de algoritmos de atención dispersa, permitiendo que los agentes de IA descubran automáticamente diseños que logran hasta 3.46× más rendimiento que la atención completa mientras extienden estas ganancias a arquitecturas emergentes de gran escala.

Autores originales: Zhuoming Chen, Xinrui Zhong, Qilong Feng, Ranajoy Sadhukhan, Yang Zhou, Michael Qizhe Shieh, Zhihao Jia, Beidi Chen

Publicado 2026-06-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhuoming Chen, Xinrui Zhong, Qilong Feng, Ranajoy Sadhukhan, Yang Zhou, Michael Qizhe Shieh, Zhihao Jia, Beidi Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que diriges una biblioteca masiva (un Modelo de Lenguaje Grande, o LLM), donde un bibliotecario (la IA) tiene que escribir una historia muy larga, palabra por palabra.

Cada vez que el bibliotecario escribe una nueva palabra, tiene que mirar hacia atrás en todo lo que ha escrito hasta el momento para asegurarse de que la nueva palabra encaje. En una biblioteca tradicional, el bibliotecario tiene que recorrer cada estante, revisar cada libro y leer cada frase para encontrar las partes relevantes. A medida que la historia se alarga (miles de palabras), este proceso de "caminar y revisar" se vuelve increíblemente lento y agotador. Este es el problema de la Atención Completa (Full Attention).

La Atención Dispersa (Sparse Attention) es como darle al bibliotecario un atajo inteligente: "Solo mira las últimas 5 páginas y los 3 capítulos más importantes del principio". Esto ahorra mucho tiempo. Sin embargo, construir estos atajos es actualmente una pesadilla para los ingenieros. Es como intentar construir una vía de tren personalizada para cada nueva idea de atajo que tienes. Si quieres probar una nueva idea, tienes que reconstruir toda la vía desde cero, lo que toma semanas.

Entra Vortex.

Vortex es un nuevo sistema que actúa como un "Constructor de Vías de Tren Universal" para estos atos. Así es como funciona, usando analogías simples:

1. El Problema: La Biblioteca "Segmentada"

Las bibliotecas modernas no almacenan los libros en una fila larga y continua. Para ahorrar espacio, almacenan los libros en cajas dispersas y no contiguas (llamadas Atención Segmentada o Paged Attention).

  • La forma antigua: Si querías decirle a una computadora "busca cajas específicas dispersas", tenías que escribir código complejo de bajo nivel para encontrar cada caja, agarrarla y ponerla en orden. Era como pedirle a un robot que encontrara granos de arena específicos en una playa cavando uno por uno.
  • La forma de Vortex: Vortex introduce una nueva forma de pensar llamada vTensor. Te da un "mapa mágico". No necesitas saber dónde están ubicadas físamente las cajas; solo dices: "Quiero las 5 cajas más relevantes", y el mapa mágico se encarga de los detalles complicos de encontrarlas en el almacenamiento disperso.

2. El Lenguaje: vFlow (El "Libro de Recetas")

Vortex viene con un lenguaje de programación llamado vFlow.

  • La analogía: Imagina que eres un chef. En lugar de escribir código para decirle a la computadora cómo picar cada una de las zanahorias, simplemente escribes una receta: "Toma las zanahorias, pícalas y mézclalas con las cebollas".
  • Cómo ayuda: Los investigadores (e incluso los agentes de IA) pueden escribir "recetas" para nuevos tipos de atajos (algoritmos de atención dispersa) en pocas líneas de código. No necesitan ser expertos en los detalles complicados del hardware. Solo describen qué quieren hacer, y Vortex se encarga de cómo hacerlo de manera eficiente.

3. El Agente de IA: El "Inventor Autónomo"

Esta es la parte más emocionante. El artículo muestra que Vortex es tan fácil de usar que los agentes de IA (programas informáticos diseñados para actuar como humanos) pueden usarlo para inventar nuevos atajos por sí mismos.

  • El experimento: Los investigadores pidieron a los agentes de IA que "inventaran 20 formas nuevas de acelerar al bibliotecario".
  • El resultado: Los agentes de IA no solo copiaron ideas viejas; crearon recetas nuevas y diversas. Uno de los atajos generados por la IA hizo que el bibliotecario fuera 3.46 veces más rápido que el método estándar, sin perder nada de precisión en la historia.
  • El ciclo: La IA siguió probando, fallando y ajustando sus recetas durante 18 horas. Finalmente, encontró un equilibrio perfecto entre velocidad y precisión que los humanos podrían haber pasado por alto.

4. Los Resultados: Acelerando el Futuro

Vortex no es solo para modelos pequeños; funciona con las bibliotecas más grandes y complejas del mundo.

  • Los Grandes Modelos: El equipo probó Vortex en un modelo masivo (MiniMax-M2.7) con 229 mil millones de parámetros, ejecutándose en chips de supercomputadora (NVIDIA B200). Incluso allí, los atajos de Vortex hicieron que el sistema fuera 1.37 veces más rápido.
  • Nuevas Arquitecturas: También lo utilizaron en un nuevo tipo de diseño de biblioteca llamado MLA (usado por modelos como DeepSeek y GLM). Diseñaron un atajo personalizado para él en vFlow y obtuvieron una aceleración de 4.7 veces.

Resumen

Piensa en Vortex como un traductor y un equipo de construcción todo en uno.

  1. Traduce reglas de hardware complejas y complicadas en recetas simples y legibles.
  2. Permite que humanos y agentes de IA inventen, prueben y desplieguen rápidamente nuevos "atajos" para leer textos largos.
  3. Convierte lo que antes era un proyecto de ingeniería de meses en una cuestión de horas, permitiéndonos encontrar formas más rápidas de ejecutar modelos de IA sin sacrificar su inteligencia.

El artículo afirma que, al facilitar la experimentación, Vortex ya ha ayudado a los agentes de IA a descubrir algoritmos que son significativamente más rápidos que cualquier cosa utilizada actualmente en producción, demostando que podemos hacer que la IA sea más rápida y eficiente sin esperar a un nuevo hardware.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →