← Últimos artículos
💬 NLP

Ada-MK: Adaptive MegaKernel Optimization via Automated DAG-based Search for LLM Inference

Ada-MK es un marco de optimización novedoso que elimina la planificación dinámica en tiempo de ejecución y reduce el uso de memoria compartida mediante una búsqueda basada en DAG en tiempo de compilación y la división de memoria, lo que permite el primer despliegue industrial de MegaKernels en sistemas comerciales de publicidad en línea para lograr una mejora de rendimiento de hasta un 50,2% frente a vLLM en GPUs de NVIDIA.

Autores originales: Wenxin Dong, Mingqing Hu, Guanghui Yu, Qiang Fu, Peng Xu, Hui Xu, Yue Xing, Xuewu Jiao, Shuanglong Li, Lin Liu

Publicado 2026-05-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Wenxin Dong, Mingqing Hu, Guanghui Yu, Qiang Fu, Peng Xu, Hui Xu, Yue Xing, Xuewu Jiao, Shuanglong Li, Lin Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás operando un servicio de entrega de alta velocidad para una tienda en línea masiva (como un motor de búsqueda o una plataforma de publicidad). Cada vez que un cliente hace una pregunta, tu sistema debe generar una respuesta palabra por palabra. En el mundo de los Modelos de Lenguaje Grande (LLM), esto se denomina "inferencia".

El problema es que, por cada palabra generada, tu computadora debe enviar miles de instrucciones diminutas a su tarjeta gráfica (GPU). Es como si un repartidor tuviera que detenerse en la oficina de correos, recoger un paquete, conducir a un almacén, dejarlo, regresar y repetir esto miles de veces solo para una oración. Esta sobrecarga de "parar y avanzar" desperdicia una enorme cantidad de tiempo: aproximadamente el 15% del tiempo total del viaje se gasta únicamente en estas paradas diminutas, no en entregar realmente la mercancía.

La Gran Idea: El "MegaKernel"
Para solucionar esto, los investigadores inventaron un concepto llamado MegaKernel. En lugar de detenerse en la oficina de correos por cada tarea diminuta, imagina un camión de entrega súper eficiente que recoge todo lo que necesita al inicio, recorre toda la ruta sin detenerse y deja todo al final. Fusiona todas esas paradas diminutas en un solo viaje gigante y continuo. Esto elimina el retraso de "parar y avanzar".

Sin embargo, hay un inconveniente. El tipo específico de camión (GPU) utilizado por la empresa (NVIDIA Ada/L20) es más pequeño y tiene menos espacio de almacenamiento en su cabina que los camiones más nuevos y lujosos (Hopper/Blackwell).

  • Solución Antigua 1 (Ajustada manualmente): Los expertos construyeron manualmente un camión personalizado para esta cabina pequeña específica. Era rápido, pero si cambiabas la carga (el modelo de IA) o la carretera (el hardware), el camión se rompía. No era portátil.
  • Solución Antigua 2 (Ajustada automáticamente): Intentaron construir un camión que pudiera ajustar automáticamente su espacio de carga sobre la marcha. Pero el conductor tenía que revisar constantemente un mapa y tomar decisiones mientras conducía ("¿Está lleno el estante? ¿Debo detenerme?"). Estas decisiones constantes ralentizaban el camión, lo cual es inaceptable cuando necesitas entregar en milisegundos.

La Nueva Solución: Ada-MK
Los autores de este artículo crearon Ada-MK, un nuevo sistema que resuelve estos problemas para los camiones "Ada" más pequeños. Así es como lo hicieron, utilizando analogías simples:

1. La Estrategia de "Empaque Inteligente" (Memoria Compartida Adaptativa)

El camión pequeño tiene un compartimento de almacenamiento diminuto (Memoria Compartida). Si intentas meter demasiado, el camión se detiene.

  • La Innovación: En lugar de intentar meter una maleta entera en el compartimento pequeño, cortaron la maleta por la mitad (división de la dimensión K). Empacan solo la mitad de los artículos, los entregan, luego empacan la otra mitad.
  • El Resultado: Esto reduce el almacenamiento máximo necesario en un 50%. También descubrieron cómo reutilizar el espacio vacío inmediatamente después de dejar un paquete para recoger el siguiente, asegurando que el camión nunca permanezca inactivo esperando espacio.

2. La "Ruta Preplanificada" (Búsqueda DAG Offline)

Los antiguos camiones "ajustados automáticamente" tomaban decisiones mientras conducían, lo que causaba atascos de tráfico (penalizaciones por bifurcación).

  • La Innovación: El equipo utilizó una computadora potente para simular millones de rutas posibles antes de que el camión saliera del garaje. Mapearon cada giro y parada en un diagrama detallado (un DAG).
  • El Resultado: Una vez encontrada la mejor ruta, la "solidificaron". El conductor ya no necesita pensar ni revisar un mapa mientras conduce; simplemente sigue el camino preplanificado perfectamente. Esto elimina todos los retrasos de toma de decisiones, haciendo que la conducción sea increíblemente suave y rápida.

3. La "Flota Híbrida" (Motor Heterogéneo)

Se dieron cuenta de que para algunas partes del viaje (cargar un lote enorme de paquetes al inicio, llamado "Prefill"), los camiones estándar antiguos eran en realidad mejores. Pero para la entrega final (generar palabra por palabra, llamado "Decode"), su nuevo camión MegaKernel era superior.

  • La Innovación: Construyeron un sistema híbrido. Mantuvieron los camiones estándar para el trabajo pesado al inicio, pero cambiaron sin problemas a su nuevo camión MegaKernel para la fase de entrega final.
  • El Resultado: Obtienes lo mejor de ambos mundos: alta velocidad para el inicio y latencia ultra baja para el final, sin tener que reconstruir toda la red de entrega.

El Impacto en el Mundo Real

El equipo probó esto en el sistema comercial de publicidad en línea de Baidu.

  • Velocidad: En escenarios donde la velocidad es crítica (lotes pequeños, respuestas cortas), su sistema fue hasta un 23.6% más rápido que las herramientas estándar de la industria y un 50.2% más rápido que una herramienta de código abierto popular llamada vLLM.
  • Fiabilidad: Funcionó consistentemente a través de diferentes tipos de modelos y tareas de IA.
  • Primera vez en su tipo: Esta es la primera vez que un "MegaKernel" ha sido desplegado con éxito en un sistema comercial de publicidad real y en vivo.

En Resumen
El artículo describe una forma de hacer que los chatbots de IA y los sistemas publicitarios sean mucho más rápidos en chips de computadora específicos y más pequeños. Lo hicieron empaquetando los datos de manera más eficiente, planificando toda la ruta de entrega con anticipación para que el conductor nunca tenga que pensar, y mezclando su nuevo método de entrega de alta velocidad con herramientas existentes. El resultado es un sistema que entrega respuestas significativamente más rápido, especialmente cuando muchos usuarios hacen preguntas uno por uno.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →