← Últimos artículos
🤖 AI

Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling

Este artículo presenta AFlex, un marco de trabajo que reduce el consumo de energía en el servicio de LLM hasta en un 49% mediante la ejecución desagregada de Atención-FFN, la optimización conjunta de recursos y frecuencia, y un pipeline entrelazado que se adapta a las sensibilidades de frecuencia a nivel de operador mientras cumple con estrictos SLO de latencia.

Autores originales: Cunchen Hu, Liangliang Xu, Tian Liu, Min Lyu, Yongkun Li, Sa Wang, Shuo Quan, Yanan Yang, Wenda Tang, Yiduo Wang, Fu Yu, Jie Wu

Publicado 2026-08-04
📖 4 min de lectura☕ Lectura para el café

Autores originales: Cunchen Hu, Liangliang Xu, Tian Liu, Min Lyu, Yongkun Li, Sa Wang, Shuo Quan, Yanan Yang, Wenda Tang, Yiduo Wang, Fu Yu, Jie Wu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás dirigiendo un cerebro robótico masivo y superinteligente en un centro de datos gigante. Este cerebro, conocido como Modelo de Lenguaje Extenso (LLM), es el motor detrás de los chatbots, los asistentes de programación y los escritores creativos. Pero hay un inconveniente: estos cerebros son increíblemente hambrientos. Consumen enormes cantidades de electricidad, a menudo haciendo funcionar sus procesadores a máxima velocidad, como el motor de un coche de carreras revolucionando a las máximas RPM incluso cuando el coche está atrapado en el tráfico. Esto es un problema porque cuesta una fortuna en energía y genera mucho calor.

Para hacer que estos robots funcionen más rápido, los científicos han descubierto cómo dividir el trabajo. Piensa en el proceso de pensamiento del robot como si tuviera dos pasos principales: primero, lee y comprende tu pregunta (la fase de "prefill") y, segundo, escribe la respuesta palabra por palabra (la fase de "decode"). Recientemente, los ingenieros se dieron cuenta de que es mejor poner estos dos pasos en habitaciones diferentes con diferentes equipos de trabajadores, en lugar de tener un solo equipo haciendo ambas cosas. Esto se llama "desagregación". Ayuda a que el robot responda más rápido, pero no necesariamente hace que consuma menos electricidad. De hecho, si simplemente reduces la velocidad de los trabajadores para ahorrar energía, el robot podría volverse demasiado lento y no cumplir con sus plazos. La gran pregunta es: ¿cómo podemos ralentizar las cosas para ahorrar energía sin que el robot tartamudee o falle?

Este artículo presenta un nuevo y astuto sistema llamado AFlex que resuelve este rompecabezas tratando el cerebro del robot como un equipo de especialistas con diferentes necesidades energéticas. Los investigadores descubrieron que las dos partes principales del cerebro del robot —la parte que presta atención a tus palabras (Atención) y la parte que procesa la lógica (Red de Alimentación hacia Adelante, o FFN)— no son iguales. Son como dos atletas diferentes: uno es un velocista que necesita un impulso de alta velocidad para correr rápido, mientras que el otro es un corredor de maratón que se cansa si lo presionas demasiado pero puede mantener un ritmo constante y más lento de manera eficiente.

Anteriormente, los sistemas trataban a todo el cerebro como una sola unidad, obligando al velocista y al corredor de maratón a correr exactamente a la misma velocidad. Si acelerabas a ambos para ayudar al velocista, el corredor de maratón desperdiciaba energía. Si ralentizabas a ambos para ahorrar energía para el corredor de maratón, el velocista se volvía demasiado lento. Los autores de este artículo descubrieron que estas dos partes en realidad prefieren velocidades diferentes dependiendo de lo que el robot esté haciendo, de qué tan larga sea la pregunta y de cuántas personas estén haciendo preguntas al mismo tiempo.

Para solucionar esto, AFlex actúa como un gerente inteligente que puede dar al velocista y al corredor de maratón sus propias pistas y sus propios ajustes de velocidad personales. Utiliza un "Programador Global" para planificar el panorama general, decidiendo a cuántos trabajadores asignar a cada tarea, y un "Controlador Local" para ajustar sus velocidades en tiempo real, segundo a segundo. El sistema también utiliza una técnica especial de tubería (pipeline) donde los trabajadores se pasan notas entre sí mientras todavía están trabajando, para que nadie se quede esperando. Este enfoque "intercalado" mantiene la línea de ensamblaje moviéndose suavemente sin huecos.

Los investigadores probaron AFlex en potentes chips informáticos (GPUs NVIDIA A800) utilizando datos del mundo real de tareas de programación y conversación. Descubrieron que al permitir que las partes de Atención y FFN funcionen a sus propias velocidades únicas de ahorro de energía, el sistema podía reducir la energía utilizada por palabra generada hasta en un 49% en comparación con los mejores métodos existentes que dividían el trabajo, y en un 48% en comparación con los sistemas que simplemente intentaban ralentizar todo el chip. Crucialmente, el robot respondía tan rápido como antes, cumpliendo todas sus promesas de velocidad. El artículo sugiere que este enfoque de dar a las diferentes partes del cerebro de la IA diferentes velocidades es un gran paso para hacer que la inteligencia artificial sea mucho más eficiente energéticamente sin sacrificar el rendimiento.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →