← Últimos artículos
🤖 machine learning

Theoretically Optimal Attention/FFN Ratios in Disaggregated LLM Serving

Este artículo presenta un marco analítico y una regla de aprovisionamiento de forma cerrada para determinar la relación óptima teórica entre recursos de Atención y FFN en el servicio de LLMs desagregados, considerando la dinámica estocástica de la carga de trabajo y los sobrecostos de sincronización para minimizar el tiempo de inactividad de los dispositivos y el bloqueo a nivel de paso.

Autores originales: Chendong Song, Meixuan Wang, Hang Zhou, Hong Liang, Yuan Lyu, Zixi Chen, Yuwei Fan, Zijie Zhou

Publicado 2026-05-08
📖 4 min de lectura☕ Lectura para el café

Autores originales: Chendong Song, Meixuan Wang, Hang Zhou, Hong Liang, Yuan Lyu, Zixi Chen, Yuwei Fan, Zijie Zhou

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás dirigiendo una fábrica masiva y de alta velocidad que produce "pensamientos" (tokens) para un cerebro gigante de IA. Esta fábrica tiene dos líneas de ensamblaje principales que trabajan juntas para finalizar cada pensamiento:

  1. La Línea de Memoria (Atención): Este equipo es como un bibliotecario. Tienen que correr de ida y vuelta a una estantería gigante y en crecimiento (la memoria caché KV) para encontrar páginas específicas para cada solicitud. A medida que la estantería se hace más grande, este equipo se vuelve más lento y más lento porque tienen que cargar pesos más pesados. Están limitados por la memoria.
  2. La Línea de Cálculo (FFN): Este equipo es como una calculadora supersónica. No necesitan mirar la estantería; simplemente hacen cuentas basadas en lo que les entregan los bibliotecarios. Están limitados por el cómputo y pueden trabajar increíblemente rápido si tienen suficiente trabajo que hacer.

El Problema: El "Baile Desajustado"

En los viejos tiempos, estos dos equipos estaban atrapados en la misma habitación. Si los bibliotecarios eran lentos, las calculadoras tenían que quedarse quietas, esperando a ellos. Si las calculadoras eran rápidas, los bibliotecarios eran el cuello de botella.

Para solucionar esto, los ingenieros inventaron un nuevo diseño llamado AFD (Desagregación Atención-FFN). Movieron a los bibliotecarios y a las calculadoras a habitaciones separadas. Ahora, puedes tener muchos equipos de bibliotecarios alimentando una sola habitación gigante de calculadoras.

Pero aquí está la trampa: ¿Cuántos equipos de bibliotecarios necesitas para una habitación de calculadoras?

  • ¿Demasiados pocos bibliotecarios? La calculadora se queda inactiva, hambrienta de datos.
  • ¿Demasiados bibliotecarios? La calculadora se desborda, y los bibliotecarios tienen que quedarse parados esperando a que la calculadora se ponga al día.

Encontrar la proporción perfecta (llamémosla r) es como intentar encontrar el número perfecto de camareros para un solo chef. Si adivinas mal, toda la fábrica se ralentiza.

La Solución del Artículo: Una "Bola de Cristal" para los Directores de Fábrica

Los autores de este artículo se dieron cuenta de que adivinar la proporción es difícil porque el trabajo es aleatorio.

  • Algunos clientes tienen preguntas cortas; otros tienen historias largas.
  • Algunas solicitudes terminan rápido; otras tardan mucho tiempo.
  • La "estantería" (memoria) crece de manera diferente para cada solicitud.

Debido a esta aleatoriedad, no puedes simplemente usar una fórmula matemática simple basada en promedios. Necesitas una manera de predecir el caos.

Su "Salsa Secreta" es un nuevo marco matemático que hace tres cosas:

  1. Mide el "Caos Promedio": Desarrollaron una manera de mirar registros de solicitudes pasadas (trazas) y calcular un solo número (llamado θ) que representa la carga de trabajo promedio real, teniendo en cuenta el hecho de que las solicitudes más largas es más probable que se vean en cualquier momento aleatorio.
  2. Tiene en cuenta al "Carrera Más Lento": En esta fábrica, todos los equipos de bibliotecarios deben terminar su trabajo antes de que la calculadora pueda comenzar. Si un equipo se atasca con un libro enorme, toda la línea espera. Los autores crearon una fórmula para predecir cuánto tiempo extra se pierde debido a estos "rezagados" (los trabajadores más lentos).
  3. Proporciona una Receta de "Proporción Áurea": Usando estas dos ideas, derivaron una regla simple y de forma cerrada. Introduces las especificaciones de tu hardware y tus registros de solicitudes, y la fórmula te dice el número exacto de equipos de bibliotecarios que necesitas para que tu habitación de calculadoras funcione a máxima velocidad.

Los Resultados: "¡Funciona!"

El equipo construyó un simulador digital (una fábrica virtual) para probar su teoría.

  • Probaron diferentes números de equipos de bibliotecarios (de 1 a 32).
  • Compararon su predicción de "Proporción Áurea" contra el mejor rendimiento real encontrado por el simulador.
  • El Veredicto: Su predicción fue increíblemente precisa, coincidiendo con la simulación del mundo real dentro de un 10%.

También descubrieron que a medida que agregas más equipos de bibliotecarios, el "tiempo de espera" causado por el equipo más lento sí aumenta, pero su fórmula tiene esto en cuenta, asegurando que no agregues demasiados equipos y desperdicies dinero.

La Conclusión

Este artículo proporciona un código científico para construir estas fábricas de IA divididas. En lugar de adivinar o usar prueba y error, los diseñadores de sistemas ahora pueden usar esta matemática para determinar exactamente cómo equilibrar sus recursos de memoria y cómputo, asegurando que la IA funcione tan rápido y eficientemente como sea posible, incluso cuando la carga de trabajo es impredecible.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →