← Últimos artículos
💬 NLP

RequestRouter: Request-Boundary Routing for Efficient Single-GPU LLM Inference

RequestRouter es un controlador de límites de solicitud ligero que selecciona dinámicamente modos de inferencia óptimos (tales como cuantización, decodificación especulativa o almacenamiento en caché de prefijos) para el servicio de LLM en una sola GPU, logrando reducciones significativas de latencia y energía con un sobrecoste insignificante mientras mantiene una precisión casi idéntica a la inferencia de precisión completa.

Autores originales: Aman Sunesh, Ali Alshehhi, Hivansh Dhakne

Publicado 2026-08-21
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Aman Sunesh, Ali Alshehhi, Hivansh Dhakne

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La inteligencia artificial moderna depende de los modelos de lenguaje extensos para generar texto, responder preguntas y resolver problemas. Estos sistemas son potentes, pero también son hambrientos de electricidad. Cada vez que un usuario hace una pregunta, la computadora debe realizar miles de millones de cálculos para producir una respuesta, un proceso que consume una energía significativa y toma tiempo. Para las personas que operan estos sistemas, el desafío es hacer que la computadora trabaje lo más rápido posible sin desperdiciar potencia. Actualmente, la mayoría de los sistemas utilizan un único ajuste fijo para cada solicitud, independientemente de si la tarea es simple o compleja. Esto es como conducir un camión pesado a velocidades de autopista ya sea que estés cruzando una manzana de la ciudad o viajando a través de un país; funciona, pero a menudo es ineficiente. Los investigadores están buscando ahora formas de adaptar los ajustes de la computadora al trabajo específico en cuestión, con la esperanza de ahorrar energía y acelerar las respuestas sin cambiar la inteligencia subyacente del modelo en sí mismo.

Un equipo de investigadores de la Universidad de Nueva York ha desarrollado un nuevo enfoque llamado RequestRouter para resolver este problema. En lugar de forzar cada solicitud a pasar por el mismo proceso lento y de alto consumo energético, su sistema actúa como un controlador de tráfico ligero. Antes de que la computadora comience a generar una respuesta, este controlador observa algunos detalles simples sobre la solicitud, como qué tan larga es la pregunta del usuario, qué tan larga se espera que sea la respuesta y si la pregunta comparte una frase inicial común con otras preguntas recientes. Basándose en estas pistas, el controlador selecciona instantáneamente la forma más eficiente de procesar esa solicitud específica de un menú de opciones existentes. Estas opciones incluyen ejecutar el modelo con números de menor precisión para ahorrar energía, utilizar una técnica que adivina las siguientes palabras para acelerar la generación, o reutilizar partes de la conversación que ya han sido calculadas. El sistema no reentrena el modelo ni cambia su arquitectura; simplemente elige la mejor herramienta para el trabajo de entre las herramientas que ya están disponibles.

Los investigadores probaron esta idea en una potente tarjeta gráfica, una pieza de hardware común utilizada para ejecutar estos modelos, utilizando un modelo de lenguaje estándar de ocho mil millones de parámetros. Realizaron miles de pruebas con diferentes tipos de solicitudes, que iban desde interacciones cortas y rápidas hasta conversaciones largas y complejas. Compararon el rendimiento de su controlador inteligente contra el método estándar de usar un único ajuste no optimizado para todo. Los resultados fueron sorprendentes. En promedio, el controlador hizo que el sistema fuera dos veces más rápido que el método estándar mientras utilizaba menos de la mitad de la energía por palabra generada. En una prueba más rigurosa donde repitieron las mismas solicitudes múltiples veces para asegurar que los resultados no fueran una casualidad, el controlador mantuvo una mejora de velocidad de casi dos veces y una reducción significativa en el uso de energía. El controlador también fue extremadamente rápido al tomar sus propias decisiones, tardando menos de cinco milésimas de milisegundo en elegir un camino, un retraso tan pequeño que es efectivamente invisible para el usuario.

Crucialmente, los investigadores descubrieron que estas ganancias de eficiencia no se produjeron a costa de la calidad. Probaron el sistema en una variedad de evaluaciones diseñadas para medir qué tan bien el modelo entiende y responde preguntas. El controlador inteligente preservó casi toda la precisión del método estándar, reteniendo más del noventa y nueve por ciento del rendimiento. Esto es importante porque algunos de los métodos más rápidos y de ahorro de energía pueden, a veces, hacer que el modelo sea menos preciso. El controlador utiliza una política basada en reglas para evitar estas trampas, dirigiendo las preguntas difíciles a los ajustes más fiables mientras envía las tareas más simples a los modos más rápidos y eficientes. El estudio también comparó su controlador simple basado en reglas contra sistemas más complejos y aprendidos que intentan predecir el mejor ajuste utilizando inteligencia artificial. Encontraron que los sistemas complejos eran mucho más lentos al tomar decisiones, añadiendo tanto retraso que cancelaban los ahorros de energía. El enfoque simple basado en reglas resultó ser la solución más práctica, ofreciendo el mejor equilibrio entre velocidad, energía y calidad.

Este trabajo sugiere que el futuro de la inteligencia artificial eficiente puede no requerir la construcción de modelos más inteligentes o la invención de nuevo hardware. En cambio, se pueden lograr mejoras significativas simplemente prestando atención a la estructura de las solicitudes que llegan y adaptándolas al modo de procesamiento adecuado. Los investigadores demostraron que, al tratar las diferentes técnicas de optimización no como ajustes permanentes sino como opciones seleccionables, pudieron recuperar una eficiencia sustancial. Este enfoque respeta la calidad del resultado mientras reduce drásticamente el costo energético de ejecutar estos sistemas. Ofrece un camino claro para hacer que los modelos de lenguaje extensos sean más sostenibles, mostrando que, a veces, la forma más efectiva de ahorrar energía no es trabajar más duro, sino trabajar de forma más inteligente eligiendo la herramienta adecuada para cada tarea específica.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →