← Últimos artículos
💻 computer science

Learning Latency-Aware Orchestration for Multi-Agent Systems

El artículo presenta LAMaS, un nuevo marco de trabajo que reduce la latencia de extremo a extremo en sistemas multiagente mediante el aprendizaje de grafos de ejecución conscientes de la latencia con asignación de crédito de ruta crítica durante el entrenamiento y el empleo de un controlador adaptativo ligero para eliminar interacciones redundantes durante la inferencia, logrando una reducción de latencia de más del 50% mientras mantiene la precisión de la tarea.

Autores originales: Xi Shi, Mengxin Zheng, Qian Lou

Publicado 2026-08-14
📖 4 min de lectura☕ Lectura para el café

Autores originales: Xi Shi, Mengxin Zheng, Qian Lou

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un equipo de brillantes robots especializados trabajando juntos para resolver un rompecabezas complejo. Este es el mundo de los Sistemas Multiagente (MAS), donde poderosas "mentes" de IA (llamadas Modelos de Lenguaje de Gran Tamaño o LLM) se dividen en ayudantes más pequeños y enfocados. Un robot puede ser excelente en matemáticas, otro en programación y un tercero en verificar hechos. Al pasarse notas e ideas de un lado a otro, pueden abordar problemas que un solo robot no podría resolver por sí solo. Sin embargo, hay un inconveniente: cada vez que estos robots hablan entre sí, toma tiempo. Si tienen que pasarse una nota diez veces para obtener una respuesta, todo el proceso se vuelve lento, tardando a veces de 10 a 60 minutos solo para terminar una sola tarea. En el mundo real, esperar tanto tiempo es un factor determinante que impide su uso.

Durante un tiempo, los científicos intentaron hacer que estos equipos fueran más rápidos simplemente reduciendo costos o haciendo que los robots fueran más inteligentes. Pero se dieron cuenta de que hacer que el equipo sea más "barato" no siempre lo hace más "rápido". Piénsalo como una carrera de relevos: si tienes un equipo de diez corredores, el tiempo total no es solo la suma de la velocidad de cada uno; está determinado por la cadena más lenta y larga de corredores pasando el testigo. Si reduces el número de corredores pero dejas intacta la cadena más lenta, el tiempo de la carrera no mejora. La gran pregunta fue: ¿Cómo rediseñamos el flujo de trabajo del equipo para reducir el tiempo sin perder la precisión de la respuesta final?

Esto es exactamente lo que los investigadores de la Universidad de la Florida Central abordaron en su nuevo artículo, introduciendo un sistema llamado LAMaS (Sistema Multiagente Consciente de la Latencia). Descubrieron que la forma antigua de optimizar estos equipos de IA era como intentar arreglar un atasco de tráfico diciéndole a cada coche que condujera más rápido, incluso si el cuello de botella era un único puente estrecho. En cambio, LAMaS actúa como un controlador de tráfico inteligente que sabe exactamente qué parte de la ruta es el "camino crítico": la cadena de pasos más larga que determina el tiempo total.

El artículo propone una estrategia de dos partes para solucionar el problema de la velocidad. Primero, durante la fase de "entrenamiento" (donde el sistema aprende cómo trabajar), LAMaS utiliza un método de puntuación especial. En lugar de castigar a todos los robots por igual cuando tardan demasiado, enfoca su "regaño" solo en los robots que forman parte del camino crítico, aquellos que están retrasando a todo el equipo. También establece una regla estricta: no importa qué tan rápido sean, no pueden caer por debajo de cierto nivel de precisión. Es como decirle a un equipo de carreras: "Pueden correr tan rápido como quieran, pero deben terminar la carrera correctamente".

Segundo, y quizás de manera más ingeniosa, LAMaS añade un "controlador ligero" que observa la carrera en tiempo real. Incluso si el equipo planeaba correr diez vueltas, este controlador podría notar después de la tercera vuelta que el equipo ya ha encontrado la respuesta. Entonces tiene el poder de decir: "¡Alto! No necesitamos las otras siete vueltas", y corta el resto del trabajo. Esto sucede dinámicamente a medida que la tarea se desarrolla, en lugar de ser un plan fijo hecho con antelación.

Cuando los investigadores probaron esto en cuatro diferentes bancos de pruebas desafiantes —que iban desde resolver problemas de matemáticas de escuela primaria hasta escribir código y responder preguntas de conocimiento complejas— descubrieron que LAMaS fue un cambio radical. Comparado con otros sistemas avanzados de equipos de IA, LAMaS redujo el tiempo de espera total en más del 50% (en algunos casos reduciéndolo hasta en un 75%) manteniendo la precisión igual de alta, o incluso mejor. Por ejemplo, en un banco de pruebas de matemáticas llamado GSM8K, su sistema terminó en aproximadamente 11.73 segundos con un 93.65% de precisión, mientras que otros sistemas de alto nivel tardaron más de 48 segundos para una precisión similar.

El artículo sugiere que este enfoque no es solo una solución temporal para un sistema específico; cuando intentaron integrar el método LAMaS en otros diseños de equipos de IA existentes, este los hizo más rápidos de manera consistente sin romperlos. Los autores demuestran que, al enfocarnos en los pasos del "cuello de botella" y permitir que el sistema se detenga anticipadamente cuando tiene confianza, podemos construir equipos de IA que no solo son inteligentes, sino también increíblemente rápidos, haciéndolos mucho más prácticos para el uso en el mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →