← Últimos artículos
💻 computer science

Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications

Este artículo propone un marco unificado de dos etapas que combina técnicas avanzadas de personalización de modelos con optimizaciones de inferencia como la decodificación especulativa y la cuantización FP8 para permitir el despliegue escalable, rentable y robusto de sistemas multi-agente basados en LLM para aplicaciones empresariales, logrando una aceleración de rendimiento de 4.48x.

Autores originales: Paresh Dashore, Shreyas Kulkarni, Uttam Gurram, Nadia Bathaee, Kartik Balasubramaniam, Genta Indra Winata, Sambit Sahu, Shi-Xiong Zhang

Publicado 2026-06-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Paresh Dashore, Shreyas Kulkarni, Uttam Gurram, Nadia Bathaee, Kartik Balasubramaniam, Genta Indra Winata, Sambit Sahu, Shi-Xiong Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que diriges un concesionario de coches de lujo y de gran actividad. Tienes un equipo de cinco expertos brillantes y especializados (un Sistema Multi-Agente) que trabajan juntos para ayudar a un cliente a programar una prueba de conducción.

  1. El Entendedor escucha lo que el cliente quiere.
  2. El Planificador determina los mejores pasos a seguir.
  3. El Evaluador actúa como un guardia de seguridad, comprobando si el plan es seguro y lógico.
  4. El Ejecutor realmente reserva la cita.
  5. El Explicador comunica al cliente los detalles finales.

En el pasado, este equipo era dirigido por un "Super-Experto" (un modelo de IA masivo). Aunque el Super-Experto era increíblemente inteligente, era lento, caro de contratar y ocupaba una enorme cantidad de espacio de oficina (potencia de cómputo). Si un cliente hacía una pregunta compleja, el equipo tenía que llamar al Super-Experto cinco veces por separado, lo que causaba largos tiempos de espera y facturas elevadas.

Los autores de este artículo (de Capital One) querían mantener la inteligencia del equipo pero hacerlo más rápido, más barato y más fácil de ejecutar. Lo hicieron en dos fases principales: Entrenar a un Nuevo Pasante y Optimizar el Flujo de Trabajo.

Fase 1: Entrenar a un Nuevo Pasante (Personalización del Modelo Agéntico)

En lugar de depender del lento Super-Experto para cada tarea, decidieron entrenar a un "Pasante" más pequeño y rápido (un modelo de IA compacto) para que hiciera el trabajo. Pero no solo le dieron un libro de texto al Pasante; utilizaron un ingenioso campamento de entrenamiento de tres pasos:

  • Paso 1: El Curso Intensivo de Contexto (Preentrenamiento Continuo):
    Normalmente, cuando le enseñas a un nuevo empleado una industria específica (como la venta de coches), este podría olvidar cómo hablar inglés normal o perder sus habilidades generales. Para solucionar esto, los autores le dieron al Pasante "pistas contextuales" antes de cada lección. Imagina leer un capítulo de un libro, pero antes de empezar, lees un breve resumen del capítulo anterior. Esto mantuvo al Pasante fluido y evitó que olvidara sus habilidades generales mientras aprendía las reglas del concesionario de coches.

  • Paso 2: Sombra del Maestro (Ajuste Fino Supervisado):
    El Pasante observó al Super-Experto manejar miles de conversaciones reales con clientes. Sin embargo, el Super-Experto a veces cometía pequeños errores o daba respuestas que eran técnicamente correctas pero no perfectas. Para solucionar esto, utilizaron una IA "Juez" aún más inteligente para revisar el trabajo del Super-Experto y reescribir las respuestas para que fueran perfectas. El Pasante aprendió de estas respuestas reescritas perfectas, no de las originales.

  • Paso 3: Aprender lo que los Clientes Realmente Prefieren (Optimización de Preferencias):
    A veces, hay dos formas de responder a una pregunta. Una es segura y la otra es arriesgada. El Pasante necesitaba aprender cuál prefiere el cliente. El equipo mostró al Pasante pares de respuestas: "Esta es buena (Elegida)" frente a "Esta es mala (Rechazada)". El Pasante aprendió a elegir el camino "Elegido", alineando su comportamiento con lo que la empresa realmente quería.

El Resultado: Ahora tenían un Pasante diminuto y rápido que era tan bueno en el trabajo como el gigante Super-Experto, pero era mucho más ligero y fácil de gestionar.

Fase 2: Supercargando el Flujo de Trabajo (Optimización de la Inferencia)

Incluso con un Pasante rápido, el sistema seguía siendo un poco lento debido a cómo la computadora procesaba la información. Añadieron dos "impulsos de turbo":

  • El Truco de "Adivinar y Comprobar" (Decodificación Especulativa):
    Normalmente, la IA escribe una palabra a la vez, comprobando su trabajo después de cada letra. Esto es como escribir una frase letra por letra y pulsar "Enter" después de cada una.
    Los autores añadieron un pequeño "Asistente de Borrador" (una IA muy pequeña) que adivina las siguientes palabras antes de que el Pasante principal las escriba. El Pasante principal luego comprueba rápidamente si esas suposiciones son correctas. Si lo son, acepta todas a la vez. Es como si el Asistente de Borrador escribiera la frase completa en una servilleta, y el Pasante solo tuviera que poner un sello de "Aprobado". Esto ahorra una cantidad masiva de tiempo.

  • El "Uniforme Ligero" (Cuantización FP8):
    Los modelos de IA suelen usar "ropa pesada" (números de alta precisión matemática) que ocupan mucha memoria. Los autores cambiaron estas ropas pesadas por "uniformes ligeros" (un tipo específico de matemáticas comprimidas llamada FP8). Esto hizo que el modelo usara la mitad de la memoria y funcionara el doble de rápido, sin que el Pasante olvidara cómo hacer su trabajo.

El Resultado Final

Al combinar el Pasante Inteligente con el truco de "Adivinar y Comprobar" y el "Uniforme Ligero", el equipo logró algo asombroso:

  • Velocidad: El sistema es ahora 4.48 veces más rápido que la configuración original.
  • Calidad: El nuevo sistema no se volvió más tonto; de hecho, manejó situaciones complejas y complicadas (como conversaciones largas o peticiones inusuales) incluso mejor que el modelo gigante original.
  • Costo: Debido a que es más rápido y utiliza menos memoria, cuesta mucho menos ejecutarlo.

La Gran Lección:
Este artículo nos enseña que no necesitas un cerebro gigante y lento para resolver problemas complejos. Si entrenas un cerebro más pequeño cuidadosamente (usando los datos y los métodos de enseñanza adecuados) y le das las herramientas correctas (como el truco de "Adivinar y Comprobar"), puedes construir un sistema que sea increíblemente rápido y también increíblemente inteligente. Se trata de trabajar de forma más inteligente, no solo más dura.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →