← Últimos artículos
💻 computer science

Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study

Este artículo presenta un estudio de despliegue en producción de una arquitectura de inferencia modular y agnóstica a la plataforma en Salesforce que permite un servicio escalable, rentable y de baja latencia de sistemas de IA compuestos como Agentforce y ApexGuru, logrando mejoras significativas en el rendimiento, la latencia de cola y los costos operativos, al tiempo que aborda desafíos únicos como la dispersión de múltiples modelos y los reinicios en frío en cascada.

Autores originales: Srikanta Prasad S V, Utkarsh Arora

Publicado 2026-04-29
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Srikanta Prasad S V, Utkarsh Arora

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que diriges un restaurante concurrido y de alta gama llamado Agentforce. En el pasado, este restaurante tenía una única cocina masiva (una configuración "estática") donde un solo chef ejecutivo intentaba hacerlo todo: picar verduras, asar filetes, hornear postres y lavar platos. Si el restaurante se llenaba, la cocina se congestionaba. Si el chef necesitaba tomar un descanso para descansar (un "arranque en frío"), todo el restaurante dejaba de servir comida. Y lo peor de todo, tenías que pagar el salario del chef las 24 horas del día, los 7 días de la semana, incluso cuando nadie estaba comiendo.

Este artículo describe cómo Salesforce reconstruyó su "restaurante" para manejar Sistemas de IA Compuestos. En lugar de una sola cocina grande, construyeron una red de entrega de alimentos modular y bajo demanda.

Así es como lo hicieron, explicado de forma sencilla:

1. El Problema: La Cocina de "Talla Única"

Las aplicaciones modernas de IA (como Agentforce o ApexGuru) son complejas. Cuando un cliente hace una pregunta, el sistema no le pide a un solo robot que responda. Es más como un equipo de especialistas trabajando juntos:

  • Especialista A (Modelo de Incrustación) consulta el historial del cliente.
  • Especialista B (LLM) redacta la respuesta.
  • Especialista C (Ejecutor SQL) verifica la base de datos.
  • Especialista D (Clasificador) decide lo que el cliente realmente quiere.

En la antigua configuración "estática", todos estos especialistas estaban atrapados en la misma habitación con el mismo hardware.

  • El Cuello de Botella: Si el especialista de la base de datos era lento, todo el pedido se retrasaba.
  • El Desperdicio: Tenías que mantener a todos los especialistas despiertos y listos las 24 horas del día, los 7 días de la semana, incluso si solo se necesitaba al especialista de "picar" a las 3 de la mañana.
  • La Pesadilla del "Arranque en Frío": Si el restaurante cerraba por una hora y reabría, cada especialista tenía que despertarse, estirarse y preparar sus herramientas. El cliente tenía que esperar a que el más lento se despertara antes de recibir cualquier comida.

2. La Solución: Una "Red de Entrega Inteligente"

Salesforce construyó una nueva arquitectura que actúa como un servicio de entrega inteligente y dinámico.

  • El Tomador de Pedidos (Servicio de Predicción): Cuando un cliente hace un pedido, un despachador inteligente no envía el pedido a una sola cocina grande. En su lugar, divide el pedido en partes y lo envía a los especialistas específicos que están mejor preparados para el trabajo.
  • Escalabilidad Independiente: Si 100 personas piden "filete" (llamadas a LLM), el sistema contrata instantáneamente a 100 chefs de filetes. Si solo 5 personas piden "ensalada" (llamadas de incrustación), solo contrata a 5 chefs de ensaladas. No compiten por espacio en la misma cocina.
  • Sin Servidores (Pago por Uso): Los especialistas no se sientan en un edificio esperando pedidos. Son "trabajadores en la nube" que solo aparecen cuando llega un pedido y se van cuando terminan. Solo pagas por los minutos que realmente trabajan.

3. Resolviendo el Problema de "Despertarse" (Arranques en Frío en Cascada)

El artículo descubrió un problema complicado: en un sistema compuesto, los especialistas dependen unos de otros. El Especialista A debe terminar antes de que el Especialista B pueda comenzar.

  • La Vieja Forma: Si el restaurante reabría, el Especialista A se despertaba (30 segundos), luego el Especialista B se despertaba (150 segundos), luego el Especialista C se despertaba (20 segundos). El cliente esperaba un total de 180 segundos.
  • El Nuevo Truco de "Precalentamiento": El sistema es lo suficientemente inteligente como para conocer la receta. Tan pronto como se llama al Especialista A, el sistema simultáneamente despierta a los Especialistas B y C en segundo plano.
  • El Resultado: En lugar de esperar 180 segundos, el cliente solo espera unos 65 segundos. El artículo indica que esto redujo el tiempo de "despertarse" en un 65%.

4. Los Resultados: Más Rápido, Más Barato y Más Suave

Después de ejecutar este nuevo sistema durante más de un año con clientes reales, esto es lo que sucedió:

  • Velocidad: La "latencia de cola" (el tiempo de espera en el peor caso para clientes lentos) disminuyó un 50%. Los pedidos que antes tardaban 37 segundos ahora tardan entre 10 y 11 segundos.
  • Capacidad: El sistema puede manejar 3.9 veces más pedidos al mismo tiempo en comparación con la antigua cocina.
  • Costo: Como dejaron de pagar por trabajadores inactivos, ahorraron entre un 30% y un 40% en costos.
  • Fiabilidad: Si un especialista se enferma (falla), el sistema no cierra todo el restaurante. Simplemente redirige el pedido alrededor de esa persona (por ejemplo: "No podemos verificar la base de datos, así que simplemente daremos una respuesta general"). El restaurante permanece abierto el 95% del tiempo, incluso cuando partes fallan.

5. Lecciones Clave Aprendidas (Los "Secretos del Chef")

Los autores compartieron algunas conclusiones importantes para cualquiera que construya estos sistemas:

  1. Los arranques en frío se multiplican, no solo se suman. Si tienes una cadena de tareas, el tiempo de espera se acumula. Tienes que despertar a toda la cadena a la vez, no una por una.
  2. Observa todo el flujo, no solo a los trabajadores individuales. Un trabajador puede ser rápido por sí mismo, pero si está atascado esperando a alguien más, todo el pedido es lento. Necesitas ver el "cuadro general" del pedido.
  3. Prueba las piezas individualmente. Como el sistema es modular, puedes cambiar solo al "chef de ensaladas" por uno nuevo sin despedir al "chef de filetes". Esto les permite mejorar sus modelos de IA en días en lugar de semanas.
  4. La degradación elegante es mejor que la perfección. Si una pequeña parte del sistema falla, todo lo demás no debería colapsar. Es mejor dar una respuesta ligeramente menos detallada que no dar ninguna respuesta.

Resumen

Este artículo trata sobre pasar de una configuración de IA rígida, costosa y de "una sola cocina" a una red flexible con estilo de "economía de gigas". Al tratar cada herramienta de IA como un trabajador separado y bajo demanda que puede escalarse hacia arriba o hacia abajo instantáneamente, Salesforce hizo que sus agentes de IA fueran más rápidos, más baratos y mucho más fiables para miles de usuarios empresariales.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →