← Derniers articles
💻 computer science

Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study

Ce document présente une étude de déploiement en production d'une architecture d'inférence modulaire et indépendante de la plateforme chez Salesforce, permettant un service évolutif, rentable et à faible latence de systèmes d'IA composés tels qu'Agentforce et ApexGuru, avec des améliorations significatives du débit, de la latence de queue et des coûts opérationnels tout en répondant à des défis uniques tels que la diffusion multi-modèles et les démarrages à froid en cascade.

Auteurs originaux : Srikanta Prasad S V, Utkarsh Arora

Publié 2026-04-29
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Srikanta Prasad S V, Utkarsh Arora

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous dirigez un restaurant animé et haut de gamme appelé Agentforce. Autrefois, ce restaurant disposait d'une seule cuisine massive (une configuration "statique") où un chef cuisinier tentait de tout faire : couper les légumes, griller les steaks, préparer les desserts et laver la vaisselle. Si le restaurant devenait bondé, la cuisine s'engorgeait. Si le chef devait prendre une pause pour se reposer (un "démarrage à froid"), tout le restaurant cessait de servir. Et, pire encore, vous deviez payer le salaire du chef 24 heures sur 24, 7 jours sur 7, même lorsque personne ne mangeait.

Ce document décrit comment Salesforce a reconstruit son "restaurant" pour gérer les Systèmes d'IA Composés. Au lieu d'une seule grande cuisine, ils ont créé un réseau de livraison alimentaire modulaire et à la demande.

Voici comment ils ont procédé, expliqué en termes simples :

1. Le Problème : La Cuisine "Taille Unique"

Les applications d'IA modernes (comme Agentforce ou ApexGuru) sont complexes. Lorsqu'un client pose une question, le système ne demande pas simplement à un robot de répondre. C'est plutôt comme une équipe de spécialistes travaillant ensemble :

  • Spécialiste A (Modèle d'Embedding) consulte l'historique du client.
  • Spécialiste B (LLM) rédige la réponse.
  • Spécialiste C (Exécuteur SQL) vérifie la base de données.
  • Spécialiste D (Classifieur) détermine ce que le client veut réellement.

Dans l'ancienne configuration "statique", tous ces spécialistes étaient coincés dans la même pièce sur le même matériel.

  • Le Goulot d'Étranglement : Si le spécialiste de la base de données était lent, toute la commande était retardée.
  • Le Gaspillage : Vous deviez maintenir tous les spécialistes éveillés et prêts 24h/24, même si seul le spécialiste de la "coupe" était nécessaire à 3 heures du matin.
  • Le Cauchemar du "Démarrage à Froid" : Si le restaurant fermait pendant une heure puis rouvrait, chaque spécialiste devait se réveiller, s'étirer et préparer ses outils. Le client devait attendre que le plus lent se réveille avant de recevoir de la nourriture.

2. La Solution : Un "Réseau de Livraison Intelligent"

Salesforce a construit une nouvelle architecture qui agit comme un service de livraison intelligent et dynamique.

  • Le Preneur de Commande (Service de Prédiction) : Lorsqu'un client commande, un dispatcher intelligent n'envoie pas la commande à une seule grande cuisine. Au lieu de cela, il décompose la commande en parties et les envoie aux spécialistes spécifiques les mieux adaptés à la tâche.
  • Mise à l'Échelle Indépendante : Si 100 personnes commandent un "steak" (appels LLM), le système engage instantanément 100 chefs de steak. Si seulement 5 personnes commandent une "salade" (appels d'embedding), il n'engage que 5 chefs de salade. Ils ne se battent pas pour l'espace dans la même cuisine.
  • Sans Serveur (Paiement à l'Usage) : Les spécialistes ne sont pas assis dans un bâtiment en attendant des commandes. Ce sont des "travailleurs du cloud" qui ne se présentent que lorsqu'une commande arrive et partent une fois leur travail terminé. Vous ne payez que pour les minutes où ils travaillent réellement.

3. Résoudre le Problème du "Réveil" (Démarrages à Froid en Cascade)

L'article a découvert un problème délicat : dans un système composé, les spécialistes dépendent les uns des autres. Le Spécialiste A doit terminer avant que le Spécialiste B ne puisse commencer.

  • L'Ancienne Méthode : Si le restaurant rouvre, le Spécialiste A se réveille (30 secondes), puis le Spécialiste B se réveille (150 secondes), puis le Spécialiste C se réveille (20 secondes). Le client attend 180 secondes au total.
  • Le Nouvel Astuce de "Pré-échauffement" : Le système est assez intelligent pour connaître la recette. Dès que le Spécialiste A est appelé, le système réveille simultanément les Spécialistes B et C en arrière-plan.
  • Le Résultat : Au lieu d'attendre 180 secondes, le client n'attend que 65 secondes environ. L'article indique que cela a réduit le temps de "réveil" de 65 %.

4. Les Résultats : Plus Rapide, Moins Cher et Plus Fluide

Après avoir fait fonctionner ce nouveau système pendant plus d'un an avec de vrais clients, voici ce qui s'est produit :

  • Vitesse : La "latence de queue" (le temps d'attente maximal pour les clients lents) a chuté de 50 %. Les commandes qui prenaient auparavant 37 secondes prennent maintenant environ 10 à 11 secondes.
  • Capacité : Le système peut gérer 3,9 fois plus de commandes simultanément par rapport à l'ancienne cuisine.
  • Coût : Parce qu'ils ont cessé de payer pour des travailleurs inactifs, ils ont économisé 30 à 40 % sur les coûts.
  • Fiabilité : Si un spécialiste tombe malade (échec), le système ne ferme pas tout le restaurant. Il redirige simplement la commande autour de cette personne (par exemple : "Nous ne pouvons pas vérifier la base de données, alors donnons une réponse générale"). Le restaurant reste ouvert 95 % du temps, même lorsque des parties tombent en panne.

5. Leçons Clés Apprises (Les "Secrets du Chef")

Les auteurs ont partagé quelques grandes conclusions pour quiconque construit ces systèmes :

  1. Les démarrages à froid se multiplient, ils ne s'additionnent pas simplement. Si vous avez une chaîne de tâches, le temps d'attente s'accumule. Vous devez réveiller toute la chaîne d'un coup, pas une par une.
  2. Surveillez l'ensemble du pipeline, pas seulement les travailleurs individuels. Un travailleur peut être rapide seul, mais s'il est coincé en attendant quelqu'un d'autre, toute la commande est lente. Vous devez voir la "grande image" de la commande.
  3. Testez les pièces individuellement. Parce que le système est modulaire, vous pouvez remplacer uniquement le "chef de salade" par un nouveau sans licencier le "chef de steak". Cela leur permet d'améliorer leurs modèles d'IA en jours plutôt qu'en semaines.
  4. La dégradation gracieuse est meilleure que la perfection. Si une petite partie du système échoue, l'ensemble ne devrait pas planter. Il vaut mieux donner une réponse légèrement moins détaillée que de ne donner aucune réponse du tout.

Résumé

Cet article traite du passage d'une configuration d'IA rigide, coûteuse et "à une seule cuisine" à un réseau flexible de style "économie des petits boulots". En traitant chaque outil d'IA comme un travailleur séparé et à la demande, pouvant être mis à l'échelle instantanément vers le haut ou vers le bas, Salesforce a rendu ses agents d'IA plus rapides, moins chers et beaucoup plus fiables pour des milliers d'utilisateurs d'entreprise.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →