From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems
Cette enquête définit les systèmes d'IA composés comme un paradigme émergent qui intègre les grands modèles de langage à des composants externes tels que les récupérateurs et les agents, en proposant une taxonomie unifiée et une analyse des paradigmes fondamentaux comme le RAG et les agents LLM pour remédier à la fragmentation actuelle et orienter les recherches futures en intelligence artificielle au niveau des systèmes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez une bibliothécaire brillante et bien informée nommée « LLM » (Large Language Model). Cette bibliothécaire a lu presque tous les livres jamais écrits jusqu'à une certaine date. Elle est incroyablement rapide pour écrire des histoires, répondre à des questions et discuter. Cependant, elle a trois gros problèmes :
- Elle oublie des choses : Elle ne peut pas se souvenir des faits survenus après qu'elle a arrêté ses études (ses connaissances sont « périmées»).
- Elle invente des choses : Parfois, quand elle ne connaît pas la réponse, elle invente avec assurance un fait faux (cela s'appelle une «hallucination»).
- Elle ne peut pas faire de mathématiques ni utiliser d'outils : Elle est excellente pour parler, mais elle ne peut pas réellement calculer une équation complexe, rechercher sur l'internet en direct ou contrôler un bras robotique.
Ce papier présente une nouvelle façon de construire l'IA appelée Systèmes d'IA Composés (CAIS). Au lieu de se fier uniquement à cette seule bibliothécaire, les CAIS construisent une équipe ou un orchestre autour de la bibliothécaire pour résoudre ces problèmes.
Voici comment le papier décompose cette «équipe», en utilisant des analogies simples :
1. Les Quatre Membres Clés de l'Équipe (Les Axes)
Le papier organise ce nouveau monde de l'IA en quatre rôles principaux qui travaillent ensemble :
Le Chercheur (RAG - Génération Augmentée par Récupération) :
- Le Problème : La bibliothécaire ne connaît pas les actualités d'aujourd'hui ni les fichiers privés de votre entreprise.
- La Solution : Avant que la bibliothécaire ne réponde, un Chercheur court vers les rayons de la bibliothèque (ou l'internet) pour trouver les documents spécifiques et à jour. Il remet ces notes à la bibliothécaire afin qu'elle puisse répondre en se basant sur des faits, et non sur des suppositions.
- Analogie : C'est comme donner un mémo de triche à la bibliothécaire juste avant un examen.
Le Chef de Projet (Agents LLM) :
- Le Problème : La bibliothécaire est bonne pour une tâche, mais elle se perd dans un projet long et compliqué qui nécessite de nombreuses étapes.
- La Solution : Un Agent est une version de la bibliothécaire capable de planifier. Il décompose une grande tâche (comme «Planifier des vacances») en petites étapes (Réserver un vol -> Trouver un hôtel -> Vérifier la météo). Il peut aussi utiliser des outils, comme appeler une API de voyage ou faire des mathématiques, puis vérifier son propre travail pour corriger les erreurs.
- Analogie : C'est comme un contremaître qui ne pose pas seulement des briques, mais qui dessine les plans, commande les matériaux et inspecte le travail.
L'Expert Multi-Sensoriel (MLLMs - LLMs Multimodaux) :
- Le Problème : La bibliothécaire ne peut lire que du texte. Si vous lui montrez une photo d'un moteur cassé ou une vidéo d'une tempête, elle est aveugle.
- La Solution : Ce sont des bibliothécaires à qui l'on a donné des yeux et des oreilles. Ils peuvent regarder des images, écouter de l'audio et regarder des vidéos, puis décrire ce qu'ils voient ou répondre à des questions à ce sujet.
- Analogie : C'est comme donner des lunettes et des écouteurs à la bibliothécaire pour qu'elle puisse comprendre un monde qui n'est pas seulement fait de mots écrits.
Le Chef d'Orchestre (Orchestration) :
- Le Problème : Si vous avez un Chercheur, un Chef de Projet et un Expert Multi-Sensoriel, ils pourraient tous parler en même temps ou se confondre sur qui fait quoi.
- La Solution : Le Chef d'Orchestre est le système qui gère toute l'équipe. Il décide quand appeler le Chercheur, quand demander au Agent de planifier, et comment combiner leurs réponses en un résultat final unique. Il s'assure que l'équipe travaille harmonieusement ensemble.
- Analogie : Pensez à un orchestre symphonique. La bibliothécaire est le violoniste, mais le Chef d'Orchestre s'assure que les tambours, les flûtes et les violons jouent tous au bon moment pour faire de la musique, et non du bruit.
2. Comment Ils Travaillent Ensemble (Le Pipeline)
Le papier explique qu'un Système d'IA Composé réel n'est pas seulement l'une de ces choses ; c'est généralement toutes à la fois.
Imaginez que vous demandez au système : «Analysez cette photo d'une machine cassée et trouvez le manuel pour la réparer.»
- L'Expert Multi-Sensoriel regarde la photo et comprend de quelle machine il s'agit.
- Le Chercheur sort et trouve le manuel spécifique pour ce modèle de machine.
- Le Chef de Projet (Agent) détermine les étapes pour la réparer et décide d'utiliser un outil pour vérifier si la pièce est en stock.
- Le Chef d'Orchestre (Orchestration) gère le flux, s'assurant que l'analyse de la photo a lieu avant la recherche du manuel, et combine tout cela en une réponse claire pour vous.
3. Les Défis Actuels
Le papier admet que si cette approche par «équipe» est puissante, elle est aussi désordonnée pour le moment :
- C'est compliqué : Construire une équipe est plus difficile que d'embaucher une seule personne. Si une partie tombe en panne, tout le système peut échouer.
- Ils ne parlent pas la même langue : Différents outils et agents utilisent souvent des formats différents, ce qui rend difficile leur connexion (comme essayer de brancher un chargeur européen dans une prise américaine).
- C'est difficile à tester : Nous n'avons pas encore de tests parfaits pour voir si toute l'équipe fonctionne bien, surtout lorsqu'ils regardent des images et parlent à des outils en même temps.
4. L'Avenir : La Standardisation
Le papier souligne que les gens commencent à créer des «adaptateurs universels» (comme le Protocole de Contexte de Modèle ou MCP). Ce sont comme des multiprises universelles qui permettent à n'importe quel outil d'IA de se brancher facilement sur n'importe quel système d'IA. L'objectif est d'arrêter de construire des ponts personnalisés pour chaque connexion et d'avoir plutôt une méthode standard pour que tous ces composants d'IA puissent communiquer entre eux.
Résumé
En bref, ce papier dit : Arrêtez d'essayer de créer un seul cerveau géant qui fait tout parfaitement. Au lieu de cela, construisez un système intelligent qui connecte un cerveau (le LLM) à une banque de mémoire (Récupération), un planificateur (Agents), des yeux/oreilles (Multimodal) et un gestionnaire (Orchestration). Ce système «Composé» est l'avenir de l'IA car il surpasse les limites de n'importe quel modèle unique.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.