Collective Intelligence with Foundation Models
Cet article propose un cadre multi-agents exploitant des modèles de fondation où un ensemble hétérogène d'agents spécialisés, plutôt que des agents homogènes redondants, améliore significativement la précision du raisonnement, la détection d'erreurs et la fiabilité des solutions grâce à une collaboration de rédaction, de critique et de synthèse par consensus.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez de résoudre les énigmes les plus difficiles du monde, du calcul intégral à la chimie. Vous pourriez demander à un seul robot super intelligent de le faire seul, ou vous pourriez rassembler toute une équipe de robots pour le découvrir ensemble. Ce document traite de l'expérimentation de l'approche qui fonctionne réellement le mieux.
Les chercheurs ont mis en place une expérience de « équipe de robots » pour voir si le fait de faire communiquer plusieurs modèles d'IA entre eux les rend plus intelligents. Ils n'ont pas simplement réuni des robots au hasard, cependant. Ils ont construit une chaîne de montage spécifique avec quatre rôles distincts :
- Les Résolveurs : Trois robots différents qui tentent chacun de résoudre le problème par eux-mêmes, en proposant leurs propres brouillons.
- Le Critique : Un quatrième robot dont l'unique tâche est de lire ces brouillons, de trouver les erreurs et de suggérer des corrections.
- L'Agrégateur : Un cinquième robot qui prend tous les brouillons corrigés, les fusionne et rédige la réponse finale convenue.
- Le Comptable : Un système qui vérifie non seulement si la réponse finale est correcte, mais aussi si chaque étape du processus de réflexion était exacte.
Ils ont testé cette équipe sur une immense bibliothèque de problèmes couvrant huit domaines différents comme la physique, la biologie, l'économie et les mathématiques, allant de facile à très difficile.
Voici la grande surprise qu'ils ont découverte : ce n'est pas une question de taille d'équipe ; c'est une question de diversité d'équipe.
Lorsque les chercheurs ont testé l'équipe avec le même type de robot (en utilisant exactement le même modèle pour le résolveur, le critique et l'agrégateur), les résultats ont été un peu étranges. L'équipe trouvait la réponse finale plus souvent qu'un robot seul, mais la manière dont ils y parvenaient était en fait moins bonne. C'était comme un groupe de jumeaux identiques se disputant entre eux ; ils pouvaient accidentellement annuler leurs erreurs et arriver sur la bonne réponse, mais leur raisonnement était truffé de lacunes. En fait, lorsqu'ils utilisaient le même modèle pour tout le monde, la qualité du raisonnement étape par étape avait en fait chuté pour atteindre un score d'environ 0,27 ou 0,28, ce qui était inférieur à un robot travaillant seul (qui marquait 0,50).
Cependant, lorsqu'ils ont remplacé les robots par différents types de robots — en utilisant trois modèles distincts pour les résolveurs et deux autres modèles spécialisés pour le critique et l'agrégateur — la magie a opéré. Cette équipe « hétérogène » n'a pas seulement trouvé les bonnes réponses ; elle a aussi réussi son raisonnement. La précision de leur raisonnement étape par étape a bondi à 0,64. C'est une amélioration de 2,3 fois par rapport à l'équipe de robots identiques !
Le document suggère que cela se produit parce que différents modèles d'IA ont différents « angles morts ». Si vous utilisez le même modèle pour tout, ils commettent tous les mêmes erreurs. Mais quand vous les mélangez, la faiblesse d'un robot devient la force d'un autre. Le critique spécialisé peut repérer des erreurs que les résolveurs ne verraient jamais parce qu'ils ont été entraînés différemment.
Les chercheurs ont également testé d'autres idées pour voir ce qui comptait le plus :
- Le simple fait d'avoir une structure d'équipe : Même si tout le monde est le même robot, le simple fait d'avoir un critique et un agrégateur aide un peu, faisant passer le score de 0,52 (un robot seul) à 0,60.
- Avoir plus d'exemplaires du même robot : Si vous utilisez simplement trois copies du même robot exact comme résolveurs au lieu d'un seul, cela n'aide presque pas, faisant grimper le score seulement à 0,61.
- Le véritable gagnant : Le bond spectaculaire à 0,63 (et le saut massif de la qualité du raisonnement) n'est survenu que lorsqu'ils ont utilisé des modèles différents pour les différentes tâches.
Les chercheurs ont mesuré ces résultats à travers des milliers de problèmes et ont constaté que cette approche d'« équipe mixte » fonctionnait de manière constante, que les problèmes soient faciles, moyens ou difficiles. En fait, l'équipe s'est étonnamment bien débrouillée sur les problèmes les plus difficiles, suggérant que les défis complexes donnent plus de matière à travailler à l'équipe diversifiée.
Ainsi, la principale conclusion est que pour que l'IA soit véritablement fiable et explicable, vous ne pouvez pas simplement cloner le robot le plus intelligent que vous avez et l'installer à chaque poste. Vous avez besoin d'un comité d'experts de types différents qui peuvent contester leur pensée. Comme le notent les auteurs, cette approche aide à créer une IA qui ne donne pas seulement la bonne réponse par chance, mais qui peut vous montrer exactement comment elle l'a trouvée, étape par étape.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.