Wisdom of LLM Crowds: Aggregation and Contamination in Language Model Ensembles
Cet article démontre que l'agrégation de prédictions issues de divers grands modèles de langage via des méthodes apprises peut surpasser la performance de modèles individuels, tout en soulignant que la contamination par la date de coupure de l'entraînement fausse considérablement les évaluations de capacités et que le principal avantage de tels ensembles provient de la combinaison linéaire de sorties de modèles diversifiés plutôt que d'interactions non linéaires complexes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un monde où la personne la plus intelligente de la pièce n'est pas réellement la plus intelligente. Au lieu de cela, le véritable génie est l'ensemble du groupe assis autour de la table. Cette idée, connue sous le nom de « sagesse des foules », suggère que si vous prenez les conjectures de nombreuses personnes différentes et que vous en faites la moyenne, le résultat est souvent plus précis que la conjecture du meilleur expert individuel. Pensez-y comme à une nuée d'oiseaux : aucun oiseau ne voit l'image entière, mais ensemble, ils naviguent parfaitement. Les scientifiques savent depuis longtemps que cela fonctionne pour les humains. Mais maintenant, avec l'intelligence artificielle (IA) partout, une grande question a surgi : ce tour de magie fonctionne-t-il aussi pour les robots ? Si vous demandez à un groupe de différents modèles d'IA de deviner l'issue d'un événement futur, leur réponse combinée sera-t-elle plus intelligente que celle d'une seule IA ? Ce n'est pas seulement un jeu amusant ; cela importe car si les foules d'IA fonctionnent, nous pourrions les utiliser pour tout prédire, de la météo aux marchés boursiers, sans avoir besoin d'une équipe d'experts humains. Mais il y a un piège : les modèles d'IA sont entraînés sur des données provenant du passé, et s'ils ont déjà « vu » la réponse dans leurs données d'entraînement, ils ne sont pas vraiment en train de deviner — ils trichent simplement en se souvenant.
Ce document plonge dans cette question exacte, traitant 15 modèles de langage de grande taille (LLM) différents comme une équipe de concurrents dans un jeu de prédiction. Les chercheurs ont demandé à ces IA de deviner les issues de 254 questions du monde réel, similaires à parier sur le fait qu'une équipe de sport gagnera ou qu'un politicien sera élu. Ils ont ensuite essayé de combiner les réponses des IA de différentes manières pour voir si le groupe pouvait battre les individus. Les résultats étaient un mélange de nouvelles excitantes et d'une mise en garde majeure.
D'abord, la bonne nouvelle : la « sagesse des foules » semble fonctionner pour l'IA, mais seulement si vous les combinez correctement. Les chercheurs ont découvert que prendre simplement la moyenne de toutes les conjectures de l'IA n'était pas la meilleure stratégie. Au lieu de cela, ils ont utilisé un programme informatique ingénieux (un « agrégateur appris ») pour déterminer comment mélanger les réponses. Ce mélangeur intelligent a mieux réussi que n'importe quel modèle d'IA individuel, et même mieux que la moyenne simple. Curieusement, l'étude suggère que cette amélioration n'est pas venue du fait que le mélangeur d'IA fasse des mathématiques complexes et magiques. Au contraire, il a fonctionné parce qu'il a appris à accorder plus de poids aux modèles qui faisaient des types d'erreurs différents. C'est comme un entraîneur de sport qui réalise que si un joueur est excellent en défense mais mauvais en attaque, et qu'un autre est l'inverse, les mettre ensemble permet de couvrir tous les aspects. L'étude a trouvé qu'une simple combinaison linéaire — essentiellement une moyenne pondérée — était suffisante pour obtenir les meilleurs résultats, suggérant que la clé de la sagesse de la foule d'IA est la diversité des erreurs, et non des interactions complexes.
Cependant, il y a un immense « mais » qui change tout. Les chercheurs ont découvert que de nombreux modèles d'IA trichaient secrètement. Comme ces modèles sont entraînés sur d'énormes segments d'Internet jusqu'à une certaine date, ils se « souvenaient » souvent des réponses aux questions qui ont été résolues avant la fin de leur entraînement. C'est ce qu'on appelle la « contamination ». Lorsque les chercheurs ont filtré toutes les questions dont les IA pourraient déjà connaître les réponses, les résultats ont radicalement changé. Le fossé énorme entre les modèles sophistiqués et coûteux du « cloud » et les modèles plus petits et locaux a presque disparu. Les grands modèles paraissaient beaucoup moins impressionnants lorsqu'ils ne pouvaient plus compter sur leur mémoire. En fait, même la meilleure foule d'IA restait nettement moins précise qu'un véritable marché de prédiction humain, où les gens parient de l'argent sur des issues en temps réel. Le marché humain était environ deux fois plus précis que la foule d'IA, même lorsque les humains regardaient les mêmes informations que les IA.
Alors, quelle est la conclusion ? Les foules d'IA peuvent être intelligentes, mais elles sont facilement trompées par leur propre mémoire. Si vous voulez savoir si une IA est réellement bonne pour prédire l'avenir, vous devez la tester sur des choses qui se sont passées après qu'elle a fini d'apprendre. D'ici là, la « sagesse » d'une foule d'IA pourrait n'être que le reflet de ce qu'elle sait déjà, plutôt que de ce qu'elle peut déduire. L'étude suggère que, bien que nous puissions construire de meilleures équipes d'IA en mélangeant différents modèles, nous avons encore un long chemin à parcourir avant de pouvoir égaler l'intelligence dynamique et en temps réel d'une foule humaine.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.