Popular but Wrong: Understanding and Mitigating LLM Overconfidence through Knowledge Popularity
Cet article révèle que les grands modèles de langage font preuve de surconfiance dans leurs réponses incorrectes lorsque celles-ci sont très populaires ou co-occurrent fréquemment avec la requête, et démontre que l'incorporation de signaux de popularité des connaissances atténue efficacement cette surconfiance tout en améliorant considérablement la précision de l'estimation de la confiance.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le bourdonnement discret d'une ferme de serveurs, une nouvelle forme d'intelligence est apparue, capable d'écrire de la poésie, de résoudre des équations et de répondre à des questions avec une fluidité qui semble presque humaine. Ces grands modèles de langage sont entraînés sur des océans de textes, apprenant à prédire le mot suivant dans une phrase en reconnaissant des motifs dans la connaissance humaine. Mais il y a un piège : ces machines ne « savent » pas vraiment les faits comme nous le faisons. Elles n'ont pas de mémoire du monde, seulement un sens statistique de quels mots apparaissent habituellement ensemble. Lorsqu'elles sont incertaines, elles ne l'admettent souvent pas. Au lieu de cela, elles produisent fréquemment des réponses incorrectes avec une certitude absolue, un phénomène que les chercheurs appellent l'excès de confiance. C'est un problème critique pour quiconque compte sur ces outils pour la sécurité, la médecine ou la finance, car un mensonge assuré est bien plus dangereux qu'une vérité hésitante. La question fondamentale pour les scientifiques a été de savoir pourquoi ces modèles font si profondément confiance à leurs propres erreurs. S'agit-il d'un bug aléatoire, ou existe-t-il un motif caché dans leur apprentissage qui les rend certains de choses erronées ?
Une équipe de chercheurs s'est lancée dans l'investigation de ce mystère en examinant le concept de popularité. Ils se sont demandé si les modèles favorisaient simplement des réponses célèbres ou fréquemment vues dans leurs données d'entraînement, même lorsque ces réponses étaient fausses pour la question spécifique posée. Pour tester cela, ils se sont concentrés sur un type spécifique de tâche : des questions factuelles sur des entités du monde réel, comme demander qui a réalisé un film spécifique ou où un joueur de basket est né. Ils ont rassemblé des milliers de ces questions et ont comparé les bonnes réponses aux mauv'aises réponses générées par les modèles. Ils ont mesuré la « popularité » des personnes et des lieux impliqués en comptant combien de liens pointaient vers eux sur Internet et la fréquence à laquelle ils apparaissaient ensemble dans des documents écrits. Cette approche leur a permis de voir si les modèles gravitaient vers les noms les plus familiers plutôt que vers les bons.
Les chercheurs ont découvert que lorsque ces modèles font des erreurs, celles-ci sont loin d'être aléatoires. Au lieu de deviner des noms obscurs ou improbables, les modèles ont tendance à halluciner des réponses qui sont plus populaires que les faits corrects. Par exemple, si un modèle ne connaît pas le réalisateur d'un film moins connu, il est plus susceptible de nommer avec assurance un réalisateur célèbre qu'il a vu de nombreuses fois auparavant, plutôt qu'un inconnu quelconque. De plus, les modèles choisissent souvent des réponses qui apparaissent fréquemment dans les mêmes phrases que la question, même si cette connexion est incorrecte. Un modèle pourrait répondre à une question sur un réalisateur de cinéma en nommant le producteur, simplement parce que ces deux rôles sont souvent mentionnés ensemble dans les articles. L'étude a révélé que ces alternatives populaires mais erronées ne sont pas seulement communes ; elles sont aussi celles auxquelles le modèle accorde le plus de confiance. Même lorsque la réponse est incorrecte, le modèle attribue un niveau de confiance plus élevé à la réponse populaire et familière qu'à une réponse moins célèbre mais correcte.
Ce schéma se vérifie à travers différents types de questions et différentes tailles de modèles, suggérant une faille fondamentale dans la manière dont ces systèmes traitent la connaissance. Les chercheurs ont constaté que plus une information est répétée dans les données d'entraînement, plus le modèle est susceptible de la générer et plus il sera confiant, peu importe qu'il s'agisse de la bonne réponse pour la requête spécifique. Cela crée une boucle de rétroaction dangereuse où la réponse incorrecte la plus familière est traitée comme la vérité la plus probable. L'étude souligne que les lacunes substantielles de connaissances de domaine sont associées à une génération encore plus fortement biaisée par la popularité, ce qui signifie que lorsque les modèles en savent moins sur un sujet spécifique, ils sont plus susceptibles de s'appuyer sur des associations familières mais incorrectes. Les conclusions révèlent de fortes associations systématiques entre popularité et excès de confiance, bien que les chercheurs notent que celles-ci sont corrélationnelles plutôt que causales, signifiant qu'elles montrent un lien clair sans prouver que la popularité seule cause les prédictions excessivement confiantes.
Pour remédier à cela, les chercheurs ont développé une méthode pour aider les modèles à reconnaître quand leur confiance pourrait être mal placée. Ils ont créé un système qui examine la popularité de la réponse et la relation entre la question et la réponse avant d'accepter le score de confiance du modèle. En tenant compte de la popularité de la réponse et de la fréquence à laquelle elle apparaît avec la question, le système peut ajuster la confiance du modèle à la baisse lorsqu'il est trop sûr d'une réponse populaire mais probablement fausse. Lorsqu'ils ont testé cette approche sur six modèles différents, les résultats ont été frappants. La confiance moyenne que les modèles plaçaient sur leurs réponses incorrectes a chuté de manière spectaculaire, passant d'un haut de 0,765 à 0,254. Parallèlement, la précision globale de la confiance du modèle s'est considérablement améliorée, ce qui signifie que le modèle est devenu bien meilleur pour savoir quand il a raison et quand il a tort.
L'étude conclut que la popularité est un moteur clé de l'excès de confiance de l'intelligence artificielle. Les modèles ne font pas que deviner ; ils suivent un chemin de moindre résistance vers les noms et les associations les plus familiers. En comprenant ce biais, il est possible de construire de meilleurs garde-fous qui empêchent ces systèmes de paraître autoritaires lorsqu'ils sont en réalité erronés. Les chercheurs ont noté que bien que leur travail se soit concentré sur des questions factuelles concernant des entités spécifiques, le principe s'étend probablement à d'autres domaines où les modèles pourraient favoriser des motifs communs plutôt que des vérités spécifiques. Ils ont également reconnu que leurs mesures de popularité étaient basées sur des données publiques d'Internet, qui servent de substitut de ce que les modèles ont vu pendant leur entraînement, et que la relation qu'ils ont trouvée est une forte corrélation plutôt qu'une preuve de cause à effet. Néanmoins, la capacité d'utiliser ces signaux de popularité pour calmer l'excès de confiance de la machine offre une étape pratique pour rendre ces outils puissants plus fiables et dignes de confiance pour un usage quotidien.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.