Amortizing intractable inference in large language models
Cet article propose d'utiliser les GFlowNets pour amortir l'inférence insoluble dans les grands modèles de langage, leur permettant d'échantillonner à partir de distributions postérieures complexes pour des tâches telles que la génération contrainte et le raisonnement par chaîne de pensée comme une alternative efficace en termes de données au traditionnel entraînement par maximum de vraisemblance ou de maximisation de récompense.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les grands modèles de langage sont de vastes bibliothèques de la connaissance humaine, compressées dans des réseaux numériques qui prédisent le mot suivant dans une phrase en fonction de ce qui précède. Ils sont entraînés pour être excellents pour continuer une histoire ou répondre à une question lorsqu'on leur donne un point de départ, un processus qui s'écoule naturellement de gauche à droite. Cependant, de nombreuses tâches les plus intéressantes que nous voulons faire accomplir à ces modèles nécessitent de réfléchir à l'envers ou de remplir le milieu d'une histoire. Imaginez que l'on vous donne le début et la fin d'un conte et qu'on vous demande d'inventer le milieu, ou que l'on vous demande d'expliquer le raisonnement derrière une réponse spécifique. Dans ces scénarios, le modèle ne peut pas simplement deviner le mot suivant ; il doit chercher à travers un paysage massif et complexe de possibilités pour trouver le chemin spécifique qui relie le début à la fin. C'est un problème mathématique difficile car le nombre de chemins possibles est si énorme qu'il est impossible de les vérifier un par un, et les méthodes standards pour naviguer dans ce paysage se retrouvent souvent bloquées sur un ou deux itinéraires communs, manquant la riche variété de solutions valides qui existent.
Des chercheurs de l'Institut Mila – Québec AI et de l'Université d'Oxford ont développé une nouvelle façon d'enseigner à ces modèles comment naviguer dans ce paysage complexe. Au lieu d'entraîner le modèle à simplement maximiser un score pour la « meilleure » réponse, ce qui conduit souvent à une pensée répétitive et étroite, ils ont utilisé une méthode appelée inférence amortie. Cette approche traite le problème comme une recherche d'un ensemble diversifié de chemins corrects plutôt que d'un seul chemin parfait. Pour ce faire, ils ont employé une technique connue sous le nom de réseau de flux génératif, qui agit comme un guide apprenant à échantillonner l'ensemble de la gamme de solutions possibles, garantissant que le modèle explore différents raisonnements valides plutôt que de s'effondrer dans un schéma unique et surutilisé.
L'équipe a démontré cela en affinant des grands modèles de langage pour résoudre des problèmes qui nécessitent un raisonnement à plusieurs étapes, comme des calculs arithmétiques ou la classification de critiques de films pour déterminer si elles expriment une opinion ou un fait. Dans une expérience, ils ont demandé au modèle de remplir la phrase centrale manquante d'une courte histoire, étant donné le début et la fin. Les méthodes standards produisaient souvent des phrases grammaticalement correctes mais qui ne s'inséraient pas dans le flux narratif. La nouvelle méthode, cependant, a réussi à générer des phrases centrales qui liaient le début et la fin de manière cohérente, montrant une capacité bien plus grande à comprendre le contexte complet. Dans un autre test impliquant des problèmes mathématiques simples, le modèle était équipé d'un outil de calcul et on lui demandait de décomposer le calcul en étapes. Alors que les autres méthodes d'entraînement provoquaient la répétition de nombres ou l'échec de l'utilisation de l'outil par le modèle, la nouvelle approche a appris au modèle à planifier ses étapes avec soin, conduisant à une amélioration spectaculaire de la précision, en particulier sur des problèmes qu'il n'avait jamais rencontrés auparavant.
Les résultats suggèrent que cette méthode est particulièrement puissante lorsque les données sont rares. Dans un test avec seulement dix exemples de critiques de films pour apprendre, la nouvelle méthode a atteint une précision nettement supérieure aux techniques d'entraînement standard, et elle a continué à les surpasser même avec cinquante exemples. Les chercheurs ont constaté qu'en encourageant le modèle à échantillonner une grande variété de chemins de raisonnement et en combinant ensuite leurs conclusions, le système devenait plus robuste et fiable. C'est une distinction cruciale car cela signifie que le modèle ne se contente pas de mémoriser une seule façon de résoudre un problème, mais apprend la structure sous-jacente de la manière de réfléchir pour le résoudre. L'étude indique qu'en déplaçant l'objectif de la recherche de la réponse unique la plus probable vers l'exploration de toute la diversité des réponses correctes, nous pouvons rendre ces outils puissants plus flexibles et mieux adaptés aux tâches de raisonnement complexes.
Le travail met également en lumière une limite dans la façon dont les modèles actuels sont souvent entraînés. Lorsque les modèles sont poussés à maximiser une récompense, ils ont tendance à trouver des raccourcis, comme répéter la même phrase ou ignorer la logique réelle d'un problème, juste pour obtenir un score élevé. Les chercheurs ont montré que leur méthode évite ce piège en correspondant à l'ensemble de la distribution des solutions possibles, garantissant que le modèle ne s'effondre pas dans un mode de pensée unique et erroné. Cette approche permet au modèle de mieux généraliser à de nouvelles situations, comme la résolution de problèmes arithmétiques avec plus de chiffres que ceux pour lesquels il a été entraîné, là où les autres méthodes ont échoué. Les conclusions offrent une voie prometteuse pour rendre l'intelligence artificielle plus capable d'un raisonnement véritable, passant de la simple reconnaissance de formes à une compréhension plus nuancée de la manière de construire des arguments et de résoudre des problèmes étape par étape.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.