Subspace Inference Enables Efficient Active Reward Learning from Preferences
Cet article introduit PreferenceEKF, une méthode d'apprentissage actif efficace en termes d'échantillonnage qui exploite le filtrage de Kalman étendu au sein d'un sous-espace de paramètres de faible dimension pour permettre une quantification de l'incertitude scalable pour les modèles de récompense de réseaux de neurones, améliorant ainsi l'efficacité et la performance de l'apprentissage par renforcement à partir de rétroaction humaine.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de l'intelligence artificielle, il existe un défi persistant connu sous le nom d'« inefficacité d'échantillonnage » de l'apprentissage à partir des commentaires humains. Imaginez l'enseignement d'un programme informatique complexe pour qu'il se comporte d'une manière alignée avec les valeurs humaines. La méthode la plus puissante actuellement disponible consiste à demander aux gens de comparer deux résultats différents — comme deux mouvements de robot ou deux réponses écrites — et d'indiquer celui qu'ils préfèrent. Bien que ce retour d'information soit facile à donner pour les humains, il est incroyablement rare ; une seule préférence ne fournit qu'un infime fragment d'information. Pour construire un modèle fiable de ce que les humains veulent, un algorithme doit poser des milliers de ces questions. Si l'ordinateur pose les mauv'aises questions, il gaspille du temps et de l'argent. S'il pose les bonnes, il apprend beaucoup plus vite. La difficulté réside dans la connaissance des questions qui seront les plus informatives. Pour ce faire, l'ordinateur doit comprendre ce qu'il ne sait pas encore, un concept appelé incertitude. Cependant, calculer cette incertitude pour les réseaux de neurones massifs et modernes est notoirement difficile et coûteux en termes de calcul, nécessant souvent l'entraînement de dizaines de modèles distincts pour obtenir une estimation approximative.
Une équipe de chercheurs de l'Université de Californie du Sud a développé une nouvelle approche pour résoudre ce goulot d'étranglement, permettant aux ordinateurs d'apprendre des préférences humaines avec une vitesse et une efficacité bien plus grandes. Ils ont introduit une méthode appelée PreferenceEKF, qui traite le processus d'apprentissage des préférences comme un problème de filtrage continu et par étapes plutôt que comme un calcul massif et ponctuel. Au lieu d'essayer de cartographier toutes les variations possibles d'un réseau de neurones géant à la fois, les chercheurs ont réalisé que le comportement du réseau pouvait être suivi avec précision au sein d'un espace beaucoup plus petit et de dimension inférieure. En concentrant leurs calculs sur ce sous-espace compact, ils ont pu utiliser un outil mathématique classique, le filtre de Kalman étendu, pour mettre à jour la compréhension du modèle en temps réel à mesure que les nouvelles réponses arrivaient. Cette technique leur a permis de générer instantanément des milliers de versions différentes du modèle de récompense, sans le coût de calcul élevé de l'entraînement de plusieurs réseaux indépendants.
Les chercheurs ont testé leur méthode contre plusieurs techniques existantes en utilisant une variété de tests de référence standards pour le contrôle robotique et la prise de décision. Ils ont constaté que leur approche était non seulement nettement plus rapide — fonctionnant jusqu'à quarante fois plus vite que certaines des alternatives les plus avancées — mais aussi plus précise dans ses prédictions. Dans les expériences où l'objectif était d'apprendre un modèle de récompense à partir d'un nombre limité de comparaisons humaines, la nouvelle méthode a systématiquement appris les préférences correctes en posant moins de questions que les autres méthodes. De plus, les modèles produits étaient mieux calibrés, ce qui signifie que la confiance de l'ordinateur dans ses réponses correspondait plus étroitement à l'exactitude réelle de ces réponses. Cette précision est vitale pour l'apprentissage actif, où le système doit décider quelle question poser ensuite ; si le système est incertain, il pose une question pour résoudre cette incertitude, et s'il est confiant, il passe à la suite. La nouvelle méthode a excellé dans cet équilibre, menant à des modèles de récompense capables d'entraîner des politiques robotiques pour accomplir des tâches complexes, égalant la performance de politiques entraînées avec des méthodes beaucoup plus coûteuses et chronophages.
L'un des aspects les plus frappants de ce travail est la façon dont il modifie le flux de travail de l'entraînement de ces systèmes. Les méthodes traditionnelles exigent souvent que l'ordinateur réentraîne ou réévalue toute sa compréhension du monde chaque fois qu'il reçoit un nouvel élément de feedback, un processus qui devient plus lent à mesure que le système grandit. La nouvelle méthode, en revanche, met à jour ses connaissances de manière séquentielle, en incorporant uniquement la dernière information reçue tout en maintenant une estimation continue de ce qu'elle a appris jusqu'à présent. Cela permet au système de passer à l'échelle efficacement, en gérant des réseaux de neurones plus larges et en générant plus d'échantillons de modèles de récompense possibles sans manquer de mémoire ou de temps. Les chercheurs ont également démontré que cette approche fonctionne même en partant de zéro, en utilisant une technique de projection aléatoire pour construire le sous-espace nécessaire à partir de rien, et elle s'est montrée prometteuse lorsqu'elle a été appliquée à des tâches basées sur l'image où les données d'entrée sont beaucoup plus complexes que de simples nombres.
Bien que la méthode soit très prometteuse, les chercheurs veillent à noter ses limites. Le cadre mathématique qu'ils ont utilisé suppose que les préférences apprises proviennent d'une source unique et cohérente. Lorsqu'ils ont testé le système avec des données provenant de plusieurs annotateurs humains qui pourraient avoir des opinions divergentes, la méthode a eu du mal à capturer toute la complexité de ces opinions différentes. Cela suggère que, bien que l'approche soit un outil puissant pour rationaliser le processus d'apprentissage, elle est mieux adaptée aux scénarios où un ensemble unique et cohérent de préférences est modélisé. Néanmoins, les résultats indiquent une étape significative vers la création d'une intelligence artificielle plus adaptable à l'intention humaine. En rendant le processus d'apprentissage à partir du feedback plus rapide et plus efficace, ce travail lève un obstacle majeur au déploiement de systèmes intelligents dans des contextes réels, de la recommandation personnalisée aux robots autonomes, là où le coût du temps humain est élevé et où le besoin d'un apprentissage rapide et précis est critique.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.