Privileged observations enable rapid and reliable policy discovery directly in the physical world
Cet article démontre que les observations privilégiées d'un système physique chaotique sont décisives pour permettre aux agents d'apprentissage par renforcement de découvrir rapidement des politiques de haute performance directement dans le monde réel, car les agents dépourvus de telles données de flux n'ont pas réussi à apprendre des stratégies augmentant la traînée, bien qu'ils aient réussi à apprendre des stratégies la réduisant.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un nageur essayant de se déplacer dans l'eau. S'il pouvait voir les courants tourbillonner autour de lui, il pourrait apprendre à tordre son corps d'une manière qui tranche la résistance, ou peut-être d'une manière qui capte l'eau pour se propulser vers l'avant. C'est l'essence même du contrôle de flux actif : un domaine où les ingénieurs tentent de manipuler le mouvement invisible et chaotique des fluides pour améliorer la façon dont les objets se déplacent ou restent immobiles. Depuis des décennies, les scientifiques savent que faire tourner un cylindre dans un courant peut modifier la force avec laquelle l'eau pousse contre lui. Parfois, une rotation constante réduit la traînée, permettant à l'objet de glisser plus facilement. D'autres fois, une rotation rythmique spécifique peut au contraire augmenter la traînée, freinant l'objet. Le défi a toujours été de déterminer le moment et la vitesse exacte de cette rotation pour obtenir le meilleur résultat, d'autant plus que l'écoulement de l'eau est chaotique et difficile à prédire.
Habituellement, lorsque les ingénieurs veulent apprendre à un ordinateur comment contrôler un tel système, ils construisent un modèle virtuel de l'eau et laissent l'ordinateur s'entraîner là. Mais les modèles virtuels ne sont jamais parfaits ; ils passent à côté des détails minuscules et désordonnés de l'eau réelle. Ainsi, une équipe de chercheurs de l'ETH Zürich a décidé de faire l'impasse sur la simulation. Ils ont construit un canal d'eau physique et ont appris à un agent informatique à apprendre directement de l'eau réelle et agitée. La question qu'ils ont posée était simple mais profonde : pour apprendre la meilleure façon de contrôler l'eau, l'ordinateur a-t-il besoin de voir l'eau tourbillonner autour de l'objet pendant qu'il apprend ? Ou peut-il le découvrir simplement en ressentant la poussée et la traction sur l'objet lui-même ?
Les chercheurs ont installé un canal d'eau de table, un réservoir transparent où l'eau circule en boucle. À l'intérieur, un cylindre repose dans le flux, et un moteur peut le faire tourner à n'importe quelle vitesse ou direction. Pour mesurer la force avec laquelle l'eau pousse contre le cylindre, ils ont utilisé un capteur de couple sensible. Pour voir l'eau, ils ont utilisé une technique appelée vélocimétrie par image de particules. Cela consiste à projeter une feuille laser à travers l'eau, qui contient de minuscules particules flottantes, et à prendre des photos rapides. En suivant le mouvement de ces particules entre les photos, un ordinateur peut construire une carte détaillée et en temps réel de la vitesse et de la direction de l'eau juste derrière le cylindre. Cette carte est l'« observation privilégiée » — une information supplémentaire que l'ordinateur peut voir pendant l'entraînement, mais dont il pourrait ne pas avoir besoin plus tard.
Ils ont entraîné un agent d'apprentissage polyvalent, un type d'intelligence artificielle, pour contrôler le cylindre. Dans un premier ensemble d'expériences, l'agent recevait à la fois la sensation de la traînée et la carte détaillée de l'écoulement de l'eau. Dans un autre ensemble, l'agent ne recevait que la sensation de la traînée, la carte de l'eau lui étant cachée. L'objectif était double : premièrement, trouver une façon de faire tourner le cylindre pour réduire la traînée autant que possible, et deuxièmement, trouver une façon de le faire tourner pour augmenter la traînée autant que possible.
Les résultats ont été frappants et ont révélé une asymétrie surprenante. Lorsque l'agent avait accès à la carte détaillée de l'écoulement de l'eau, il apprenait incroyablement vite. En quelques minutes d'interaction avec l'eau réelle, il a découvert une stratégie pour réduire la traînée d'environ 32 %. Il a également rapidement trouvé une stratégie pour augmenter la traînée d'environ 25 %. Ces chiffres égalaient ou dépassaient même légèrement les performances des meilleures stratégies conçues par des humains, qui avaient été développées au fil de décennies d'études.
Cependant, lorsque les chercheurs ont caché la carte de l'eau et ont forcé l'agent à apprendre en utilisant uniquement la mesure de la traînée, l'histoire a totalement changé. L'agent était toujours capable d'apprendre à réduire la traînée, parvenant finalement à une réduction d'environ 31 %. Cela lui prenait simplement un peu plus de temps et était un peu plus variable. Mais lorsque l'objectif était d'augmenter la traînée, l'agent a échoué. Sans voir l'écoulement de l'eau, aucune des sessions d'entraînement n'a réussi à apprendre une stratégie qui augmentait significativement la traînée. L'agent n'a pas pu comprendre comment faire pousser l'eau plus fort, même si la meilleure stratégie possible existait et était physiquement réalisable.
Pour comprendre pourquoi cela s'était produit, les chercheurs ont examiné de près ce que faisait l'eau. Ils ont découvert que chaque fois que le cylindre commençait à tourner, l'eau réagissait presque toujours en poussant moins contre le cylindre au départ, quel que soit l'objectif de pousser plus ou moins. Cette baisse initiale de la traînée est une réponse physique naturelle. Pour l'agent essayant de réduire la traînée, cette baisse initiale était un signe utile montrant qu'il était sur la bonne voie. Mais pour l'agent essayant d'augmenter la traînée, cette baisse initiale était déroutante ; elle semblait être l'opposé de ce qu'il voulait accomplir. Sans la carte détaillée de l'eau pour voir la vue d'ensemble et comprendre que la traînée finirait par augmenter, l'agent est resté bloqué dans ce creux initial et n'a jamais appris la bonne stratégie.
Les chercheurs ont ensuite testé si les stratégies apprises par l'agent avec la carte de l'eau pouvaient être utilisées sans elle. Ils ont enregistré les schémas de rotation exacts utilisés par l'agent lorsqu'il avait la carte, puis ont rejoué ces séquences exactes comme des séquences fixes, sans nouvelle observation. Étonnamment, ces séquences fixes fonctionnaient tout aussi bien que l'agent vivant et pensant. L'agent avait appris un ensemble spécifique de mouvements qui fonctionnaient si bien qu'il n'avait pas besoin de continuer à observer l'eau pour les exécuter. Cela prouve que la carte de l'eau n'était pas nécessaire pour exécuter la tâche, mais qu'elle était absolument essentielle pour la découvrir.
Cette découverte met en lumière une distinction cruciale dans l'apprentissage : ce dont vous avez besoin pour trouver une solution est souvent différent de ce dont vous avez besoin pour l'utiliser. Dans ce cas, la vue riche et détaillée de l'écoulement de l'eau a agi comme un enseignant, guidant l'agent à travers les réactions initiales confuses du fluide. Une fois que l'agent a trouvé le bon chemin, il pouvait le parcourir les yeux bandés. L'étude suggère que dans les systèmes physiques complexes, avoir accès à des informations supplémentaires pendant la phase d'apprentissage peut être le facteur décisif entre le succès et l'échec, même si ces informations ne sont pas disponibles lorsque le système est réellement en fonctionnement. Elle montre que pour que l'intelligence artificielle maîtrise le monde réel, chaotique et désordonné, elle doit peut-être être autorisée à voir plus qu'elle ne sera jamais autorisée à utiliser.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.