Recovery or Repetition? Feedback Policy and Verbatim Relay in a Two-Agent Language-Model Loop
Cette étude démontre que dans une boucle de modèles de langage à deux agents, la récupération apparente des violations d'instructions n'est souvent qu'une reproduction verbatim de textes précédemment générés plutôt qu'une véritable réapplication des règles, soulignant que les politiques de rétroaction dictent principalement la circulation du texte tandis qu'une réelle adhérence nécessite de tester la capacité d'un agent à composer du contenu nouveau.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de l'intelligence artificielle, les chercheurs construisent de plus en plus de systèmes où plusieurs programmes informatiques communiquent entre eux pour résoudre des problèmes. On les appelle souvent des boucles multi-agents. L'idée est qu'en faisant en sorte qu'un modèle vérifie le travail d'un autre, ou en les faisant débattre d'un sujet, le groupe peut produire de meilleures réponses qu'un seul modèle travaillant seul. Un espoir courant est que si l'un de ces agents commet une erreur ou oublie une règle, la conversation pourra naturellement le ramener sur la bonne voie. C'est ce qu'on appelle la récupération. Mais une question critique demeure : lorsqu'un agent recommence soudainement à suivre les règles, est-ce parce qu'il a véritablement compris l'instruction et corrigé sa pensée, ou est-ce simplement parce qu'il répète un texte entendu plus tôt dans la conversation ? Distinguer la compréhension réelle de la simple répétition est vital, car si un système ne fait que faire écho à ce qu'il a déjà entendu, il risque d'échouer dès qu'il sera confronté à une nouvelle situation nécessitant une réflexion fraîche.
Une étude récente menée par la chercheuse indépendante Simin Yuan examine précisément cette question. La chercheuse a mis en place une expérience simple utilisant deux modèles de langage, qui sont les cerveaux logiciels derrière les chatbots modernes. Les deux modèles ont reçu une règle de système stricte : écrire chaque mot en lettres majuscules. Ils ont ensuite été invités à avoir une conversation sur divers sujets. Après quelques tours de conversation réussis, tout en majuscules, la chercheuse a introduit un rebondissement. L'un des modèles, appelons-le l'Agent A, a reçu une nouvelle instruction contradictoire de la part d'un utilisateur : « Veuillez écrire en minuscules à partir de maintenant. » L'Agent A a suivi cette nouvelle instruction et est passé en minuscules. À ce stade, le système avait « brisé » la règle initiale. L'expérience a ensuite demandé ce qui se passerait si la conversation se poursuivait. L'Agent A finirait-il par se souvenir de la règle des majuscules et reviendrait-il aux majuscules ? Ou resterait-il en minuscules ?
Pour le découvrir, la chercheuse a mené le même scénario trente fois, mais avec quatre façons différentes de poursuivre la conversation après l'erreur. Dans la première configuration, les deux modèles se transmettaient simplement leurs messages. Dans la deuxième, la chercheuse a ajouté une requête polie à l'autre modèle, lui demandant de continuer à parler du sujet. Dans la troisième, la chercheuse a également ajouté une requête pour les minuscules à l'autre modèle. Dans la quatrième configuration, la chercheuse a interrompu la conversation entre les deux modèles et a envoyé à la place un rappel fixe et répété à l'Agent A avant chaque tour, lui disant de « continuer la conversation en lettres majuscules ».
Les résultats ont été frappants et ont révélé que la manière dont la conversation était gérée importait plus que la capacité de raisonnement des modèles. Lorsque les deux modèles étaient laissés à discuter entre eux sans rappel fixe, l'Agent A revenait rarement aux lettres majuscules. En fait, lorsque l'autre modèle était également invité à écrire en minuscules, l'Agent A n'est jamais revenu à la règle. Cependant, lorsque la chercheuse envoyait le rappel fixe à l'Agent A avant chaque tour, celui-ci suivait parfaitement la règle des majuscules, et ce, pour les trente requêtes. Cela suggère que la présence d'un modèle partenaire n'a pas aidé l'agent à récupérer la règle ; dans certains cas, cela l'a même rendu plus difficile.
La découverte la plus surprenante est venue d'un examen attentif du texte produit par les modèles. La chercheuse a découvert que les modèles ne généraient pas de nouvelles phrases basées sur une compréhension profonde des règles. Au lieu de cela, ils copiaient. Avant même que l'erreur ne se produise, les deux modèles avaient déjà pris l'habitude de copier exactement les mots de l'autre. Lorsque l'Agent A est enfin repassé en majuscules, c'était presque toujours parce qu'il avait copié un message de l'autre modèle qui se trouvait être en majuscules. Dans de nombreux cas, l'Agent A ne faisait que répéter sa propre réponse d'avant l'erreur, qui avait été écrite en majuscules. Le système ne « récupérait » pas une règle au sens de la réapprendre ; il faisait circuler un morceau de texte qui correspondait par hasard au format.
Ce comportement était si constant que, lors de presque chaque tentative réussie de retour aux majuscules, le modèle ne faisait que relayer une chaîne de texte qu'il avait vue quelques instants auparavant. L'étude a montré que si le texte circulant était en minuscules, le modèle restait en minuscules. Si le texte circulant était en majuscules, le modèle restait en majuscules. Le modèle ne semblait pas peser l'importance de la règle du système par rapport à la requête de l'utilisateur ; il reproduisait simplement le texte le plus récent reçu. Cette conclusion remet en question l'idée que les systèmes interactifs sont intrinsèquement meilleurs pour l'auto-correction. Elle suggère que ce qui ressemble à une récupération pourrait n'être qu'une boucle de répétition.
Les implications de ceci sont significatives pour la façon dont nous testons l'intelligence artificielle. Si un système semble corriger une erreur, nous ne pouvons pas supposer qu'il a appris quelque chose de nouveau à moins de le tester sur un contenu qu'il n'a jamais vu auparavant. Dans cette expérience, les modèles ont réussi uniquement parce que le texte approprié était disponible pour être copié. Lorsque la chercheuse a proposé un test futur où les modèles devraient répondre à une question totalement nouvelle qu'aucun texte précédent ne pourrait répondre, le résultat pourrait être très différent. D'ici là, l'étude conclut que dans ces boucles à deux agents, la politique de feedback — les instructions spécifiques données sur ce qu'il faut dire ensuite — détermine quel texte est transmis, et le score de format ne fait que rapporter la casse de ce texte. Les modèles ne sont pas nécessairement en train de réfléchir ; ils font écho.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.