← Derniers articles
💬 NLP

Beyond Uniform Forgetting: A Study of Sequential Direct Preference Optimization Across Preference Settings

Cet article démontre que l'optimisation directe des préférences séquentielle ne dégrade pas uniformément les préférences précédemment apprises, mais produit au contraire des résultats variés allant de la stabilité au transfert positif selon la relation entre les objectifs, la force du signal et l'ordre d'entraînement, tout en révélant que l'opposition des gradients n'est pas le principal moteur de ces effets.

Auteurs originaux : Pranav Bhandari, Nicolas Fay, Amitava Datta, Usman Naseem, Mehwish Nasim

Publié 2026-06-19
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Pranav Bhandari, Nicolas Fay, Amitava Datta, Usman Naseem, Mehwish Nasim

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseignez à un assistant très intelligent mais inexpérimenté (un modèle de langage IA) comment se comporter. Vous ne lui enseignez pas seulement une chose ; vous avez une liste d'objectifs : être utile, être inoffensif, être honnête et suivre les instructions.

D'ordinaire, vous pourriez penser que vous lui enseignez l'une après l'autre. D'abord, vous lui apprenez à être utile. Ensuite, vous lui apprenez à être inoffensif. La grande question posée par cet article est la suivante : lorsque vous enseignez la deuxième leçon, l'assistant oublie-t-il la première ?

La crainte commune est celle de l'« oubli catastrophique » — comme un étudiant qui étudie pour un examen d'histoire, puis étudie pour un examen de mathématiques, et qui oublie alors complètement tout ce qu'il savait en histoire.

Cet article étudie si cela se produit avec l'IA, et si oui, pourquoi. Voici la décomposition de leurs découvertes en utilisant des analogies simples.

L'expérience : Les « quatre pièces »

Les chercheurs n'ont pas seulement testé un scénario. Ils ont mis en place quatre différentes « pièces » (scénarios) pour voir comment l'IA réagissait lors du passage d'une tâche à l'autre :

  1. La pièce du conflit (Conflit de distribution) : Enseigner « Utile » contre « Inoffensif ». Ce sont comme deux langues différentes ; les requêtes et les objectifs sont très différents.
  2. La pièce du compromis (Multi-attributs) : Enseigner la « Verbosité » (être bavard) contre la « Cohérence » (être logique). Ce sont des traits affinés qui peuvent entrer en conflit.
  3. La pièce bruyante (Signal de sécurité fort) : Enseigner « Inoffensif » où le signal de sécurité est extrêmement fort et clair, par rapport à « Utile ».
  4. La pièce de l'harmonie (Objectifs compatibles) : Enseigner « Suivre les instructions » contre « Honnêteté ». Ces objectifs se chevauchent naturellement et s'entraident.

La grande découverte : Ce n'est pas une gomme uniforme

La découverte la plus importante est que l'IA n'oublie pas tout de manière uniforme.

Si vous considérez la connaissance de l'IA comme un jardin, les théories précédentes suggéraient que planter une nouvelle fleur (un nouvel objectif) effacerait les anciennes fleurs. Cet article a découvert que ce n'est pas vrai. Au lieu de cela, le jardin change de manières complexes :

  • Désherbage partiel : Parfois, les anciennes compétences s'affaiblissent un peu, mais ne disparaissent pas.
  • Stabilité : Parfois, les anciennes compétences restent exactement les mêmes.
  • Transfert positif : Parfois, apprendre la nouvelle compétence rend l'ancienne compétence meilleure.
  • Redistribution : C'est la partie délicate. L'IA ne devient pas simplement « moins bonne » globalement. Elle peut devenir moins bonne pour les tâches faciles, mais meilleure pour les tâches difficiles, ou vice versa.

L'analogie de l'étudiant « confiant » vs « incertain » :
Les chercheurs ont examiné les questions individuelles auxquelles l'IA répondait. Ils ont constaté que lorsqu'une IA apprenait une nouvelle compétence, elle ne traitait pas ses anciennes connaissances de la même manière.

  • Dans certains cas, l'IA est devenue moins confiante quant aux réponses dont elle était auparavant sûre (les questions « faciles »).
  • Dans d'autres cas, l'IA est devenue plus confiante concernant ces mêmes questions faciles.
  • Cela dépend entièrement de la relation entre les deux compétences enseignées.

Le mystère : Pourquoi cela se produit-il ?

Les chercheurs avaient une forte suspicion sur le pourquoi l'IA oublie certaines choses. Ils pensaient que c'était comme deux personnes tirant une corde dans des directions opposées.

  • La théorie : Lors de l'enseignement de la seconde compétence, les « mathématiques » (gradients) tirant l'IA dans la nouvelle direction luttaient directement contre les mathématiques qui la tiraient dans l'ancienne direction. Comme un tir à la corde où la corde casse.

Le test de réalité :
Ils ont mesuré ce « tir à la corde » et ont constaté qu'il n'y avait presque aucun combat.

  • Les forces tirant l'IA dans la nouvelle direction étaient en fait perpendiculaires (à un angle de 90 degrés) à l'ancienne direction.
  • La métaphore : Imaginez que vous marchez vers le Nord. Puis, on vous dit de marcher vers l'Est. Vous ne luttez pas contre vos pas vers le Nord ; vous tournez simplement un coin. L'IA n'est pas « repoussée » par la nouvelle leçon ; elle dérive simplement sur le côté.

La conclusion

L'article conclut que nous ne pouvons pas supposer que l'enseignement d'une nouvelle compétence ruinera une ancienne.

  • Cela dépend du mélange : Si les deux compétences sont compatibles (comme l'Honnêteté et les Instructions), elles se renforcent mutuellement. Si elles sont très différentes (comme la Sécurité vs l'Utilité), l'ancienne compétence peut s'affaiblir un peu, mais elle n'est généralement pas effacée.
  • Cela dépend du signal : Si la nouvelle leçon est très forte et claire (comme un signal de sécurité puissant), elle peut en fait renforcer les anciennes compétences plutôt que de les affaiblir.
  • Cela dépend de l'ordre : Enseigner A puis B est différent d'enseigner B puis A.

La leçon pour les bâtisseurs :
Si vous construisez une IA, ne supposez pas simplement que l'ajout d'une nouvelle fonctionnalité brisera les anciennes. Vous devez examiner comment les objectifs se rapportent les uns aux autres. Parfois, vous pouvez les empiler en toute sécurité ; d'autres fois, vous devez faire attention à l'ordre dans lequel vous les enseignez, car la « mémoire » de l'IA se déplace de manières subtiles et inégales plutôt que de simplement supprimer le passé.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →