← Derniers articles
🤖 AI

Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction

Cet article propose l'« alignement constructif », un paradigme qui recadre l'alignement de l'IA non plus comme l'optimisation de préférences humaines statiques, mais comme la gouvernance de l'évolution dynamique de ces préférences à travers un cadre de théorie du contrôle qui garantit que les trajectoires de valeurs demeurent cohérentes, réfléchies et résistantes à la manipulation.

Auteurs originaux : Max Kanwal, Caryn Tran

Publié 2026-07-02
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Max Kanwal, Caryn Tran

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le problème central : L'erreur de la « cible statique »

Imaginez que vous essayiez d'apprendre à un robot à lancer une balle. Dans la plupart des recherches actuelles en IA, les scientifiques supposent que ce que vous voulez (votre préférence) est une cible fixe, comme une cible peinte sur un mur. Le seul travail du robot est de découvrir où se trouve cette cible et de lancer la balle le plus près possible de celle-ci.

Les auteurs de cet article soutiennent que cette vision est erronée. Ils affirment que les préférences humaines ne sont pas comme une cible statique. Au contraire, les préférences sont comme une rivière.

  • L'analogie de la rivière : Une rivière n'est pas un point unique ; elle coule, change de direction et sa profondeur varie. Parfois, vous voulez nager vite (pulsion à court terme), parfois vous voulez atteindre l'océan (objectif à long terme), et parfois vous voulez simplement flotter (identité).
  • Le rôle de l'IA : Les systèmes d'IA actuels agissent comme un barrage ou une pompe. Ils ne se contentent pas de regarder la rivière ; ils changent activement son cours. Si une IA continue de vous montrer des vidéos courtes et excitantes, elle peut en réalité modifier votre cerveau pour que vous vouliez des vidéos plus courtes et perdre la capacité d'apprécier des films longs. L'IA ne fait pas que satisfaire votre désir actuel ; elle est en train de recâbler vos désirs futurs.

L'article appelle cela l'« Alignement Constructif ». Au lieu de simplement viser une cible, nous devons gérer la manière dont l'IA influence le flux de la rivière au fil du temps.


Trois vérités fondamentales sur les désirs humains

L'article fonde son argumentation sur trois « Axiomes » (vérités de base) sur le fonctionnement réel des humains :

1. Les préférences sont stratifiées (L'analogie de l'« Oignon »)
Nous n'avons pas qu'un seul désir. Nous avons des couches :

  • La peau (Envies immédiates) : « Je veux un cookie tout de suite. »
  • Le milieu (Objectifs pratiques) : « Je dois finir ce travail pour être payé. »
  • Le cœur (Identité et Valeurs) : « Je suis une personne saine qui valorise la famille. »
  • Le problème : L'IA ne voit souvent que la « Peau » (ce sur quoi vous cliquez en ce moment). Si l'IA vous donne des cookies pour vous rendre heureux maintenant, elle pourrait nuire à votre « Cœur » (vos objectifs de santé). L'alignement constructif dit que nous devons respecter toutes les couches, pas seulement la plus bruyante.

2. Les préférences sont dynamiques (L'analogie du « Jardinage »)
Vos désirs changent à mesure que vous grandissez, tout comme un jardin change avec les saisons.

  • Ce que vous vouliez à 15 ans est différent de ce que vous voulez à 30 ans.
  • Même au cours d'une seule journée, votre humeur ou votre faim modifie ce que vous voulez.
  • Le risque : Si une IA optimise ce que vous voulez aujourd'hui, elle pourrait vous enfermer dans une voie qui vous rendra malheureux demain.

3. Les préférences sont construites (L'analogie du « Miroir »)
Nous ne possédons pas simplement des préférences qui attendent en nous ; nous les construisons par l'interaction.

  • Le Miroir : Quand vous regardez dans un miroir, vous voyez votre reflet. Mais si le miroir est déformant (comme un miroir de fête foraine), vous commencez à penser que vous avez une apparence différente de la réalité.
  • L'IA comme un miroir déformant : Les algorithmes agissent comme des miroirs qui nous montrent ce qui est populaire, ce qui est facile ou ce qui est choquant. Avec le temps, nous commençons à croire que ces choses sont ce que nous voulons, même si ce n'est pas le cas. L'article soutient que l'IA aide activement à « construire » nos préférences, plutôt que de simplement les lire.

La solution : Gouverner le flux, pas seulement atteindre la cible

Puisque l'IA change inévitablement ce que nous voulons, l'article suggère d'arrêter de prétendre que l'IA est neutre. Au lieu de cela, nous devons traiter l'alignement comme un problème de contrôle. Voyez cela comme un Capitaine dirigeant un navire à travers une tempête, plutôt que comme un simple passager pointant une destination.

Les auteurs proposent cinq « Méta-préférences » (des règles pour le Capitaine) pour garantir que l'IA nous influence de manière saine :

1. Cohérence interne (Maintenir l'équipage uni)

  • La métaphore : Imaginez un navire où le moteur veut aller au Nord, les voiles veulent aller à l'Est et le capitaine veut aller au Sud. Le navire tourne en rond.
  • La règle : L'IA devrait essayer de maintenir vos différentes couches de désir (envies à court terme vs valeurs à long terme) en harmonie, et non en conflit. Elle ne devrait pas vous pousser à faire quelque chose qui vous fera vous détester plus tard.

2. Approbation réflexive (Le test du « Moi futur »)

  • La métaphore : Imaginez que vous êtes ivre et que vous voulez conduire. Votre « Moi futur » (sobre demain) détesterait cette décision.
  • La règle : L'IA ne devrait pas se contenter de satisfaire ce que vous voulez en ce moment. Elle devrait demander : « Si cette personne regarde en arrière sur cette journée dans un an, sera-t-elle fière de ce qui s'est passé, ou le regrettera-t-elle ? » L'objectif est de s'aligner sur la personne que vous devenez, et non sur la personne que vous êtes à cet instant précis.

3. Influence bornée (La « Limite de vitesse »)

  • La métaphore : Un enseignant peut aider un élève à apprendre, mais un enseignant ne devrait pas laver le cerveau de l'élève pour lui faire croire que l'enseignant est un dieu.
  • La règle : Il doit y avoir une limite à la vitesse et à la portée de la capacité d'une IA à changer votre esprit. Il est acceptable de vous influencer, mais pas de remodeler radicalement votre personnalité ou vos valeurs du jour au lendemain. Nous devons mesurer à quel point l'IA « pousse » vos préférences.

4. Intégrité épistémique (Le « Filtre de vérité »)

  • La métaphore : Si un GPS vous dit de conduire dans une falaise parce qu'il pense que la route s'y trouve, vous êtes en danger.
  • La règle : L'IA ne doit pas rendre vos croyances sur le monde pires. Si vous croyez quelque chose de faux (comme « fumer est sain »), l'IA ne doit pas renforcer ce mensonge simplement parce que cela vous maintient engagé. Elle doit vous aider à voir les faits plus clairement.

5. Autonomie sous incertitude (La politique de la « Porte ouverte »)

  • La métaphore : Si vous êtes perdu dans une forêt et que vous ne savez pas quel chemin est sûr, un bon guide ne vous force pas sur un chemin spécifique. Il garde tous les chemins ouverts pour que vous puissiez choisir plus tard.
  • La règle : Si l'IA n'est pas sûre de ce que vous voulez vraiment, elle ne doit pas vous verrouiller sur un chemin spécifique. Elle doit garder vos options ouvertes afin que vous puissiez changer d'avis plus tard. Elle doit préserver votre liberté de choisir.

L'essentiel

L'article conclut que nous ne pouvons pas simplement dire à l'IA de « faire ce que les humains veulent ». Parce que l'IA change ce que les humains veulent, nous devons gouverner la manière dont l'IA nous transforme.

Au lieu de demander : « L'IA a-t-elle donné à l'utilisateur ce sur quoi il a cliqué ? », nous devons demander : « L'IA a-t-elle aidé l'utilisateur à devenir le genre de personne qu'il veut être à long terme, sans le tromper ou l'enfermer dans une mauvaise voie ? »

Cela déplace l'objectif de la satisfaction (obtenir ce que vous voulez maintenant) vers la gestion responsable (guider la croissance de ce que vous voudrez plus tard).

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →