← Derniers articles
🤖 machine learning

Synthetic Persona Pretraining: Alignment from Token Zero

Cet article introduit le Pré-entraînement de Personas Synthétiques (SPP), une méthode qui intègre des réflexions à la première personne alignées sur des valeurs directement dans la phase de pré-entraînement afin d'installer un persona d'assistant désiré dès le premier jeton, démontrant qu'une telle intervention précoce améliore de manière significative l'adhésion à la constitution, la robustesse face au jailbreak et l'alignement moral par rapport aux approches d'alignement post-entraînement.

Auteurs originaux : Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Ro
Publié 2026-08-14
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous élevez un enfant. Vous pourriez attendre qu'il soit adolescent, l'asseoir et lui dire : « Bon, maintenant que tu sais parler, voici les règles : sois gentil, dis la vérité et ne fais pas de mal aux autres. » Ou bien, vous pourriez commencer à enseigner ces valeurs dès le tout premier mot qu'il apprend à prononcer, en les tissant dans chaque histoire que vous lui racontez au fil de sa croissance. C'est le dilemme fondamental auquel sont confrontés les scientifiques qui construisent l'intelligence artificielle.

Les modèles d'IA sont comme des enfants numériques qui apprennent en lisant des milliards de pages de texte provenant d'Internet. Cette phase d'apprentissage initiale est appelée « pré-entraînement ». Pendant cette période, l'IA absorbe des faits, des styles d'écriture et la manière dont les humains se parlent. Cependant, les « règles » consistant à être un assistant utile et sûr sont généralement ajoutées après cette phase massive d'apprentissage, lors d'une étape distincte appelée « post-entraînement ». Le problème est qu'au moment où l'IA a fini de lire Internet, elle a déjà formé une personnalité basée sur ce qu'elle y a trouvé. Essayer d'imposer de nouvelles règles à une personnalité déjà formée revient à essayer d'apprendre la politesse à un adolescent qui a déjà appris à être impoli ; cela ressemble souvent à une fine couche de peinture sur un mur décrépit, et les vieilles habitudes peuvent facilement faire craquer la surface.

Ce document, intitulé « Synthetic Persona Pretraining: Alignment from Token Zero », suggère une autre façon d'élever nos enfants IA. Les chercheurs proposent d'installer la personnalité et les valeurs souhaitées dès le tout premier instant de l'entraînement — ce qu'ils appellent le « token zéro ». Au lieu d'attendre pour corriger l'IA plus tard, ils veulent construire le « bon assistant » dans son cerveau pendant qu'elle apprend encore à parler.

L'expérience : Élever un enfant numérique avec une constitution

Les chercheurs, une équipe de l'EPFL et de diverses universités, ont décidé de tester cette idée de « l'élevage de modèle ». Ils ont créé une nouvelle méthode appelée Synthetic Persona Pretraining (SPT). Voici comment ils ont procédé, en utilisant une analogie simple :

Imaginez que l'IA apprend à lire une bibliothèque de livres. Dans l'ancienne méthode, l'IA lit simplement les livres. Dans la nouvelle méthode, les chercheurs ont pris environ 10 % de ces livres et ont ajouté une « bulle de pensée » spéciale après chaque paragraphe. À l'intérieur de cette bulle de pensée, le futur persona de l'IA (appelons-le « Cato ») ferait une pause et réfléchirait à ce qu'il vient de lire, en disant des choses comme : « Hmm, cette histoire de crime est triste, et mes règles disent que je ne devrais jamais encourager la violence », ou « Ce manuel technique est ennuyeux mais utile ».

Ils n'ont pas seulement ajouté ces pensées ; ils ont fait en sorte que l'IA apprenne à les générer. Ils ont entraîné le modèle à la fois sur le texte original et sur ces nouvelles pensées de « réflexion ». Ils ont fait cela de deux manières :

  1. Token Zero (L'approche « dès la naissance ») : Ils ont parsemé ces pensées de réflexion tout au long du processus d'entraînement, de la toute première seconde jusqu'à la dernière.
  2. Midtraining (L'approche « adolescent ») : Ils ont attendu que l'IA ait déjà lu la majeure partie des livres pour n'ajouter les réflexions qu'à la toute fin de la phase d'entraînement.

Ils ont également utilisé un groupe témoin qui se contentait de lire les livres normalement (Vanilla) et un autre où les mauvais livres avaient été supprimés mais sans réflexions (Filtered).

Ce qu'ils ont découvert : Le pouvoir de commencer tôt

Les résultats ont été fascinants et suggèrent que le quand vous enseignez à l'IA importe autant que le quoi.

1. L'IA « dès la naissance » était plus intelligente concernant les valeurs.
Les modèles entraînés avec des réflexions dès le début (Token Zero) étaient bien meilleurs pour suivre leur « Constitution » (un ensemble de règles qu'ils étaient censés suivre). Lorsque les chercheurs les ont testés sur des dilemmes moraux complexes — des situations que l'IA n'avait jamais vues auparavant — les modèles Token Zero ont fait des choix qui semblaient plus alignés avec les règles. Ils ne se contentaient pas de mémoriser les règles ; ils semblaient comprendre l'esprit de celles-ci.

  • Les chiffres : Sur un test appelé « ConstitutionEval », les modèles Token Zero ont obtenu environ 67 % de bonnes réponses, tandis que les modèles qui n'ont reçu les réflexions qu'à la fin (Midtraining) n'ont obtenu qu'environ 56 %.
  • La surprise : Les modèles Token Zero ont réellement changé leurs priorités. Ils ont commencé à accorder beaucoup plus de valeur à la « Vérité » et à la « Justice » que les autres modèles, qui préféraient la « Créativité » et l'« Apprentissage ». Cela suggère que commencer tôt n'a pas seulement ajouté des règles ; cela a remodelé la façon dont l'IA perçoit le monde.

2. L'approche « adolescent » était acceptable pour certaines choses, mais pas pour toutes.
Il est intéressant de noter que si l'objectif était simplement d'empêcher l'IA d'être « jailbreakée » (piégée pour faire des choses malveillantes), l'approche Midtraining fonctionnait presque aussi bien que l'approche Token Zero. Il semble que pour les réflexes simples de type « ne fais pas ça », on peut les enseigner tardivement. Mais pour un raisonnement moral profond et complexe, il faut vraiment commencer dès le premier jour.

3. Plus gros cerveau, plus grands gains.
Les chercheurs ont testé cela sur deux tailles d'IA : une petite (1,7 milliard de paramètres) et une plus grande (3 milliards de paramètres). Ils ont constaté que l'avantage de commencer tôt devenait encore plus important à mesure que l'IA devenait plus grande et plus intelligente. Sur les tests les plus difficiles, l'écart entre l'IA « dès la naissance » et l'IA « adolescent » a doublé à mesure qu'ils augmentaient l'échelle. Cela suggère que pour les IA massives et super-intelligentes du futur, commencer avec les bonnes valeurs sera encore plus critique.

4. La « colle » est importante.
Il y avait un bémol. Les chercheurs ont découvert que ces valeurs précoces ne restaient ancrées que si l'étape finale de l'entraînement (où l'IA apprend à discuter avec les humains) correspondait à la personnalité construite précédemment. Ils ont appelé cela le « liaison de persona » (persona binding). Si on entraînait l'IA pour être un certain type d'assistant durant la phase de lecture, mais qu'on lui apprenait à être un type d'assistant totalement différent durant la phase de discussion, les valeurs précoces commençaient à s'effacer. C'est comme enseigner à un enfant à devenir médecin, puis l'envoyer en école d'art ; il pourrait oublier les règles médicales. Cependant, lorsque la « colle » tenait, les valeurs étaient étonnamment fortes, survivant même lorsque les chercheurs tentaient de les briser avec des tests piégeux.

Pourquoi cela importe

Ce document suggère que nous commettons peut-être une erreur en essayant de « réparer » l'IA après qu'elle a déjà tout appris d'Internet. Les auteurs soutiennent que les valeurs sont difficiles à ajouter à un produit fini. Au lieu de cela, nous devrions « élever » l'IA avec les bonnes valeurs dès le tout premier token qu'elle traite.

Bien que les résultats soient prometteurs, les chercheurs précisent qu'il ne s'agit que d'un début. Ils ont testé cela sur des modèles relativement petits (3 milliards de paramètres) comparés aux modèles massifs utilisés par les grandes entreprises technologiques actuelles. Ils suggèrent qu'en construisant des modèles plus grands et plus intelligents, le bénéfice de commencer avec les bonnes valeurs tôt deviendra probablement encore plus puissant. Ils ont également noté que, bien que les valeurs précoces soient fortes, elles pouvaient encore être affaiblies par certains types d'entraînements ultérieurs, ce qui signifie que nous devons toujours rester vigilants quant à la manière dont nous terminons l'éducation de nos enfants numériques.

En résumé, si nous voulons une IA qui soit véritablement sûre et utile, nous ne devrions pas attendre qu'elle soit adulte pour lui apprendre le bien et le mal. Nous devrions lui enseigner pendant qu'elle apprend encore à parler.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →