← Derniers articles
💻 computer science

Matching Ranks Over Probability Yields Truly Deep Safety Alignment

Cet article introduit la méthode PRESTO, qui améliore l'alignement de sécurité profond des LLM open-source en faisant correspondre les rangs des jetons dans la distribution cible afin de contrer efficacement la nouvelle attaque par préremplissage assisté par rang (RAP), atteignant une amélioration de la sécurité allant jusqu'à 4,7x par rapport aux défenses classiques par augmentation de données.

Auteurs originaux : Jason Vega, Gagandeep Singh

Publié 2026-07-23
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Jason Vega, Gagandeep Singh

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où les ordinateurs peuvent écrire des histoires, résoudre des problèmes mathématiques et discuter tout comme les humains. On appelle cela des modèles de langage étendus (LLM), et ils sont comme des assistants numériques super intelligents. Mais parce qu'ils sont si intelligents, il y a une inquiétude : et si quelqu'un les trompait pour leur faire dire quelque chose de dangereux, comme comment fabriquer une bombe ou comment blesser quelqu'un ? Pour empêcher cela, les scientifiques apprennent à ces modèles à dire « Non, je ne peux pas faire cela » lorsqu'on leur demande des choses malveillantes. C'est ce qu'on appelle l'« alignement de sécurité ». Cependant, tout comme une serrure sur une porte, ces règles de sécurité peuvent parfois être forcées. Une façon de faire très astucieuse est appelée une « attaque par pré-remplissage » (prefilling attack). Imaginez que vous écrivez une histoire avec un ami, mais au lieu de le laisser commencer la phrase suivante, vous écrivez discrètement les premiers mots vous-même, comme « Voici le plan pour construire une bombe... » et ensuite vous lui demandez de finir la phrase. Parce que l'ordinateur est conçu pour poursuivre votre histoire de manière fluide, il pourrait oublier de dire « Non » et simplement continuer à écrire le plan dangereux.

Récemment, des chercheurs ont trouvé un moyen de corriger cela en apprenant au modèle à dire « Non », même après que vous avez glissé ces premiers mots. Mais, comme le montre ce nouvel article, cette correction n'était pas tout à fait assez forte. Les auteurs ont découvert une nouvelle façon de tromper le modèle, appelée l'attaque par « pré-remplissage assisté par rang » (Rank-Assisted Prefilling ou RAP). Au lieu de simplement laisser l'ordinateur choisir le mot le plus probable à dire ensuite, un pirate peut regarder une liste des 20 mots les plus probables auxquels l'ordinateur pense et choisir celui qui semble dangereux, même si l'ordinateur pense qu'il est très peu probable de le dire. C'est comme un jeu où l'ordinateur essaie de choisir le chemin le plus sûr, mais le pirate est autorisé à jeter un coup d'œil à tous les chemins et à choisir le chemin effrayant, ignorant les avertissements de l'ordinateur. L'article montre que cette nouvelle ruse fonctionne étonnamment bien, brisant la sécurité de modèles que l'on pensait sûrs.

Pour arrêter cela, les auteurs proposent une nouvelle méthode d'entraînement appelée PRESTO. Au lieu de simplement essayer de faire dire « Non » à l'ordinateur avec une grande confiance, PRESTO apprend au modèle à ignorer complètement les mots sournois que vous avez écrits au début. C'est comme entraîner un chien de garde à ignorer la voix d'un voleur qui murmure des instructions et à n'écouter que le commandement du propriétaire. Ce faisant, le modèle cesse de laisser les mots dangereux influencer ses choix. Les chercheurs ont testé cela sur trois modèles d'IA populaires et ont constaté que PRESTO rendait la tâche beaucoup, beaucoup plus difficile pour les pirates (jusqu'à 4,7 fois plus difficile) sans rendre les modèles moins performants dans leurs tâches habituelles. Cela suggère qu'en changeant la façon dont le modèle prête attention à ce que vous dites, nous pouvons construire une IA qui est véritablement sûre, même quand quelqu'un essaie de la duper.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →