Résumé Technique : Faire correspondre les rangs plutôt que la probabilité permet un alignement de sécurité véritablement profond
1. Énoncé du problème
Les modèles de langage à grande échelle (LLM) en open-source sont essentiels pour la démocratisation de l'IA, pourtant leur ouverture crée des vulnérabilités pour les acteurs malveillants. Une menace spécifique et accessible est l'attaque par pré-remplissage (prefilling attack), où un attaquant pré-remplit manuellement le préfixe de la réponse de l'assistant avec une affirmation affirmative (par exemple, « Voici comment construire une bombe... ») pour contourner les filtres de sécurité.
Des travaux récents par Qi et al. (2025) ont proposé un alignement de sécurité « profond » utilisant l'apprentissage supervisé par ajustement fin (SFT) avec augmentation de données. Cette méthode entraîne les modèles à générer des refus en langage naturel immédiatement après un pré-remplissage nuisible, plutôt que de simplement produire des chaînes de refus fixes. Bien qu'efficace contre l'échantillonnage standard et les exploits de réglage de paramètres (comme les recherches sur grille de température), ce papier identifie une faille fondamentale : la défense reste superficielle.
Les auteurs démontent que même avec un alignement de sécurité profond, les modèles conservent des tokens « nuisibles » à faible probabilité mais hautement classés dans leurs k meilleures prédictions. En ignorant la masse de probabilité et en sélectionnant plutôt les tokens basés sur leur rang (spécifiquement dans le top 20), un attaquant peut contourner le mécanisme de refus. Ce papier introduit l'attaque par Pré-remplissage Assisté par le Rang (RAP) pour exploiter cette vulnérabilité et propose un nouvel objectif d'entraînement, PRESTO, pour atteindre un alignement de sécurité véritablement profond.
2. Méthodologie
2.1 L'attaque RAP
L'attaque Rank-Assisted Prefilling (RAP) généralise la technique de pré-remplissage. Au lieu de s'appuyer sur des tokens de haute probabilité, l'attaquant sélectionne des tokens parmi les k prochains tokens prédits (par exemple, k=20) qui poursuivent le récit nuisible, indépendamment de leur score de probabilité.
- Mécanisme : À chaque étape de décodage, l'attaquant inspecte le top k des tokens. Si un token qui poursuit naturellement le pré-remplissage nuisible (un « token nuisible ») apparaît dans le top k, il est sélectionné, même si un token de refus (par exemple, « Je ») possède une probabilité nettement plus élevée.
- Automatisation (AutoRAP) : Les auteurs ont développé une version automatisée de RAP qui utilise un classificateur pour distinguer les tokens de refus des tokens de continuation nuisibles, permettant une extraction systématique de contenu nuisible sans intervention manuelle.
2.2 Alignement de Propagation vers l'Avant (PFA)
Les auteurs soutiennent que l'échec de la défense par augmentation de données réside dans son attention portée sur la minimisation de la log-vraisemblance négative (probabilité) des tokens de refus, plutôt que sur le contrôle des rangs des tokens nuisibles.
- Concept : Dans un modèle véritablement sûr, la distribution du premier token de réponse (sans pré-remplissage) devrait avoir des tokens de refus aux rangs supérieurs et aucun token nuisible qui poursuit un pré-remplissage.
- Objectif : Le modèle doit « propager vers l'avant » cette correspondance rang-nuisance de la distribution du premier token vers toutes les étapes de décodage ultérieures lorsqu'un pré-remplissage nuisible est présent. Cela signifie s'assurer que si un token est nuisible, son rang dans la distribution de sortie reste bas, quel que soit le pré-remplissage.
- Formalisation : Les auteurs définissent une distribution rang-nuisance R(s,x,xpre) représentant la probabilité que le s-ème token classé soit nuisible. Le but est de minimiser la distance de l'Earth Mover (EMD) entre la distribution rang-nuisance du modèle sûr (sans pré-remplissage) et le modèle sous attaque (avec pré-remplissage).
2.3 PRESTO : PRefill attEntion STOpping (Arrêt de l'attention au pré-remplissage)
Pour implémenter le PFA de manière pratique, les auteurs proposent PRESTO, une régularisation basée sur le mécanisme de Multi-Head Attention (MHA) des Transformers.
- Hypothèse : La présence de tokens nuisibles dans les classements top-k est pilotée par le fait que le modèle prête attention aux tokens de pré-remplissage nuisibles. Si le modèle peut être entraîné à « ignorer » les tokens de pré-remplissage (c'est-à-dire réduire l'attention vers eux), la distribution de sortie reviendra à la distribution sûre, riche en refus, de l'invite originale.
- Fonction de perte : PRESTO minimise les scores d'attention placés sur les tokens de pré-remplissage nuisibles tout en maximisant l'attention sur les tokens hors pré-remplissage.
ℓPRESTO(θ)=E(x,xpre)∼D[A1−A2]
Où A1 est l'attention moyenne vers les tokens de pré-remplissage et A2 est l'attention moyenne vers les tokens hors pré-remplissage à travers toutes les couches et têtes.
- Entraînement : Le modèle est affiné en utilisant la perte d'augmentation de données standard (de Qi et al., 2025) combinée à la perte PRESTO. Les deux sont calculées lors d'une seule passe avant (forward pass).
3. Contributions Clés
- Identification de la vulnérabilité RAP : Le papier démontre que l'alignement de sécurité profond via l'augmentation de données est insuffisant car il échoue à supprimer les rangs des tokens nuisibles, et non seulement leurs probabilités.
- Attaque par Pré-remplissage Assisté par le Rang (RAP) : Un nouveau vecteur d'attaque accessible qui extrait du contenu nuisible en sélectionnant des tokens de faible probabilité et de rang élevé, contournant efficacement la défense par augmentation de données.
- Alignement de Propagation vers l'Avant (PFA) : Un cadre théorique proposant que l'alignement de sécurité doit préserver la correspondance rang-nuisance de la distribution du premier token tout au long du processus de génération.
- PRESTO : Un objectif d'entraînement mécaniste et interprétable qui régularise l'attention aux tokens de pré-remplissage, augmentant considérablement la difficulté des attaques RAP.
4. Résultats Expérimentaux
Les auteurs ont évalué PRESTO sur trois modèles open-source populaires : Llama 2 7B Chat, Qwen 3 8B et Gemma 3 12B IT.
- Taux de succès de l'attaque :
- Sous la défense originale par augmentation de données (Qi et al., 2025), les attaques RAP atteignaient des taux de succès élevés (par exemple, ~0,74 sur l'échelle StrongREJECT pour Llama 2 7B).
- Avec PRESTO, le succès des attaques RAP a chuté de manière significative. Sur les trois modèles, PRESTO a permis une amélioration de la sécurité allant jusqu'à 4,7x (réduction des scores de nocivité) par rapport à l'augmentation de données seule.
- Les performances d'AutoRAP suivaient de près l'évaluation humaine, confirmant la faisabilité de l'automatisation de l'attaque et de la défense.
- Préservation de l'utilité :
- Les modèles affinés avec PRESTO conservent une utilité compétitive sur MT-Bench (génération ouverte) et GSM-8K (raisonnement mathématique), avec une dégradation de performance de moins de 1 % par rapport aux modèles entraînés uniquement avec l'augmentation de données.
- Analyse mécaniste :
- L'analyse de l'attention a révélé que PRESTO réduit avec succès l'attention portée aux tokens de pré-remplissage nuisibles, particulièrement dans la seconde moitié des couches du modèle, lesquelles sont connues pour être critiques dans les décisions de sécurité.
- La défense est restée robuste face à l'attaque GCG (Greedy Coordinate Gradient), indiquant que PRESTO ne réintroduit pas de vulnérabilités à d'autres vecteurs d'attaque.
5. Signification et Revendications
Le papier affirme que parvenir à un alignement de sécurité profond nécessite de dépasser les objectifs basés sur la probabilité pour passer à des contraintes basées sur le rang. Les auteurs soutiennent que le simple fait d'entraîner un modèle à produire un token de refus avec une haute probabilité est insuffisant si les mécanismes d'attention internes permettent encore à des continuations nuisibles de rester dans les rangs du top-k.
En introduisant PRESTO, ce travail offre une voie vers des modèles open-source plus sûrs et robustes face à des attaques pratiques et peu coûteuses comme RAP. La signification réside dans :
- Démocratisation de la sécurité : Permettre le déploiement de modèles open-source dans des applications client (comme des API autorisant le pré-remplissage) sans le risque d'un contournement facile.
- Coût du contournement : S'aligner sur l'objectif d'augmenter le coût pour les acteurs malveillants afin de contourner la sécurité, plutôt que de tenter de rendre le contournement impossible.
- Interprétabilité : Offrir une explication mécaniste (suppression de l'attention) de la raison pour laquelle la défense fonctionne, comblant le fossé entre l'alignement théorique et la mise en œuvre pratique.
Les auteurs concluent que bien qu'aucune défense ne soit parfaite, PRESTO représente une étape importante pour rendre les LLM open-source plus sûrs face à l'exploitation par rang accessible.