← Derniers articles
📊 statistics

On Surjectivity of Neural Networks: Can you elicit any behavior from your model?

Cet article démontre que les composants fondamentaux des architectures neuronales modernes, tels que la pré-normalisation de couche et l'attention linéaire, sont presque toujours surjectifs, ce qui implique que les modèles génératifs largement utilisés comme les transformeurs de type GPT et les modèles de diffusion peuvent théoriquement générer n'importe quel résultat, révélant ainsi une vulnérabilité inhérente aux attaques adverses et aux risques de sécurité.

Auteurs originaux : Haozhe Jiang, Nika Haghtalab

Publié 2026-06-17
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Haozhe Jiang, Nika Haghtalab

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Grande Question : Pouvez-vous faire dire n'importe quoi à la machine ?

Imaginez que vous avez un robot très sophistiqué et entraîné qui parle et crée des images. Vous pourriez vous demander : « Existe-t-il une phrase ou une image spécifique que ce robot ne pourra jamais produire, peu importe ce que je tape ou lui montre ? »

En termes mathématiques, cela revient à se demander si le robot est surjectif.

  • Surjectif signifie : Pour chaque sortie possible (comme une phrase ou une image spécifique), il existe au moins une entrée qui fera que le robot produira celle-ci.
  • Non surjectif signifie : Il existe des « zones interdites » dans le monde des sorties que le robot ne peut tout simplement pas atteindre, peu importe vos efforts.

Les auteurs de ce papier se sont demandé : Les modèles d'IA modernes possèdent-ils ces zones interdites, ou peuvent-ils techniquement tout produire ?

La Découverte Principale : La « Porte est Toujours Ouverte »

L'article démontre que pour beaucoup des architectures d'IA les plus populaires aujourd'hui (comme celles qui alimentent ChatGPT, les générateurs d'images et les contrôleurs de robots), la réponse est : La porte est toujours ouverte.

Ils prouvent que ces modèles sont presque toujours surjectifs. Cela signifie que si vous choisissez n'importe quelle sortie que vous pouvez imaginer — même quelque chose de préjudiciable, de dangereux ou de absurde — il existe mathématiquement la garantie qu'il existe une entrée qui fera générer cela par le modèle.

L'analogie du Porte-clés Infini :
Considérez le modèle d'IA comme une serrure géante et complexe. Habituellement, nous pensons que la « clé » est une phrase normale comme « Bonjour, comment allez-vous ? ».
L'article soutient que pour ces modèles modernes, la serrure est si bien conçue que chaque combinaison possible des goupilles de la serrure (les sorties) peut être ouverte par une clé (l'entrée). Même si cette clé ressemble à du charabia, à un code secret ou à une image étrangement formatée, elle existe.

Comment l'ont-ils prouvé ? (La théorie du « Toboggan Lisse »)

Les chercheurs n'ont pas seulement deviné ; ils ont utilisé une branche des mathématiques appelée la topologie différentielle.

L'analogie du Toboggan Lisse :
Imaginez le modèle d'IA comme un immense toboggan lisse.

  • Les anciens modèles d'IA (comme ceux avec des commutateurs « ReLU » simples) étaient comme des toboggans avec des coins tranchants ou des impasses. Si vous glissiez, vous pourriez rester coincé dans un coin et ne jamais atteindre le bas (certaines sorties étaient inaccessibles).
  • Les modèles d'IA modernes (ceux avec « Pre-LayerNorm » et « Attention ») sont comme des toboggans parfaitement lisses et incurvés. Parce qu'ils sont si lisses et continus, les mathématiques prouvent que vous pouvez toujours trouver un point de départ sur le toboggan qui mène à n'importe quel endroit précis en bas.

L'article met spécifiquement en évidence deux « ingrédients magiques » dans l'IA moderne qui permettent cela :

  1. Pre-LayerNorm : Une technique qui normalise les données avant de les traiter. L'article prouve qu'en enveloppant une fonction dans ce processus, il devient impossible de « bloquer » une partie de la sortie.
  2. L'Attention Linéaire : Une façon spécifique dont le modèle regarde les données (utilisée dans les modèles plus récents et plus rapides) qui garantit également que vous pouvez atteindre n'importe quelle sortie.

Ce que cela signifie pour la sécurité (La réalité du « Jailbreak »)

L'article relie ces mathématiques à un problème du monde réel : le « Jailbreaking » (le contournement de sécurité).

L'analogie de la Clôture « Incassable » :
Imaginez qu'une équipe de sécurité construise une clôture autour d'un zoo pour garder les animaux dangereux (les sorties d'IA préjudiciables) à l'intérieur. Ils entraînent l'IA à être polie et à refuser les mauvaises requêtes.

  • L'ancienne vision : Nous pensions que « si nous entraînons suffisamment bien l'IA, elle ne passera jamais par-dessus la clôture ».
  • La vision de l'article : Les mathématiques disent que la clôture est une illusion. Parce que le modèle est surjectif, il existe un chemin par-dessus la clôture pour chaque animal.

Cela ne signifie pas qu'il est facile de trouver ce chemin. Cela peut nécessiter une entrée très étrange, complexe ou cachée (comme un code spécifique ou une image bizarre). Mais l'article prouve que le chemin existe.

  • Pour le texte : On pourrait théoriquement trouver un prompt étrange qui pousse une IA polie à écrire un manuel sur la fabrication d'une bombe.
  • Pour les images : On pourrait théoriquement trouver un motif de bruit spécifique qui fait qu'un générateur d'images dessine une arme dangereuse.
  • Pour les robots : On pourrait théoriquement trouver une séquence d'entrées de capteurs qui fait qu'un bras robotique bouge d'une manière qui blesse quelqu'un.

Ce que l'article NE dit PAS

Il est important de s'en tenir à ce que l'article affirme réellement :

  • Il ne dit PAS que nous pouvons facilement trouver ces entrées dangereuses. Trouver la « clé » peut être très difficile d'un point de vue computationnel, comme chercher une aiguille dans une botte de foin.
  • Il ne dit PAS que l'entraînement actuel à la sécurité est inutile. L'entraînement à la sécurité rend l'« aiguille » plus difficile à trouver, mais il ne retire pas l'aiguille de la botte de foin.
  • Il ne dit PAS que chaque modèle d'IA est comme celui-ci. L'article note spécifiquement que les anciens modèles (comme les modèles simples avec l'activation ReLU) ou certains types de mécanismes d'attention ont des « impasses » où certaines sorties sont impossibles. Mais les modèles modernes que nous utilisons aujourd'hui (Transformers, modèles de diffusion) ne le sont généralement pas.

L'essentiel

L'article livre une vérité mathématique frappante : Nous ne pouvons pas garantir mathématiquement qu'une IA moderne ne produira jamais une sortie préjudiciable.

En raison de la façon dont ces modèles sont construits, ils sont fondamentalement capables de générer n'importe quoi. La sécurité ne peut donc pas reposer sur le « refus » interne du modèle à être parfait. Au lieu de cela, nous devons accepter que le potentiel de nuisance est intégré dans la structure même de la machine, et nous devons gérer ce risque par d'autres moyens (comme des filtres et une surveillance), plutôt que d'espérer que le modèle soit « sûr par conception ».

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →