← Derniers articles
💬 NLP

Stochasticity in Tokenisation Improves Robustness

Cette étude démontre que l'entraînement des modèles de langage avec une tokenisation stochastique améliore leur robustesse face aux perturbations adverses et aléatoires sans compromettre la précision ni augmenter les coûts d'inférence.

Auteurs originaux : Sophie Steger, Rui Li, Sofiane Ennadir, Anya Sims, Arno Solin, Franz Pernkopf, Martin Trapp

Publié 2026-04-20
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Sophie Steger, Rui Li, Sofiane Ennadir, Anya Sims, Arno Solin, Franz Pernkopf, Martin Trapp

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🛡️ L'Art de la "Désorganisation" : Comment rendre les IA plus solides

Imaginez que vous apprenez à un enfant à lire. Habituellement, vous lui montrez les mots écrits de manière standard, parfaitement espacés et orthographiés : "revolution". L'enfant apprend que ce mot correspond à une seule image mentale.

Mais que se passe-t-il si, soudainement, quelqu'un écrit ce mot de façon bizarre ?

  • "re-vol-u-tion"
  • "r-e-v-o-l-u-t-i-o-n"
  • "rev-ol-uti-on"

Pour un enfant (ou une intelligence artificielle) qui n'a vu que la version standard, ces variations peuvent sembler être des mots différents ou du charabia. L'enfant panique et ne comprend plus rien. C'est exactement le problème que les chercheurs ont découvert avec les Grands Modèles de Langage (LLM) comme ceux qui alimentent les chatbots actuels.

1. Le Problème : Des IA trop "rigides"

Les IA sont entraînées avec une méthode très stricte appelée tokenisation. C'est comme si on découpait une phrase en petits morceaux (des "tokens") pour les donner à l'IA.

  • La méthode classique (Canonique) : L'IA voit toujours le mot "revolution" découpé exactement de la même façon, une seule fois. C'est comme si elle apprenait à reconnaître un visage uniquement sous un angle précis, avec une lumière fixe.
  • Le danger : Si un pirate informatique (un "attaquant") change légèrement la façon dont le mot est découpé (en ajoutant des tirets ou en changeant la taille des morceaux), l'IA, qui n'a jamais vu ça, peut se tromper complètement. C'est comme si un voleur portait un masque très simple, mais suffisant pour tromper un gardien qui n'a jamais vu de masques.

2. La Solution : L'Entraînement au "Chaos Contrôlé"

L'idée géniale de ce papier est simple : pour rendre l'IA plus forte, il faut l'entraîner dans le chaos.

Au lieu de montrer à l'IA le mot "revolution" toujours découpé de la même façon, les chercheurs lui montrent des milliers de façons différentes de le découper pendant l'entraînement :

  • Parfois : "re-vol-ution"
  • Parfois : "r-e-v-o-l-u-t-i-o-n"
  • Parfois : "rev-ol-uti-on"

C'est comme si vous entraîniez un soldat non pas seulement à marcher sur un terrain plat, mais aussi sur des sentiers boueux, des escaliers, et dans la pluie. Résultat ? Quand il arrive sur le terrain plat (la réalité normale), il est indestructible.

3. Les Découvertes Clés (avec des analogies)

  • L'entraînement aléatoire (Stochasticité) :
    Les chercheurs ont découvert que si l'on entraîne l'IA avec ces découpages aléatoires, elle devient beaucoup plus robuste. Elle ne panique plus quand on lui présente une version "bizarre" d'un mot. Elle comprend que le sens du mot reste le même, peu importe comment on le découpe.

  • Le problème de la "mauvaise" randomisation :
    Au début, ils pensaient que n'importe quel chaos suffisait. Mais ils ont réalisé que leur première méthode (appelée STOCHASTOK) était un peu comme un jeu de dés truqué : elle produisait certains découpages très souvent et d'autres jamais.

    • L'analogie : Imaginez un professeur qui pose des questions aléatoires, mais qui pose toujours les mêmes 5 questions sur 100. L'élève apprendra à répondre à ces 5 questions, mais échouera face aux 95 autres.
    • La correction : Ils ont créé de nouvelles méthodes (STOCHASTOK-UNI et UNIFORM-K) qui garantissent que toutes les façons possibles de découper un mot sont vues, de manière équitable. C'est comme un professeur qui pose vraiment n'importe quelle question possible.
  • Le résultat spectaculaire :

    • Sans cet entraînement spécial, si on change légèrement la façon d'écrire un mot pour tromper l'IA, son score de réussite chute de 94% à 6% (c'est catastrophique !).
    • Avec l'entraînement au "chaos contrôlé", son score reste élevé (autour de 70%) même face aux attaques les plus malveillantes.

4. Pourquoi c'est important pour nous ?

Pensez à la sécurité d'une maison.

  • L'IA classique est comme une maison avec une porte blindée, mais dont la serrure est très simple. Un cambrioleur qui connaît la serrure peut l'ouvrir facilement.
  • L'IA entraînée avec cette méthode est comme une maison où les murs, le toit et les fenêtres ont été renforcés de manière aléatoire et imprévisible. Le cambrioleur ne sait plus par où passer, car la maison a appris à résister à toutes les formes d'effraction possibles.

En résumé :
Ce papier nous dit que pour rendre les intelligences artificielles plus sûres et moins faciles à tromper, il ne faut pas les entraîner dans un monde parfait et ordonné. Il faut les habituer à l'imprévu, au désordre et aux variations. En acceptant le "chaos" pendant l'apprentissage, l'IA devient inébranlable face aux tentatives de manipulation.

C'est une leçon de vie aussi bien pour les machines que pour nous : ceux qui s'entraînent dans la difficulté sont ceux qui survivent le mieux à la réalité.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →