← Derniers articles
🤖 machine learning

Safety Game: Inference-Time Alignment of Black-Box LLMs via Constrained Optimization

Cet article propose un cadre de boîte noire, indépendant du modèle, pour l'alignement de la sécurité au moment de l'inférence des grands modèles de langage qui formule le compromis entre sécurité et utilité comme un jeu à somme nulle à deux joueurs, permettant aux parties prenantes d'imposer des contraintes de sécurité via la programmation linéaire sans nécessiter d'accès au modèle ni de réentraînement.

Auteurs originaux : Tuan Nguyen, Long Tran-Thanh

Publié 2026-06-02
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Tuan Nguyen, Long Tran-Thanh

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez un assistant robotique très intelligent, mais quelque peu imprévisible. Vous voulez l'utiliser pour vous aider dans vos tâches, mais vous craignez qu'il ne vous donne accidentellement des conseils dangereux (comme comment fabriquer une bombe) ou qu'il refuse de vous aider alors que vous avez simplement besoin d'une recette simple.

Habituellement, pour corriger un robot de ce type, vous devez le démonter, le réentraîner avec de nouvelles règles et espérer qu'il apprenne. Mais et si votre robot était une « boîte noire » ? Vous ne pouvez pas voir à l'intérieur, vous ne pouvez pas le démonter et vous ne pouvez pas le réentraîner. C'est le problème de nombreux modèles d'IA puissants disponibles aujourd'hui : les entreprises ne peuvent pas modifier leur code interne, elles peuvent seulement leur poser des questions et obtenir des réponses.

Cette publication propose un « filtre de sécurité » ingénieux qui se situe à l'extérieur du robot, agissant comme un gardien intelligent. Il n'a pas besoin de savoir comment le robot réfléchit ; il lui suffit d'examiner les réponses que le robot pourrait donner et de choisir la meilleure.

Voici comment cela fonctionne, en utilisant quelques analogies de la vie quotidienne :

1. L'analogie du « Menu » (L'ensemble de candidats)

Au lieu de demander au robot de rédiger un tout nouvel essai à partir de zéro (ce qui est difficile à contrôler), le système demande d'abord au robot de générer une petite liste de réponses possibles, comme un menu d'options.

  • Option A : Une réponse très utile, mais elle pourrait être dangereuse (ex : « Mélangez de l'eau de Javel et de l'ammoniaque pour obtenir un gaz sympa ! »).
  • Option B : Une réponse totalement sûre, mais inutile (ex : « Je ne peux pas répondre à cela. »).
  • Option C : Une réponse équilibrée (ex : « Vous pouvez mélanger du bicarbonate de soude et du vinaigre pour une réaction sûre. »).

Le but est de choisir l'Option C.

2. Le « Funambule » (La théorie des jeux)

Le papier traite le choix d'une réponse comme un jeu entre deux joueurs :

  • Joueur 1 (L'Aide) : Veut donner la réponse la plus utile et la plus informative possible.
  • Joueur 2 (Le Gardien de la Sécurité) : Veut s'assurer que la réponse n'est pas dangereuse.

Le système utilise un « jeu » mathématique pour trouver l'équilibre parfait. C'est comme un funambule qui essaie de rester le plus possible vers l'avant (utile) sans tomber dans le vide (dangereux). Le système calcule la stratégie « Minimax », qui est la façon la plus sûre d'être aussi utile que possible sans franchir la ligne.

3. L'analogie du « Budget » (L'optimisation sous contrainte)

Imaginez que vous ayez un budget strict pour le « risque ».

  • Chaque fois que le robot suggère une réponse risquée, cela vous coûte des « dollars de risque ».
  • Vous avez un budget fixe (disons, 10 $).
  • Le système examine toutes les options sur le menu. Il peut choisir une réponse légèrement risquée si elle est très utile, tant que le « coût de risque » total de la décision finale reste en dessous de votre budget de 10 $.
  • Si une réponse est trop dangereuse, elle coûte trop cher, et le système la rejette.
  • Si toutes les réponses sont trop dangereuses, le système revient par défaut à un « repli sûr » (comme dire « Je ne peux pas aider pour cela »).

4. L'« Arbitre » (Le solveur de programmation linéaire)

Comment le système prend-il réellement cette décision ? Il ne demande pas au robot de « réfléchir » aux règles (car le robot pourrait être mauvais pour suivre les règles ou pourrait être piégé). À la place, le système utilise un outil mathématique distinct et simple appelé solveur de programmation linéaire (LP).

Considérez le solveur LP comme un arbitre strict qui ne regarde que les chiffres :

  1. Évaluer les options : À quel point est-ce utile ? À quel point est-ce risqué ?
  2. Calculer : « Si je choisis celle-ci, est-ce que je reste sous le budget de risque ? »
  3. Prendre la décision : Choisir l'option qui apporte le plus d'aide tout en respectant le budget.

Parce que cet arbitre est un programme mathématique simple, il est rapide, fiable et n'a pas besoin d'être réentraîné à chaque fois qu'une nouvelle règle de sécurité apparaît.

Pourquoi est-ce important ?

  • Pas de chirurgie requise : Vous n'avez pas besoin d'ouvrir le modèle d'IA. Vous pouvez utiliser cela avec n'importe quel modèle, même ceux appartenant à de grandes entreprises technologiques que vous ne pouvez pas modifier.
  • Flexible : Si de nouvelles règles de sécurité apparaissent demain (ex : « Ne parlez pas de politique »), il vous suffit de changer le budget mathématique. Vous n'avez pas besoin de réentraîner toute l'IA.
  • Équitable pour tous : Les petites entreprises ou les chercheurs qui n'ont pas les moyens d'entraîner leurs propres modèles d'IA massifs peuvent tout de même utiliser des modèles préexistants de manière sécurisée.

L'essentiel

Cette publication démontre qu'en traitant la sécurité comme un problème mathématique d'équilibrage entre « utilité » et « risque » à partir d'un menu d'options, nous pouvons rendre les modèles d'IA « boîte noire » beaucoup plus sûrs sans jamais toucher à leur code interne. C'est comme placer un feu de signalisation intelligent et mathématiquement parfait devant une intersection chaotique pour assurer la sécurité de tous, sans avoir besoin de reconstruire les voitures.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →