← Derniers articles
💻 computer science

Repeated-Game Security for Restaking-Based Verifiable Inference

Cet article démontre que la compatibilité incitative à un tour souvent supposée dans l'inférence vérifiable basée sur le restaking est insuffisante en raison d'un écart de jeu répété où le slashing proportionnel ne parvient pas à décourager la non-conformité rationnelle au fil du temps, et propose un mécanisme déployable combinant des défis dépendants de l'historique et un slashing pondéré par la réputation pour restaurer la sécurité à long terme sans nécessiter de vérification cryptographique par requête.

Auteurs originaux : Zhenhang Shang, Yingzhe Yu, Kani Chen

Publié 2026-08-11
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhenhang Shang, Yingzhe Yu, Kani Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où des cerveaux informatiques géants et super-intelligents (appelés Grands Modèles de Langage) peuvent répondre à vos questions, écrire vos histoires ou résoudre vos problèmes de mathématiques. Mais voici le piège : faire fonctionner ces cerveaux coûte cher et est lent. Ainsi, les entreprises veulent embaucher des travailleurs indépendants pour faire le travail de réflexion à leur place. Le problème est le suivant : comment savoir si le travailleur n'a pas simplement deviné la réponse ou utilisé un cerveau plus petit et moins cher pour économiser de l'argent ? C'est le monde de l'inférence vérifiable.

Pour résoudre cela, nous utilisons un système appelé restaking (mise en gage de nouveau). Pensez-y comme à un dépôt de garantie. Le travailleur dépose une pile d'argent numérique (la mise) comme une promesse de faire le travail honnêtement. S'il dévie, un arbitre vérifie son travail et, s'il est pris en faute, l'arbitre lui prend une partie de son dépôt. C'est ce qu'on appelle le slashing (le déchéance). Pendant longtemps, les experts ont pensé que c'était un filet de sécurité parfait. Ils pensaient que si l'amende pour dévier était supérieure à l'argent économisé en déviant, personne ne chercherait jamais à dévier. C'était un contrat de type « coup unique » : Ne vole pas le biscuit, ou tu perdras le bocal.

Mais et si le travailleur n'effectuait pas seulement un travail, mais des millions de tâches, encore et encore ? C'est là que l'histoire devient complexe. La publication que vous allez lire pose une question brillante : le filet de sécurité du « coup unique » fonctionne-t-il réellement quand le jeu est joué de manière répétée ? Les auteurs, Zhenhang Shang, Yingzhe Yu et Kani Chen de l'Université des sciences et technologies de Hong Kong, ont découvert que l'ancien filet de sécurité possède un trou caché. Ils ont découvert que si un travailleur dévie juste un peu, il peut en fait s'en sortir, même si l'amende semble effrayante au premier abord. Pourquoi ? Parce que chaque fois qu'il est pris, l'amende ne prend qu'une fraction de son dépôt. Ainsi, son dépôt devient de plus en plus petit, rendant les amendes futures de plus en plus faibles, tandis qu'il continue d'empocher les économies réalisées en déviant sur chaque nouvelle tâche. C'est comme un voleur qui continue de voler un peu d'or, et chaque fois que le garde le rattrape, le garde ne prend qu'un petit morceau de l'or restant, faisant chuter le « risque » du voleur jusqu'à ce qu'il soit pratiquement intouchable.

La Grande Découverte : La Faille du « Récidiviste »

Les auteurs ont réalisé que l'ancienne règle — « Ne dévie pas car l'amende est plus grande que le gain » — ne fonctionne que pour une décision unique et ponctuelle. Mais dans le monde réel, ces fournisseurs d'IA sont là pour le long terme, répondant à des milliers, voire des millions de questions. Le document modélise cela comme un jeu répété, où le fournisseur et le protocole jouent tour après tour.

Ils ont découvert un « écart de jeu répété ». Voici le tour de magie utilisé par le déviateur :

  1. La Mise en Place : Le fournisseur dépose une mise importante.
  2. La Déviation : Il utilise un modèle plus basique et plus rapide pour répondre aux questions, économisant ainsi de l'argent sur chaque requête.
  3. L'Erreur : Parfois, l'arbitre (le protocole) le prend en flagrant délit.
  4. La Faille : Le protocole ne retire qu'un pourcentage de la mise, disons 20 %. Le fournisseur perd de l'argent, mais il lui en reste toujours 80 %.
  5. Le Cycle : Parce que sa mise est désormais plus petite, la prochaine fois qu'il est pris, l'amende est encore plus faible (20 % d'un nombre plus petit). Mais l'argent qu'il économise en déviant sur la question suivante est exactement le même qu'auparavant !

Le papier prouve mathématiquement que cela crée un déséquilibre dangereux. Les économies restent constantes, mais la pénalité diminue à chaque fois qu'il est pris. Les auteurs montrent que pour de nombreux systèmes existants (comme EigenAI, VeriLLM et Sertn AVS), cet écart est bien réel. Même si ces systèmes réussissent le test de sécurité du « coup unique », ils échouent au test du « long terme ». Dans les simulations, un déviateur rationnel pourrait réaliser un profit supplémentaire de 1,5 % à 8 % simplement en exploitant cette faille de jeu répété, même lorsque le système pense être sécurisé.

La Solution : Un Système Plus Intelligent, Sensible à l'Historique

Alors, comment réparer un système qui s'affaiblit chaque fois qu'un déviateur est pris ? Les auteurs proposent un nouveau mécanisme qui agit comme un arbitre intelligent doté de mémoire. Au lieu de simplement regarder combien d'argent il reste au travailleur, le nouveau système examine son historique.

Ils introduisent trois outils ingénieux pour colmater la brèche :

  1. Scores de Suspicion (L'œil Vigilant) : Le système tient un score pour chaque travailleur. S'il agit bizarrement (comme répondre trop vite ou donner des réponses légèrement différentes), son score de suspicion augmente. Plus le score est élevé, plus l'arbitre est susceptible de vérifier son travail. Cela signifie que si vous déviez, vous n'êtes pas seulement amendé ; vous êtes surveillé de plus près la fois suivante.
  2. Amendes Pondérées par la Réputation (La Lettre de Mort) : Au lieu de simplement prendre un pourcentage de l'argent restant, l'amende dépend également de la réputation du travailleur. Si vous avez un mauvais historique, l'amende devient beaucoup plus dure, même si votre dépôt est petit. Cela empêche le tour de passe-passe de la « pénalité décroissante ».
  3. Vesting (La Laisse) : Lorsqu'un travailleur tente de quitter le jeu (retirer son argent), le système ne le laisse pas s'enfuir immédiatement. Son argent est « verrouillé » pendant un certain temps. S'il tente de dévier et de partir, le système peut toujours le rattraper et prendre son argent pendant cette période de verrouillage. Cela empêche la stratégie « dévier et s'enfuir ».

Est-ce que cela fonctionne vraiment ?

Les auteurs n'ont pas seulement imaginé cela ; ils ont construit un simulateur pour tester leur théorie. Ils ont opposé leur nouveau système aux anciens en utilisant différents types de « déviateurs », incluant certains qui dévient constamment, d'autres qui ne dévient que lorsqu'ils pensent que personne ne regarde, et d'autres qui tentent de dévier puis de s'enfuir.

Les résultats étaient prometteurs. Dans les simulations, les anciens systèmes laissaient les déviateurs conserver leur profit supplémentaire. Mais le nouveau système, avec ses règles sensibles à l'historique, a réduit les profits des déviateurs de 31 % à 54 %. Dans certains cas, il a même fait de la déviation une stratégie perdante, transformant un profit en perte pour le déviateur.

Ils ont également testé à quel point la déviation est « détectable ». Ils ont utilisé de vrais modèles d'IA (allant de petits modèles de 0,5 milliard de paramètres à de très gros modèles de 14 milliards de paramètres) pour voir si le système pouvait distinguer une vraie réponse d'une réponse fausse et bon marché. Ils ont constaté que le « compteur de suspicion » de leur système fonctionne très bien, surtout lorsque la différence de coût entre le bon modèle et le modèle bon marché est importante. Plus le déviateur essaie d'économiser de l'argent, plus il est facile de le prendre.

Pourquoi cela importe

Ce papier est un signal d'alarme pour le monde de la sécurité de la blockchain et de l'IA. Il montre que le fait qu'une règle de sécurité fonctionne pour un instant donné ne signifie pas qu'elle fonctionnera pour toute une vie. Les auteurs n'ont pas seulement souligné un problème ; ils ont construit le plan d'un système capable de gérer la réalité des interactions répétées.

Ils ont prouvé qu'en faisant dépendre la pénalité du comportement passé du travailleur et en le maintenant sur une « laisse » lorsqu'il tente de partir, nous pouvons créer un système qui reste sécurisé même si le jeu se poursuit indéfiniment. C'est un passage d'une vision de la sécurité comme une simple « caution » à une vision de la sécurité comme une relation à long terme où la confiance se gagne et se perd au fil du temps. Pour quiconque construit l'avenir de l'IA sur la blockchain, c'est une étape cruciale pour garantir que les travailleurs accomplissent réellement le travail qu'ils ont promis de faire.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →