← Derniers articles
🤖 machine learning

STITCH-OPE: Trajectory Stitching with Guided Diffusion for Off-Policy Evaluation

STITCH-OPE est un cadre génératif fondé sur des modèles qui exploite la diffusion guidée et le raccordement de trajectoires pour surmonter les limites des méthodes d'évaluation hors politique existantes dans des contextes à haute dimension et à long horizon, atteignant ainsi une réduction significative de la variance et une précision améliorée.

Auteurs originaux : Hossein Goli, Michael Gimelfarb, Nathan Samuel de Lara, Haruki Nishimura, Masha Itkina, Florian Shkurti

Publié 2026-07-13
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hossein Goli, Michael Gimelfarb, Nathan Samuel de Lara, Haruki Nishimura, Masha Itkina, Florian Shkurti

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot comment jouer à un jeu vidéo, mais que vous ne pouvez pas laisser le robot jouer réellement au jeu dans le monde réel. Peut-être que le robot est trop coûteux, ou que le jeu est trop dangereux. À la place, vous disposez d'une immense bibliothèque d'enregistrements vidéo montrant un autre robot (appelons-le « Vieux Bot ») en train de jouer au jeu. Votre objectif est de déterminer si un nouveau robot (« Nouveau Bot ») s'en sortira bien, simplement en regardant ces anciens enregistrements. C'est ce qu'on appelle l'Évaluation Hors-Politique (OPE - Off-Policy Evaluation).

Le problème est que le Vieux Bot et le Nouveau Bot pourraient jouer de manières très différentes. Si le Nouveau Bot essaie de faire quelque chose que le Vieux Bot n'a jamais fait, les anciens enregistrements deviennent inutiles. Si vous essayez de deviner le score du Nouveau Bot en étirant simplement les anciennes données, les mathématiques deviennent complexes et explosent dans le chaos, surtout pour des jeux longs et compliqués.

Entrez en scène STITCH-OPE, une nouvelle méthode qui agit à la fois comme un éditeur vidéo ingénieux et un directeur de création.

Le problème avec les anciennes méthodes

Les tentatives précédentes pour résoudre cela revenaient à essayer de prédire un film entier en essayant de deviner chaque image du début à la fin en un seul bond géant.

  • L'approche par « Échantillonnage d'Importance » (Importance Sampling) revenait à essayer de réparer un film cassé en multipliant le volume de chaque image par un nombre énorme. Si le film est long, le volume devient si fort qu'il fait éclater les haut-parleurs (la variance explose).
  • L'approche « Basée sur le Modèle » (Model-Based) revenait à essayer de construire un simulateur parfait du monde. Mais si vous faites une minuscule erreur dans la première seconde, cette erreur s'amplifie de seconde en seconde, jusqu'à ce que la simulation soit complètement fausse à la fin.

La solution STITCH-OPE : La stratégie « Lego »

STITCH-OPE change la donne en décomposant le long film en petits morceaux gérables. Pensez à la construction d'un long pont en Lego. Au lieu d'essayer d'assembler tout le pont d'un coup (ce qui est difficile et risque de casser), vous construisez le pont pièce par pièce, en connectant la fin d'une petite section au début de la suivante.

Voici comment cela fonctionne, étape par étape :

  1. L'éditeur de « Clips Courts » :
    Au lieu d'entraîner un modèle pour générer une vidéo entière de 10 minutes d'un coup, STITCH-OPE entraîne un « modèle de diffusion » (une IA sophistiquée qui apprend à transformer du bruit statique aléatoire en images claires) pour générer uniquement de courts clips du jeu. Disons qu'il apprend à générer des clips de 8 secondes. Il apprend à prendre une version désordonnée et bruitée d'un clip et à la nettoyer jusqu'à ce qu'elle ressemble à un mouvement réel que le Vieux Bot ferait.

  2. L'astuce du « Stitching » (Assemblage) :
    Pour créer une vidéo longue, STITCH-OPE ne la génère pas d'un seul bloc. Il génère un clip de 8 secondes, s'arrête, puis demande à l'IA : « D'accord, tu as terminé à ce point précis. Maintenant, génère le prochain clip de 8 secondes en partant exactement de là où tu t'es arrêté. » Il assemble ces courts clips bout à bout.

  • Pourquoi c'est cool : Si l'IA fait une petite erreur dans le premier clip, cela ne ruine pas tout le film. Elle corrige simplement le clip suivant en fonction de l'endroit où le précédent s'est réellement terminé. Cela stoppe l'« explosion d'erreur » qui frappe les autres méthodes.
  1. La « Direction de Scène » (La recette secrète) :
    Maintenant, nous devons nous assurer que ces clips ressemblent à ce que le Nouveau Bot ferait, et non seulement au Vieux Bot. L'IA possède une « fonction de score » (une façon de savoir ce que le Nouveau Bot aime faire).
  • Le Piège : Si vous dites simplement à l'IA « Fais ce que le Nouveau Bot aime », elle pourrait être confuse et créer des mouvements impossibles parce que le style du Nouveau Bot est totalement différent de celui du Vieux Bot.
  • La Solution : STITCH-OPE utilise une astuce de « guidage négatif ». Il dit à l'IA : « Fais ce que le Nouveau Bot aime, MAIS soustrais les choses que le Vieux Bot adorait faire. »
  • L'Analogie : Imaginez que vous dirigez une scène. Le Vieux Bot adore danser en cercle. Le Nouveau Bot veut courir en ligne droite. Si vous dites simplement « Cours en ligne droite », l'acteur risque de rester bloqué. Mais si vous dites « Ne danse pas en cercle, et ensuite cours », l'acteur sait exactement ce qu'il doit éviter. Cela empêche l'IA de rester coincée dans la « zone de confort » des mouvements du Vieux Bot et la force à explorer le style du Nouveau Bot.

Ce que disent les chiffres

Les auteurs ont testé cela sur des tâches de contrôle de robot célèbres (comme faire sauter, marcher ou courir à un robot) en utilisant des jeux de données appelés D4RL et OpenAI Gym. Ils ont fixé la longueur du jeu à 768 étapes pour les grands robots et 256 ou 196 étapes pour les plus petits.

Les résultats sont prometteurs :

  • Précision : STITCH-OPE a battu presque toutes les autres méthodes dans 11 des 15 cas de tests spécifiques.
  • Classement : Il était très efficace pour déterminer quel robot était le « meilleur », même si les robots étaient très différents de celui présent dans les enregistrements.
  • La taille de la « Fenêtre » : Ils ont découvert que générer des clips d'une longueur de 8 (la taille de la fenêtre ww) était le point d'équilibre idéal. Cela permet de balancer le besoin d'assembler les clips sans faire trop d'erreurs.

Ce qu'ils ne savent pas (encore)

L'article précise bien que ce n'est pas une baguette magique pour tout.

  • Les mouvements « impossibles » : Si le Nouveau Bot essaie de faire quelque chose que le Vieux Bot n'a jamais fait (comme sauter d'une falaise alors que le Vieux Bot ne faisait que marcher sur le sol), l'IA pourrait être confuse et inventer un mouvement faux et impossible. Les mathématiques supposent que le Vieux Bot a vu au moins une partie de ce que le Nouveau Bot fait.
  • Complexité du monde réel : Bien que cela fonctionne très bien sur ces simulations informatiques, les auteurs admettent qu'ils ne sont pas encore certains de savoir si cela fonctionnera parfaitement sur des problèmes réels et complexes, où les données sont incomplètes ou lorsque le robot ne peut pas tout voir clairement.

L'essentiel

STITCH-OPE suggère qu'en décomposant les problèmes longs et effrayants en petits morceaux assemblables et en utilisant une règle intelligente de « ne fais pas ça » pour guider l'IA, nous pouvons bien mieux prédire comment un nouveau robot performera sans jamais le laisser toucher le monde réel. C'est un grand pas en avant pour tester en toute sécurité les robots dans des situations à enjeux élevés, mais les auteurs nous rappellent qu'il s'agit encore d'un succès basé sur la simulation, et que les tests en conditions réelles constituent la prochaine frontière.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →