← Derniers articles
💻 computer science

Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3

Le papier présente Tycho, un système d'agent de codage qui répond au défi ARC-AGI-3 en formalisant les environnements comme des machines de Moore paramétrées et en employant une « abstraction active » pour construire, tester et réparer dynamiquement des modèles de monde exécutables, atteignant une efficacité de rejeu humain parfaite sur les 183 niveaux tout en réduisant considérablement le nombre d'actions par rapport aux références humaines.

Auteurs originaux : Jens Lehmann, Andrei Aioanei, Sahar Vahdati

Publié 2026-07-31
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Jens Lehmann, Andrei Aioanei, Sahar Vahdati

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez parachuté dans un tout nouveau jeu vidéo sans manuel, sans tutoriel et sans aucun moyen de demander de l'aide. Vous ne pouvez que voir l'écran, appuyer sur un bouton et observer ce qui se passe ensuite. Pour gagner, vous devez découvrir les règles cachées, deviner l'objectif et tout cela sans gaspiller le moindre mouvement, car chaque pression de bouton compte contre votre score. C'est le défi de l'abstraction active : apprendre comment un monde fonctionne en agissant en son sein, plutôt qu'en mémorisant simplement des réponses. Les scientifiques appellent cela l'« acquisition de compétences », ce qui consiste essentiellement à apprendre un nouveau tour rapidement en seulement quelques essais, plutôt qu'en ayant besoin de s'entraîner un million de fois. La grande question est la suivante : un ordinateur peut-il apprendre à jouer à ces jeux mystérieux comme le fait un humain — en observant, en devinant les règles, puis en utilisant ces règles pour planifier ses coups ?

Ce document présente un système appelé Tycho (nommé d'après l'astronome Tycho Brahe, qui a cartographié les étoiles avec une telle précision que d'autres ont pu plus tard découvrir les lois de l'univers) pour répondre à cette question. Tycho est un « agent de codage » conçu pour jouer à un ensemble spécifique de puzzles complexes appelés ARC-AGI-3. Au lieu de simplement deviner le prochain mouvement, Tycho tente d'écrire un petit programme informatique qui agit comme un simulateur du jeu lui-même. Il observe le jeu, écrit du code pour prédire ce qui se passera s'il appuie sur un bouton, vérifie si ce code est correct, puis utilise ce code pour planifier ses mouvements. Les chercheurs ont testé quatre manières différentes dont Tycho pourrait utiliser ce simulateur : en l'ignorant complètement, en laissant le cerveau principal écrire le code lui-même, en demandant à un robot assistant d'écrire le code, ou en réparant automatiquement le code chaque fois qu'il commet une erreur.

Les résultats ont été surprenants et nuancés. L'équipe a découvert que le simple fait d'avoir un simulateur ne suffit pas ; c'est la stratégie de savoir quand l'utiliser qui importe le plus. La meilleure approche a été la délégation demandée par l'acteur (actor-requested delegation), où l'agent principal demande à un assistant spécialisé de construire le simulateur de jeu uniquement lorsqu'il pense que c'est nécessaire. Cette méthode a obtenu l'efficacité la plus élevée lors des tests initiaux. Lorsqu'ils ont appliqué cette stratégie gagnante à deux des modèles d'IA les plus puissants disponibles (GPT-5.6 Sol et Opus 5), les résultats ont été incroyables : ils ont résolu 100 % des 25 jeux publics et tous les 183 niveaux qu'ils contiennent. Le modèle Opus 5 était particulièrement efficace, utilisant 61 % de moins d'actions qu'un joueur humain moyen pour terminer les mêmes niveaux.

Cependant, l'article met également en garde contre un piège courant. Ils ont constaté que construire un simulateur qui prédit parfaitement chaque pixel du jeu (haute précision) ne garantit pas la victoire. Une stratégie, appelée « réparation automatique », a construit des simulateurs qui étaient incroyablement précis pour prédire ce qui se passe ensuite, mais l'agent jouait mal car il ne savait pas ce qu'il devait viser ou quand arrêter d'utiliser le simulateur. C'est comme avoir une carte parfaite d'un labyrinthe mais ne pas savoir où se trouve la sortie. L'article conclut que la véritable intelligence ne consiste pas seulement à construire un modèle parfait du monde ; il s'agit de l'« abstraction active » consistant à décider quand construire un modèle, quand lui faire confiance et quand l'ignorer pour simplement agir. Tycho a montré qu'en traitant le jeu comme un ensemble de règles à découvrir et à tester, plutôt que comme une simple image à résoudre, l'IA peut apprendre à jouer à de nouveaux jeux avec une efficacité humaine.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →