← Derniers articles
🤖 machine learning

Training and Benchmarking Code Generation for Physics-Inspired Animations

Cet article présente SimuScene, un ensemble de données et un benchmark complets pour l'entraînement et l'évaluation des grands modèles de langage sur la génération de code exécutable pour des animations inspirées de la physique, démontrant que même les meilleurs modèles éprouvent des difficultés face à cette tâche mais peuvent être considérablement améliorés grâce à un nouveau pipeline d'apprentissage par renforcement utilisant des récompenses visuelles.

Auteurs originaux : Yanan Wang, Renxi Wang, Yongxin Wang, Xuezhi Liang, Fajri Koto, Timothy Baldwin, Xiaodan Liang, Haonan Li

Publié 2026-08-14
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yanan Wang, Renxi Wang, Yongxin Wang, Xuezhi Liang, Fajri Koto, Timothy Baldwin, Xiaodan Liang, Haonan Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez un ami robot super intelligent capable de lire un livre d'histoires et d'écrire instantanément le code informatique pour faire un film de cette histoire. Vous dites au robot : « Une balle roule le long d'une colline et rebondit contre un mur », et vous vous attendez à voir une balle rouler le long d'une colline et rebondir contre un mur. C'est le rêve des Modèles de Langage de Grande Taille (LLM) : des ordinateurs capables de comprendre le langage humain et de le transformer en action. Mais il y a une partie délicate. Ce n'est pas parce que le robot écrit le code que le film qu'il crée ressemblera vraiment à l'histoire. Le code peut s'exécuter, mais la balle pourrait flotter comme un fantôme, rouler en montée, ou se transformer en carré. Cet article explore un recoin spécifique de la science où nous nous demandons : ces robots IA peuvent-ils non seulement écrire le script, mais aussi diriger réellement la physique du film pour qu'elle paraisse réelle ? C'est comme demander à un chef non pas seulement d'écrire une recette de gâteau, mais de réellement cuire un gâteau qui a le goût d'un gâteau, et non d'une brique.

Les chercheurs derrière cette étude, dirigés par une équipe de l'Université d'Intelligence Artificielle Mohamed bin Zayed et de l'Université de Sun Yat-sen, ont décidé de mettre ces robots IA à l'épreuve ultime. Ils ont créé un nouveau jeu appelé SimuScene. Voyez cela comme un immense terrain de jeu automatisé avec 52 thèmes physiques différents, comme la gravité, la lumière, l'électricité et la façon dont les fluides circulent. Ils ont construit un système qui génère des milliers de scénarios uniques — comme « un disque tournant sur une table glissante » ou « la lumière déviée à travers une lentille » — et demande ensuite à l'IA d'écrire du code Python pour les animer. Mais voici le piège : l'IA ne reçoit pas simplement un laissez-passer pour avoir écrit un code qui s'exécute. Le code doit produire une vidéo qui correspond réellement à la physique décrite. Pour vérifier cela, ils ont utilisé un « arbitre » spécial (un Modèle Vision-Langage) qui regarde la vidéo générée et répond à des questions telles que : « Est-ce que la balle a rebondi ? » ou « Est-ce que la lumière a dévié de la bonne manière ? ». Si la vidéo échoue aux questions, l'IA échoue au test.

Les résultats ont été un rappel à la réalité. Même les modèles d'IA les plus intelligents et les plus avancés disponibles aujourd'hui ont énormément lutté. Lorsque les chercheurs ont demandé à 10 IA de haut niveau de générer ces animations, la meilleure d'entre elles n'a réussi environ que 21,5 % des scénarios en moyenne. Cela signifie que pour 100 tentatives, l'IA n'a réussi à créer une vidéo correspondant à la description physique qu'environ 21 fois. La plupart du temps, le code s'exécutait, mais l'animation était étrange : des objets pouvaient passer à travers des murs, bouger dans la mauvaise direction ou ignorer totalement la gravité. Il s'avère que apprendre à une IA à écrire du code est une chose, mais lui apprendre à comprendre les règles invisibles de la façon dont le monde bouge et à visualiser ces règles est un puzzle bien plus difficile.

Cependant, l'article ne se contente pas de dire que « c'est difficile ». L'équipe a également essayé une astuce ingénieuse pour rendre les IA meilleures. Ils ont utilisé une méthode appelée Apprentissage par Renforcement, qui revient à entraîner un chien avec des friandises. Au lieu de simplement dire à l'IA « bon travail » ou « mauvais travail » en fonction du texte, ils ont laissé l'IA générer une vidéo, ont regardé la vidéo, et ne lui ont donné une « friandise » (une récompense) que si la vidéo paraissait réellement correcte. Ils ont utilisé un juge basé sur la vision pour donner ces récompenses. Après cet entraînement, les modèles d'IA se sont considérablement améliorés. Un petit modèle qui partait d'un taux de réussite de 0 % a atteint un taux de réussite de 11,1 % après l'entraînement, et un modèle plus grand est passé de 18,3 % à 34,4 %. Cela suggère que, bien que les IA ne soient pas encore des moteurs physiques parfaits, elles peuvent apprendre à s'améliorer si on leur montre les films réels qu'elles créent et qu'on les laisse voir leurs propres erreurs.

En résumé, cet article montre que si nos amis l'IA deviennent très doués pour écrire du code, ils sont encore en train d'apprendre à être de bons directeurs de la physique. Ils peuvent écrire le script, mais faire en sorte que le film paraisse réel est encore un travail en cours. L'équipe a construit un ensemble massif de données de plus de 7 600 scénarios physiques pour aider à les entraîner, et leurs expériences prouvent que regarder les résultats (les vidéos) et apprendre d'eux est un moyen puissant d'enseigner à ces modèles. C'est un signe d'espoir qui montre qu'avec le bon entraînement, nous pourrions bientôt avoir des IA capables de transformer nos descriptions physiques les plus folles en images animées précises.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →