← Derniers articles
💻 computer science

InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation

Cet article présente InteractScience, une nouvelle référence et un cadre d'évaluation hybride conçus pour évaluer la capacité des grands modèles de langage à générer du code de démonstration scientifique interactif en combinant des tests fonctionnels programmatiques et une analyse qualitative ancrée dans le visuel couvrant cinq domaines scientifiques.

Auteurs originaux : Qiaosheng Chen, Yang Liu, Lei Li, Kai Chen, Qipeng Guo, Gong Cheng, Fei Yuan

Publié 2026-05-21
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Qiaosheng Chen, Yang Liu, Lei Li, Kai Chen, Qipeng Guo, Gong Cheng, Fei Yuan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous demandiez à un robot très intelligent et bien informé de construire pour vous une expérience scientifique. Vous ne voulez pas simplement une image de volcan ou un paragraphe expliquant comment fonctionne la gravité. Vous voulez une simulation interactive fonctionnelle où vous pouvez déplacer un curseur pour modifier la vitesse du vent et observer un vaisseau spatial virtuel voler, ou appuyer sur un bouton pour voir comment les planètes orbitent.

Le document « InteractScience » porte sur l'évaluation de la capacité des robots d'intelligence artificielle les plus avancés d'aujourd'hui à créer ce type spécifique de démonstrations scientifiques interactives.

Voici le détail de ce qu'ils ont réalisé, en utilisant des analogies simples :

Le Problème : Le « Grand Parleur » contre le « Grand Bâtisseur »

Les auteurs ont constaté que les modèles d'IA actuels excellent dans deux domaines distincts :

  1. Parler de science : Si vous demandez « Quelles forces agissent sur un bloc sur un plan incliné ? », l'IA peut rédiger une réponse parfaite de manuel scolaire.
  2. Construire des sites web statiques : Si vous demandez « Créez-moi un blog avec un en-tête bleu », l'IA peut écrire le code, et le résultat est joli.

Mais, lorsque vous demandez à l'IA de combiner les deux — « Créez un site web interactif où je peux faire glisser un bloc sur un plan incliné et voir les forces physiques changer en temps réel » — l'IA échoue souvent. Elle peut construire un plan incliné qui semble réel, mais lorsque vous faites glisser le bloc, il s'envole hors de l'écran parce que les mathématiques sont erronées, ou les boutons ne font rien du tout.

C'est comme engager un architecte capable de décrire magnifiquement une maison et de poser parfaitement des briques, mais qui, lorsqu'on lui demande de construire une maison avec un ascenseur fonctionnel, laisse le puits de l'ascenseur vide, ou ouvre les portes sur un mur de briques.

La Solution : Un Nouveau « Bulletin de Notes » (InteractScience)

Les chercheurs ont créé un nouveau terrain d'essai appelé InteractScience. Au lieu de simplement demander à l'IA d'écrire du code et d'espérer que cela fonctionne, ils ont mis en place un système de notation strict comportant deux parties distinctes, comme un enseignant vérifiant à la fois les mathématiques et le dessin sur le projet d'un élève.

Partie 1 : L'« Inspecteur Robot » (Tests Fonctionnels Programmatiques)

Imaginez un inspecteur robot qui ne se soucie pas de la beauté du site web. Ce robot dispose d'une liste de contrôle d'actions spécifiques :

  • « Cliquez sur le bouton 'Démarrer'. »
  • « Déplacez le curseur à 50 %. »
  • « Vérifiez si le nombre à l'écran est passé de 10 à 20. »

Si le code de l'IA ne parvient pas à faire exactement ce que le robot demande, il obtient un zéro pour cette partie. Cela vérifie si la logique fonctionne.

Partie 2 : Le « Critique d'Art » (Tests Qualitatifs Fondés sur la Vision)

Imaginez un critique d'art qui examine l'image finale. Mais ce n'est pas simplement un humain qui devine ; c'est un juge d'IA ultra-intelligent.

  • Le juge dispose d'une Photo de Référence (la « Référence Or » de l'apparence que la démonstration devrait avoir).
  • Le juge dispose d'une Liste de Contrôle (par exemple : « La flèche pointe-t-elle dans la bonne direction ? » « La courbe est-elle lisse ? »).
  • Le juge compare le résultat de l'IA à la photo et à la liste de contrôle.

Cela vérifie si la science et les visuels sont corrects.

Ce Qu'ils Ont Découvert

Les chercheurs ont testé 30 modèles d'IA différents (gratuits et payants) sur 150 problèmes scientifiques différents, allant du facile (graphiques mathématiques) au difficile (simulations physiques complexes).

Voici la grande surprise qu'ils ont découverte :

  • La « Coquille » est bonne : La plupart des IA sont excellentes pour construire la « coquille » de l'application. Elles peuvent faire apparaître et fonctionner les boutons, les curseurs et les menus. Si vous cliquez sur un bouton, il clique. (C'est comme si l'inspecteur robot validait le test du « clic »).
  • Le « Cerveau » est cassé : Cependant, lorsque l'IA tente réellement de faire de la science, elle échoue souvent. Le curseur peut bouger, mais l'équation physique derrière est fausse. La balle peut tomber, mais elle tombe dans la mauvaise direction.
  • L'Écart : Il existe un énorme fossé entre « faire fonctionner les boutons » et « faire fonctionner la science ». L'IA peut construire une voiture avec des portes fonctionnelles et une peinture brillante, mais le moteur ne fait pas tourner les roues.

Pourquoi Cela Compte

L'article soutient que nous ne pouvons pas encore faire confiance à l'IA pour construire des outils scientifiques. Si un élève utilise une simulation générée par l'IA pour apprendre la physique, et que la simulation contient une erreur mathématique cachée, l'élève apprendra la mauvaise chose.

InteractScience est le premier outil qui force l'IA à prouver qu'elle peut faire correctement à la fois le codage et la science, et non pas l'un ou l'autre. C'est un test de réalité pour l'avenir de l'IA dans l'éducation.

La Conclusion

L'article conclut que, bien que l'IA s'améliore dans l'écriture de code, elle peine toujours à intégrer des connaissances scientifiques approfondies dans ces codes. C'est comme un élève qui peut mémoriser le dictionnaire mais qui n'a pas appris à écrire une histoire. Les chercheurs espèrent que ce nouveau test aidera les développeurs à corriger ces erreurs de « cerveau » afin que, dans le futur, l'IA puisse véritablement être un partenaire fiable en science et en éducation.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →