StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley
StarDojo est un nouveau benchmark basé sur le jeu Stardew Valley qui évalue les LLM multimodaux agentiques à l'ouverture dans des simulations de production et de vie complexes à travers 1 000 tâches organisées, révélant que même les modèles de pointe comme GPT-4.1 luttent considérablement avec la compréhension visuelle, le raisonnement et la manipulation de bas niveau, n'atteignant qu'un taux de réussite de 12,7 %.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez d'apprendre à un robot comment mener une vie humaine épanouie. Pas seulement comment répondre à une question ou écrire un poème, mais comment se réveiller, aller au travail, se faire des amis, gérer un budget et gérer des averses de pluie imprévues — tout cela en même temps.
C'est exactement ce que les auteurs de ce document, StarDojo, tentent de faire. Ils ont construit un terrain d'essai en utilisant le jeu vidéo populaire Stardew Valley pour voir si des agents d'intelligence artificielle (IA) peuvent gérer la réalité complexe et désordonnée de la « production et de la vie ».
Voici une décomposition de leur travail en utilisant des analogies simples :
1. Le Problème : L'écart des « deux voies »
Pensez aux benchmarks actuels de l'IA comme à un examen du permis de conduire où vous devez seulement garer une voiture en ligne droite (production) ou un test où vous devez seulement discuter avec un passager (interaction sociale).
- La Réalité : Dans la vraie vie, on ne peut pas simplement se garer et discuter. Il faut conduire jusqu'à l'épicerie (production), acheter de la nourriture, puis parler au caissier (social) tout en gérant son temps et son argent.
- L'Écart : Les tests existants ne vérifient pas si une IA peut faire les deux à la fois. Ils sont généralement trop simples ou trop focalisés sur une seule chose.
2. La Solution : StarDojo (L'examen du « simulateur de vie »)
Les auteurs ont créé StarDojo, un nouveau benchmark basé sur le jeu Stardew Valley.
- Le Jeu : Imaginez une ferme paisible où vous plantez des cultures, minez des rochers, combattez des slimes dans une grotte et passez du temps avec les villageois.
- Le Twist : Ils ont transformé ce jeu en un examen rigoureux pour l'IA. Au lieu d'un humain qui joue, ils laissent des agents d'IA tenter de réaliser des tâches spécifiques.
- Les Tâches : Ils ont créé 1 000 défis différents allant du « facile » (comme arroser une plante) au « difficile » (comme planifier une saison entière de ferme tout en construisant une relation avec un voisin et en combattant des monstres).
- La Version « Lite » : Pour faciliter les tests, ils ont également sélectionné un ensemble plus restreint de 100 tâches représentatives (StarDojo-Lite) qui couvrent les bases.
3. Comment ils ont connecté l'IA au jeu
Normalement, pour contrôler un jeu vidéo, vous avez besoin d'un clavier et d'une souris. Mais on ne peut pas facilement brancher un clavier dans un cerveau de robot.
- Le Pont : Les auteurs ont construit un « traducteur » spécial (appelé StarDojoMod) qui permet à l'IA de parler directement au moteur du jeu.
- L'Analogie : Au lieu que l'IA essaie de « voir » l'écran et d'« appuyer » sur des boutons comme un humain, c'est comme si l'IA avait une ligne téléphonique directe avec l'ordinateur interne du jeu. Elle peut demander : « Quel est mon niveau d'énergie ? » ou dire : « Déplace-moi vers la gauche », et le jeu le fait instantanément. Cela permet de faire tourner de nombreuses parties simultanément pour tester l'IA rapidement.
4. Les Résultats : L'IA a du mal à « grandir »
Les auteurs ont testé les modèles d'IA les plus intelligents disponibles (comme GPT-4.1, Claude et Gemini) sur cet examen. Les résultats sont frappants :
- Le Score : Même la meilleure IA n'a réussi qu'environ 12,7 % des tâches.
- Les Choses Faciles : L'IA était correcte pour des tâches simples et courtes (comme ramasser un outil s'il est déjà dans sa main).
- Les Choses Difficiles : L'IA a complètement échoué pour tout ce qui nécessitait un plan de longue haleine ou des déplacements sur la carte. Si une tâche nécessitait plus de quelques étapes, l'IA se perdait ou oubliait ce qu'elle était en train de faire.
5. Pourquoi l'IA a-t-elle échoué ? (Les « quatre angles morts »)
Les auteurs ont analysé les erreurs et ont trouvé quatre raisons principales pour lesquelles l'IA n'a pas pu gérer ce « simulateur de vie » :
- Cécité Visuelle (42 % des erreurs) : L'IA regardait l'écran du jeu et ne pouvait pas distinguer les éléments. Elle pouvait prendre un rocher pour un arbre, ou ne pas voir qu'une porte se trouve juste devant elle. C'est comme naviguer dans une pièce en portant des lunettes embuées.
- Confusion de Raisonnement (21 %) : Même quand l'IA disposait des bonnes informations (comme une liste textuelle disant « Vous êtes près de la grange »), elle ignorait le texte et se fiait à sa vision floue, ce qui entraînait la confusion.
- Capacité d'Attention Limitée (21 %) : L'IA ne pouvait pas planifier à l'avance. Elle pouvait oublier qu'elle doit arroser les cultures avant de pouvoir les récolter, ou changer d'objectif en plein milieu d'une tâche.
- Mains Maladroites (16 %) : L'IA savait quoi faire, mais ratait le comment. Elle pouvait essayer d'utiliser un outil dans la mauvaise direction ou choisir le mauvais objet dans son inventaire.
6. La Conclusion
Le document conclut que, bien que l'IA soit excellente pour répondre à des questions ou écrire du code, elle est actuellement très mauvaise dans la « vie incarnée » (embodied living). Elle peine à combiner la vision, la pensée, la planification et l'action dans un monde dynamique où le temps passe et où les choses changent.
StarDojo est désormais un outil ouvert à la recherche. C'est comme une « salle de sport » où l'IA peut s'entraîner pour devenir meilleure face au défi complexe, désordonné et magnifique de vivre une vie simulée. Le document ne promet pas que l'IA gérera des fermes demain ; il montre simplement précisément là où l'IA trébuche afin que nous puissions l'aider à apprendre.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.