ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models
L'article introduit ROSE, un benchmark contrôlé démontrant que les grands modèles de langage multimodaux souffrent d'un écart de performance significatif entre le comptage visuel et les actions conditionnées par le contexte, révélant un goulot d'étranglement distinct dans la traduction des preuves visuelles partagées en comportements spécifiques à la tâche malgré une performance humaine élevée.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous regardiez une immense grille de 100 autocollants identiques sur un mur. Soudain, vous remarquez que trois d'entre eux sont légèrement différents — peut-être l'un est à l'envers, ou en possède une petite rayure.
Maintenant, imaginez qu'un robot se tient à côté de vous. Vous posez au robot trois questions différentes sur ce même mur :
- Le Compte : « Combien y a-t-il de stickers bizarres au total ? »
- La Zone : « Combien de stickers bizarres se trouvent dans le coin supérieur gauche ? »
- L'Action : « Pointe ton doigt vers chaque sticker bizarre dans le coin supérieur gauche. »
Selon l'article ROSE, beaucoup des modèles d'IA les plus intelligents d'aujourd'hui sont excellents pour les deux premières questions, mais terribles pour la troisième. Ils peuvent compter les autocollants étranges parfaitement, mais quand on leur demande de pointer physiquement les bons en fonction d'une règle spécifique, ils s'embrouillent et pointent les mauvais, ou pointent des autocollants en dehors de la zone.
Voici une décomposition de ce que l'article a découvert, en utilisant des analogies simples :
1. Le Problème : « Je vois, mais je ne peux pas agir sur ce que je vois »
Les chercheurs appellent cela le « fossé perception-action » (Perception-to-Action Gap).
Pensez à une IA comme à un bibliothécaire très intelligent qui peut instantanément vous dire combien il y a de livres rouges sur une étagère. Mais si vous lui demandez de « Aller à la troisième étagère, trouver les livres rouges et les sortir », il pourrait se figer. Il sait ce qu'il doit chercher, mais il a du mal à traduire ce savoir en une action précise et spécifique sous un nouvel ensemble de règles.
L'article a découvert que même les meilleurs modèles d'IA (comme GPT-5.5 ou Gemini) voient leurs performances chuter considérablement lorsqu'ils passent du simple « comptage » au « clic sur des points précis ». Certains modèles ont perdu près de 45 % de précision simplement parce que la tâche a changé, passant de « dites-moi le nombre » à « montrez-moi l'emplacement ».
2. Le Test : Le jeu de la grille « L'intrus »
Pour prouver cela, l'équipe a construit un benchmark appelé ROSE.
- La Configuration : Ils ont créé des milliers d'images de grilles remplies d'objets presque identiques (comme des caractères chinois qui se ressemblent beaucoup, ou des emojis rendus dans des styles légèrement différents).
- Le Twist : Dans chaque image, il y a un élément « majoritaire » (le normal) et quelques « exceptions » (les bizarres).
- Le Défi : L'IA doit jouer à un jeu où les règles changent à chaque fois, mais où l'image reste la même.
- Tour 1 : Comptez tous les bizarres.
- Tour 2 : Comptez uniquement les bizarres à l'intérieur d'une boîte spécifique.
- Tour 3 : Cliquez sur les bizarres à l'intérieur de cette boîte.
- Tour 4 : Cliquez sur les bizarres en dehors de cette boîte.
C'est comme jouer à un jeu de « Où est Charlie ? » où les règles changent de « Trouvez Charlie » à « Trouvez Charlie uniquement dans la cuisine » puis à « Touchez Charlie dans la cuisine ». L'image ne change pas, mais les instructions de l'IA changent.
3. Les Résultats : Le fossé entre « Compter » et « Cliquer »
Les résultats ont été surprenants :
- Les Humains : Presque parfaits. Si vous montriez la grille à un humain et lui demandiez de compter, puis de cliquer, il pourrait faire les deux avec une précision proche de 100 %.
- Les Modèles d'IA : Ils pouvaient généralement compter correctement (Perception). Mais lorsqu'on leur demandait de cliquer sur les endroits spécifiques (Action), ils échouaient souvent.
- Exemple : Un modèle pourrait dire correctement : « Il y a 3 stickers bizarres ». Mais lorsqu'on lui demande de cliquer sur ceux du coin supérieur gauche, il pourrait cliquer sur 3 stickers, incluant un qui est en fait en dehors du coin, ou il pourrait cliquer sur les 3 mauvais.
L'article montre que connaître la réponse n'est pas la même chose que pouvoir exécuter la réponse. L'IA reste « bloquée » sur l'image globale et oublie d'appliquer la règle locale (comme la boîte spécifique ou la zone d'exclusion).
4. Pourquoi cela arrive-t-il ?
Les chercheurs ont cherché à comprendre pourquoi l'IA échoue. Ce n'est pas seulement que l'IA est mauvaise en mathématiques ou qu'elle ne voit pas les pixels.
- Ce n'est pas une erreur de formatage : L'IA ne se contente pas de taper les mauvais mots. Elle choisit réellement les mauvaises coordonnées.
- C'est un problème de « Contexte » : L'IA a du mal à prendre une compréhension globale (« Je vois 3 choses bizarres ») et à la recalibrer pour un contexte spécifique (« Mais je ne veux que celles dans cette boîte bleue »).
- L'échec de l'« Ancrage » : Parfois, l'IA est « ancrée » au compte total. Si elle voit 3 choses bizarres au total, et que vous lui demandez celles dans une boîte, elle pourrait quand même essayer de cliquer sur 3 choses, même s'il n'y en a que 2 dans la boîte. Elle ne peut pas lâcher le chiffre d'origine.
5. La Conclusion
L'article conclut que, bien que l'IA devienne très douée pour voir et décrire le monde, elle éprouve encore des difficultés à agir sur ce monde avec précision lorsque les règles changent.
Pensez à un conducteur qui est excellent pour repérer un feu rouge à un kilomètre de distance (Perception), mais qui a du mal à freiner exactement au moment où le feu devient rouge, surtout s'il y a d'autres voitures ou des panneaux qui troublent la vue (Action).
Le benchmark ROSE est un nouvel outil conçu pour mesurer précisément ce fossé. Il aide les chercheurs à voir que pour que l'IA soit véritablement utile dans des tâches réelles (comme cliquer sur des boutons à l'écran ou naviguer dans une pièce), elle doit devenir meilleure pour prendre ce qu'elle voit et le transformer en le bon mouvement exact pour la situation actuelle.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.