← Derniers articles
🤖 AI

MELLON - Multimodal Enhanced LLM for Online Navigation

L'article présente MELLON, un cadre multimodal qui améliore considérablement les performances des agents de navigation web sur le benchmark WebShop en alignant le texte et les images pour améliorer le raisonnement et la planification, atteignant une augmentation de précision de 9,26 % après seulement un époch d'entraînement.

Auteurs originaux : Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

Publié 2026-08-11
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot comment faire des courses sur Internet. Vous pourriez vous dire : « Donnez-lui simplement les instructions textuelles, comme "acheter une chemise rouge", et il lira le site web et cliquera sur les boutons. » Mais voici le hic : les sites web ne sont pas seulement des murs de texte. Ce sont des lieux visuels et colorés, remplis d'images, de mises en page et de designs. Si vous demandez à un humain de trouver une paire de chaussures spécifique, il ne se contente pas de lire la description ; il regarde la photo pour voir la couleur, le style et la forme. Pendant longtemps, les programmes informatiques les plus intelligents essayant de naviguer sur le web étaient comme des acheteurs aveugles — ils pouvaient lire le texte parfaitement mais ne pouvaient pas « voir » les images. Ce document s'inscrit dans le monde de l'intelligence artificielle, et plus précisément dans celui des « agents de navigation web ». Ce sont des assistants numériques conçus pour comprendre des commandes en langage naturel et accomplir des tâches sur de vrais sites web, comme acheter des articles ou réserver des billets. La grande question que se posent les chercheurs est la suivante : pouvons-nous apprendre à ces agents à utiliser à la fois leurs « yeux » (pour voir les images) et leur « cerveau » (pour lire le texte) en même temps, tout comme les humains le font ?

Les chercheurs derrière cette étude, travaillant sur un projet appelé MELLON, ont décidé de tester cette idée sur une boutique en ligne simulée appelée WebShop. Ils voulaient voir si le fait de donner à un agent IA une vue des photos des produits, aux côtés des descriptions textuelles, l'aiderait à prendre de meilleures décisions. Ils n'ont pas seulement deviné ; ils ont construit trois outils expérimentaux différents pour tenter de résoudre l'énigme. Le premier, et le plus réussi, était MELLON lui-même. Considérez MELLON comme un acheteur super intelligent qui porte des lunettes spéciales capables de traduire le monde visuel en un langage que le cerveau de l'IA peut comprendre. L'équipe a constaté qu'en entraînant cet agent pendant un seul cycle d'apprentissage (un « epoch »), il devenait nettement meilleur dans sa tâche. Plus précisément, la précision de l'accomplissement des tâches a bondi de 9,26 % par rapport à une version de base qui ne regardait que le texte. Cela suggère que mélanger la vision et le texte est un moyen puissant d'aider l'IA à naviguer sur le web, même si le système traverse encore des phases de croissance.

Cependant, l'histoire n'est pas une simple victoire du « le multimodal est toujours meilleur ». L'équipe a également essayé deux autres approches créatives qui n'ont pas fonctionné aussi bien qu'espéré. Une idée consistait à traiter la tâche d'achat comme un jeu de « Questions-Réponses Visuelles » (VQAgent), où l'IA regarde une image et une question, puis choisit la bonne réponse. Ils pensaient que cela fonctionnerait car faire des courses est similaire à répondre à des questions sur des images. Mais ils ont découvert que dans le contexte désordonné et réel de WebShop, les descriptions textuelles contenaient des indices plus importants que les images. C'est comme si l'IA avait été entraînée à compter excessivement sur les images, et qu'elle se retrouvait confuse lorsque le texte était la véritable clé de la solution. C'est comme essayer de résoudre une énigme en fixant un dessin alors que la réponse est cachée dans les petits caractères.

La troisième tentative impliquait un « Classeur Multimodal » (Multimodal Ranker), un outil conçu pour que l'agent fasse une pause et compare soigneusement chaque article d'une page avant de faire un choix, plutôt que de simplement saisir la première chose qu'il voit. L'espoir était que ce temps de réflexion supplémentaire conduirait à de meilleurs résultats. Au lieu de cela, l'expérience a montré que cette prudence supplémentaire rendait l'agent plus lent et moins précis. Les chercheurs ont constaté que les outils utilisés pour mesurer la similitude entre les images et le texte (appelés scores BERT et CLIP) ne correspondaient pas bien à ce qui faisait réellement un « bon assortiment » dans le système de score du jeu. Il s'est avéré que tenter de classer chaque option était comme un acheteur passant une heure à comparer chaque chemise du magasin, pour finalement acheter la mauvaise parce qu'il a été submergé.

Alors, quelle est la conclusion finale de cette aventure de shopping numérique ? Le document suggère que, bien que donner aux agents d'IA la capacité de « voir » le web soit une voie prometteuse, ce n'est pas une baguette magique. L'agent MELLON a prouvé qu'aligner les images et le texte peut booster les performances, mais les autres expériences ont montré que simplement ajouter un raisonnement visuel plus complexe ou forcer l'agent à tout regarder n'est pas toujours la bonne stratégie. Les chercheurs concluent que nous devons continuer à explorer comment mieux mélanger ces indices visuels et textuels, peut-être en entraînant les agents plus longtemps ou en utilisant des « cerveaux » encore plus intelligents (modèles de langage étendus ou LLM) à l'avenir. Pour l'instant, ils ont montré qu'un peu de vision aide beaucoup, mais que l'IA doit encore apprendre quand regarder l'image et quand lire les petits caractères.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →