UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp
Le papier introduit UNIBROWSE, un nouveau cadre de données-vers-agent qui génère des données d'entraînement exhaustives couvrant les trois modèles de flux d'informations de navigation multimodale et emploie un apprentissage par renforcement sensible à l'exploration pour entraîner un agent de l'échelle 35B qui atteint des performances de pointe sur les benchmarks multimodaux de BrowseComp, surpassant de manière significative à la fois son modèle de base et les principaux agents à code source fermé.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous soyez un détective tentant de résoudre un mystère, mais qu'au lieu de simplement lire quelques indices sur un carnet de notes, vous deviez naviguer entre une bibliothèque, un album photo et un flux d'actualités en direct pour trouver la réponse. C'est ce qu'est une tâche « Multimodal BrowseComp » : un puzzle super difficile où un agent IA doit lire du texte, regarder des images et utiliser des outils de recherche pour assembler une solution qui ne se trouve pas simplement sur une seule page web.
Pendant longtemps, les détectives IA que nous entraînions étaient un peu à sens unique. Ils étaient excellents pour lire des indices textuels ou regarder une image puis lire du texte pour trouver une réponse (comme voir la photo d'un chien et chercher « quelle est la race de ce chien ? »). Mais ils étaient terribles pour l'inverse : lire du texte pour comprendre ce qu'il faut chercher dans une image (comme lire la description d'un bâtiment étrange, puis chercher une photo pour confirmer sa forme).
La grande découverte : le détective « UniBrowse »
Les chercheurs derrière ce papier, une équipe de l'Université de Pékin, ont construit un nouveau système d'entraînement appelé UNIBROWSE. Considérez cela comme un camp d'entraînement super intelligent qui enseigne enfin aux agents IA comment gérer les trois types de indices :
- Texte uniquement : Juste lire et connecter des faits.
- Image vers Texte : Partir d'une photo et trouver l'histoire.
- Texte vers Image : Lire une histoire d'abord, puis partir à la chasse à la photo correspondante pour la prouver.
Avant cela, la plupart des camps d'entraînement ne couvraient que les deux premiers types. Les auteurs soutiennent qu'ignorer le troisième type (Texte vers Image) laisse l'IA « sous-entraînée » pour des scénarios du monde réel où il faut vérifier un fait visuellement après l'avoir lu. Ils ont également remarqué que les méthodes précédentes étaient comme essayer d'apprendre en errant au hasard dans une ville (ce qui mène à beaucoup de bruit et de faux chemins) ou en regardant seulement une carte parfaite et factice (qui ne correspond pas au monde réel désordonné). UNIBROWSE corrige cela en partant d'une « carte » solide (un graphe de connaissances) mais en envoyant ensuite l'IA chercher des preuves réelles et en temps réel sur l'internet actuel pour s'assurer que les indices sont authentiques.
Le filtre d'« Exploration » : Couper le superflu
C'est la partie ingénieuse : les chercheurs ont réalisé que tous les problèmes d'entraînement ne sont pas égaux. Certains problèmes n'ont qu'une seule façon ennuyeuse de les résoudre, tandis que d'autres forcent l'agent à essayer différents chemins, à revenir en arrière et à réessayer.
Pour corriger cela, ils ont inventé une nouvelle métrique appelée « degré d'exploration ». Imaginez que vous notez les devoirs d'un élève. Si tous les élèves résolvent le problème de mathématiques exactement de la même manière facile, on n'apprend pas grand-chose. Mais si certains élèves cherchent un raccourci, d'autres restent bloqués et reviennent en arrière, et quelques-uns trouvent un nouveau chemin astucieux, c'est là que le véritable apprentissage se produit.
L'équipe a utilisé ce « degré d'exploration » pour filtrer leurs données. Ils ont jeté les problèmes ennuyeux à chemin unique et ont conservé uniquement les 30 % des questions les plus « exploratoires ». Cela a rendu leur Apprentissage par Renforcement (la partie où l'IA apprend par essais et erreurs) beaucoup plus efficace, en se concentrant uniquement sur les puzzles qui apprennent réellement à l'agent à réfléchir profondément.
Les résultats : Un nouveau champion
En utilisant ce pipeline, ils ont construit un agent IA de 35 milliards de paramètres (un cerveau très large). Ils n'ont pas seulement deviné que cela fonctionnerait ; ils ont mesuré ses performances par rapport à cinq benchmarks difficiles.
Les résultats sont impressionnants. Leur nouvel agent, UniBrowse, a obtenu une précision moyenne de 54,4 sur ces tests.
- C'est un bond de 10,5 points par rapport à son modèle de base (Qwen3.5-35B-A3B), qui commençait à 43,9.
- Il a battu plusieurs géants « propriétaires » célèbres (comme GPT-5 et Gemini-2.5 Pro) qui ont obtenu respectivement environ 42,9 et 44,8.
- Il a même surpassé d'autres modèles open-source comme Kimi K2.5 (50,8).
Ce qu'ils ne prétendent pas
Il est important de savoir ce que ce papier ne dit pas. Les auteurs précisent avec prudence que, bien qu'UniBrowse soit le meilleur agent open-source qu'ils aient vu, il n'a toujours pas battu les systèmes propriétaires les plus puissants (comme Gemini-3.1 Pro, qui a atteint 63,2). Ils admettent également que leur agent est limité à la navigation web publique avec du texte et des images ; il ne peut pas encore gérer les sites web interactifs, les vidéos ou les cartes. Ils suggèrent que des modèles plus grands et de meilleurs outils pourraient être nécessaires pour combler cet écart restant, mais ils ne prétendent pas avoir résolu tout le problème de la navigation par IA.
L'essentiel
En construisant un système d'entraînement qui couvre les trois types de indices (texte, image vers texte, et texte vers image) et en filtrant les problèmes d'entraînement ennuyeux, l'équipe UNIBROWSE a créé un agent IA nettement meilleur pour résoudre des mystères complexes à plusieurs étapes sur Internet. C'est une étape solide, prouvant que la façon dont vous entraînez un agent compte tout autant que la taille de son cerveau.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.