SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation
SearchEyes introduit un monde de recherche simulé unifié, fondé sur un graphe de connaissances typé qui intègre les données, l'environnement et les signaux de récompense à travers des chaînes Perception-Connaissance et une optimisation de politique ancrée par sauts (Hop-Anchored Policy Optimization), permettant des performances de raisonnement multi-sauts de pointe pour les agents de recherche multimodaux sans dépendre de moteurs externes ou de modèles de récompense distincts.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'enseigner à un robot très intelligent comment résoudre un mystère complexe. Le robot doit regarder une image, lire des documents et relier les points pour trouver une réponse. C'est ce que l'article appelle un « agent de recherche multimodal ».
Cependant, les auteurs de cet article, SearchEyes, ont découvert que la façon dont nous enseignons habituellement aux robots est défaillante. C'est comme essayer d'apprendre à quelqu'un à conduire en lui donnant une carte, une voiture et un examen de conduite, mais en s'assurant qu'aucun des trois ne correspond.
- La Carte (Données d'entraînement) : Vous lui donnez une liste de questions et de réponses, mais vous jetez les étapes du « mode d'emploi ».
- La Voiture (Environnement) : Vous le laissez conduire sur une route publique réelle et imprévisible (l'internet réel) où les feux de signalisation peuvent changer ou la route peut disparaître.
- Le Test (Récompenses) : Vous lui dites seulement « Bon travail » ou « Mauvais travail » à la toute fin. S'il a fait une erreur à l'étape 1, mais qu'il a eu de la chance à l'étape 10, il recevra quand même un « Bon travail ». Il n'apprend jamais où il s'est trompé.
SearchEyes corrige cela en construisant une simulation parfaite et autonome où la carte, la voiture et le test sont tous construits à partir du même plan.
Voici comment ils ont procédé, en utilisant des analogies simples :
1. Le Plan : Un graphe de connaissances « typé »
Au lieu d'utiliser l'internet réel et désordonné, l'équipe a construit une immense bibliothèque de faits organisée appelée Graphe de Connaissances. Considérez cela comme un immense arbre généalogique de l'information mondiale, mais avec des règles strictes :
- Chaque personne (entité) possède une photo, une biographie et une liste de relations.
- Ils ne conservent que les personnes « célèbres » qui possèdent les trois (photo, bio et connexions) afin que le robot puisse s'exercer à regarder des images et à lire du texte.
2. Le Parcours d'Entraînement : « Chaînes Perception-Connaissance » (PKC)
Pour entraîner le robot, ils n'ont pas simplement écrit des questions au hasard. Ils ont utilisé une recette spéciale appelée Chaînes Perception-Connaissance (PKC).
- L'Analogie : Imaginez une chasse au trésor où vous devez alterner entre l'observation d'une photo et la lecture d'un indice.
- Étape 1 (Perception) : « Regardez cette photo d'un homme. Qui est-il ? » (Le robot doit identifier la personne à partir de l'image).
- Étape 2 (Connaissance) : « Maintenant, cherchez pour quelle équipe il a joué. » (Le robot doit effectuer une recherche textuelle).
- Étape 3 (Perception) : « Trouvez une photo du stade où joue cette équipe. »
- La Magie : Le système génère ces questions automatiquement tout en gardant une « feuille de triche » (le chemin exact des faits) cachée en arrière-plan. Cela garantit que le robot doit emprunter le long chemin multi-étapes pour résoudre l'énigme, plutôt que de deviner la réponse immédiatement.
3. Le Simulateur de Conduite : Un « Monde de Recherche Autonome »
Dans le monde réel, si vous demandez quelque chose à un moteur de recherche, les résultats peuvent changer demain. Dans le monde de SearchEyes, le « moteur de recherche » est en réalité une immense base de données préchargée de la bibliothèque qu'ils ont construite.
- Le Bénéfice : C'est 100 % reproductible. Si le robot cherche « Cristiano Ronaldo », il obtiendra toujours exactement les mêmes 5 premiers résultats. Cela élimine le chaos de l'internet réel, permettant au robot d'apprendre la logique de la recherche sans être distrait par des liens brisés ou des sites web changeants.
4. Le Coach : Feedback « Ancré sur les Étapes » (HaPO)
C'est l'innovation la plus importante. Dans un entraînement normal, le coach dit seulement « Tu as trouvé la bonne réponse ! » à la toute fin.
- Le Problème : Si le robot a pris 10 étapes pour y arriver, le coach ne sait pas quelle étape était brillante et laquelle était un coup de chance.
- La Solution SearchEyes : Comme ils ont conservé la « feuille de triche » (le chemin exact des faits), ils peuvent agir comme un coach qui observe chaque étape.
- « Bon travail pour avoir trouvé la photo du stade à l'étape 3 ! »
- « Oups, tu as choisi la mauvaise équipe à l'étape 2. Réessayons. »
- La Métaphore : Au lieu de noter l'examen entier avec un seul score, ils donnent une note pour chaque question de l'examen. Cela aide le robot à apprendre beaucoup plus vite car il sait exactement où s'améliorer.
Les Résultats
Lorsqu'ils ont testé cette nouvelle méthode (appelée SearchEyes) sur six tests différents impliquant des images et du texte :
- Elle a battu tous les autres robots open-source qui tentent de faire la même chose.
- Leur plus petit robot (27 milliards de « cellules cérébrales ») a été plus performant que des robots beaucoup plus grands et coûteux issus de grandes entreprises technologiques.
- Cela a prouvé qu'en donnant au robot un monde d'entraînement structuré, étape par étape, et un feedback précis, vous n'avez pas besoin d'un supercalculateur massif pour obtenir d'excellents résultats.
En bref : SearchEyes a cessé d'essayer d'enseigner aux robots en les jetant dans le chaos de l'internet réel. À la place, ils ont construit une salle de sport d'entraînement parfaite et contrôlée où le robot pratique des compétences spécifiques, est noté à chaque mouvement et apprend à résoudre des mystères visuels complexes avec une efficacité incroyable.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.