Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval
Cette étude démontre que les LLM de pointe comme GPT-4.1 et Claude Sonnet 4.6 atteignent des performances de recherche équivalentes à celles de l'embedding multimodal natif Gemini 2 de Google sur Flickr30k, bien que ce dernier demeure supérieur pour les applications à faible latence grâce aux embeddings précalculables.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez de trouver une aiguille spécifique dans une botte de foin massive et chaotique. Mais voici le rebondissement : l'aiguille n'est pas seulement un morceau de métal ; c'est une image, et vous la décrivez avec des mots. C'est le monde de la recherche multimodale, une branche de l'informatique où les machines apprennent à relier ce qu'elles voient (des images) à ce qu'elles lisent (du texte). Pendant des années, la méthode standard pour faire cela consistait à construire deux « cerveaux » distincts : un qui lit le texte et le transforme en un code secret, et un autre qui regarde les images et les transforme en un code secret différent. L'ordinateur tente ensuite de faire correspondre ces deux codes, comme si l'on essayait de faire entrer un pion carré dans un trou rond en plissant très fort les yeux.
Récemment, deux nouveaux super-outils sont entrés dans l'arène. Premièrement, il y a les Grands Modèles de Langage (LLM) de pointe. Considérez-les comme des bibliothécaires incroyablement intelligents et omniscients qui peuvent regarder un tas de 25 photos et une seule phrase, puis lire instantanément chaque photo, les comparer entre elles et choisir la meilleure correspondance. Deuxièmement, il y a les Plongements (Embeddings) Nativement Multimodaux. Ce sont comme des traducteurs universels qui parlent couramment à la fois l'« Image » et le « Texte » dès le départ, transformant tout en un code secret unique et unifié sans avoir besoin que deux cerveaux séparés se parlent. La grande question que tout le monde se pose est la suivante : avons-nous besoin du bibliothécaire super intelligent pour lire chaque photo et les comparer, ou le traducteur universel est-il assez rapide et précis pour faire le travail seul ? Cela importe car si le bibliothécaire est trop lent, vous ne pouvez pas l'utiliser pour des applications en temps réel, comme rechercher des photos dans votre galerie pendant que vous marchez dans la rue.
Ce document met en place une course à enjeux élevés entre ces deux approches en utilisant un ensemble de données appelé Flickr30k, qui contient 31 000 images accompagnées de descriptions écrites par des humains. Pour rendre la course vraiment équitable et difficile, les chercheurs n'ont pas simplement jeté des photos aléatoires aux modèles. Ils ont créé des « négatifs difficiles » — des photos qui ressemblent beaucoup à la bonne réponse mais qui ne sont pas tout à fait exactes, conçues pour tromper même les systèmes les plus intelligents. Ils ont testé quatre poids lourds : Gemini Embedding 2 et Amazon Nova 2 (les traducteurs universels) contre GPT-4.1 et Claude Sonnet 4.6 (les bibliothécaires super intelligents).
Les résultats ont été un choc pour les sprinteurs, mais un soulagement pour les défenseurs de la précision. Lorsqu'il s'agissait d'obtenir la bonne réponse, les traducteurs universels et les bibliothécaires super intelligents étaient au coude-à-coude. L'étude a révélé que Gemini Embedding 2, GPT-4.1 et Claude Sonnet 4.6 affichaient des performances statistiquement identiques. Ils étaient si proches qu'on ne pouvait pas les distinguer sur la seule base de la précision ; ils parvenaient tous à choisir l'image correcte environ 80 % du temps dans ces scénarios délicats. Le document écarte explicitement l'idée que les bibliothécaires soient nettement supérieurs en termes de précision, montant que les nouveaux modèles de plongement sont tout aussi affûtés pour trouver la bonne aiguille dans la botte de foin. Cependant, un modèle, Amazon Nova 2, a pris du retard, trouvant la bonne réponse environ 13 points de pourcentage moins souvent, probablement parce qu'il était configuré pour des tâches générales plutôt que pour ce type spécifique de recherche d'images.
Mais la véritable histoire ne concerne pas seulement qui gagne la course de la précision ; il s'agit de savoir qui termine le marathon. C'est ici que les deux approches divergent radicalement. Les bibliothécaires super intelligents (LLM) doivent regarder chaque photo du groupe pour chaque question. L'étude a mesuré cela et a constaté que classer 1 000 requêtes prenait aux bibliothécaires plus de 6 100 secondes (pour GPT-4.1) et 9 415 secondes (pour Claude Sonnet 4.6). C'est des heures d'attente. En revanche, les traducteurs universels (modèles de plongement) fonctionnent différemment. Ils peuvent pré-calculer les codes secrets pour toutes les photos une seule fois, comme si l'on tamponnait le code-barres de chaque livre d'une bibliothèque avant même que vous n'entriez. Une fois que cette « pré-computation » est terminée, trouver la bonne photo pour 1 000 requêtes a pris aux modèles de plongement moins de 2 secondes.
Les auteurs concluent que, bien que les bibliothécaires super intelligents soient brillants pour le raisonnement et la comparaison d'images côte à côte, les traducteurs universels sont les grands vainqueurs pour tout ce qui doit se produire instantanément. Si vous construisez une application où un utilisateur doit rechercher dans une grande collection d'images en un clin d'œil, les modèles de plongement sont le meilleur choix. Les bibliothécaires restent utiles si votre collection de photos change chaque seconde ou est très petite, rendant l'étape de pré-calcul inutile, mais pour la vitesse et l'échelle, les nouveaux modèles de plongement ont prouvé qu'ils pouvaient égaler la précision des géants tout en étant mille fois plus rapides.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.