← Nieuwste papers
🤖 AI

Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval

Deze studie toont aan dat frontier LLM's zoals GPT-4.1 en Claude Sonnet 4.6 een retrieval-prestatie leveren die gelijkwaardig is aan Google's native multimodale Gemini Embedding 2 op Flickr30k, hoewel de laatste superieur blijft voor toepassingen met een lage latentie vanwege vooraf berekenbare embeddings.

Oorspronkelijke auteurs: Archan Dutta, Vyanktesh Kanungo

Gepubliceerd 2026-08-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Archan Dutta, Vyanktesh Kanungo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een specifieke naald in een enorme, chaotische hooiberg te vinden. Maar hier is de twist: de naald is niet zomaar een stuk metaal; het is een afbeelding, en je beschrijft deze met woorden. Dit is de wereld van multimodale retrieval, een tak van de computerwetenschap waar machines leren om te verbinden wat ze zien (afbeeldingen) met wat ze lezen (tekst). Jarenlang was de standaardmanier om dit te doen het bouwen van twee aparte "hersenen": één die tekst leest en dit omzet in een geheime code, en een andere die naar foto's kijkt en deze omzet in een andere geheime code. De computer probeert vervolgens deze twee codes met elkaar te matchen, alsof je probeert een vierkante pen in een rond gat te passen door heel hard te knijpen met je ogen.

Onlangs zijn er twee nieuwe supertools de arena binnengekomen. Ten eerste zijn er de Frontier Large Language Models (LLMs). Denk aan deze als ongelooflijk slimme, alwetende bibliothecarissen die naar een stapel van 25 foto's en een enkele zin kunnen kijken, en dan direct elke foto kunnen lezen, ze met elkaar kunnen vergelijken en de beste match kunnen kiezen. Ten tweede zijn er de Natively Multimodal Embeddings. Dit zijn als een universele vertaler die vanaf het begin vloeiend zowel "Afbeelding" als "Tekst" spreeelt, door alles om te zetten in een enkele, verenigde geheime code zonder dat er twee aparte hersenen met elkaar hoeven te communiceren. De grote vraag die iedereen zich stelt is: hebben we de super-slimme bibliothecaris nodig om elke foto te bekijken en te vergelijken, of is de universele vertaler snel en nauwkeurig genoeg om de klus alleen te klaren? Dit is belangrijk omdat als de bibliothecaris te traag is, je hem niet kunt gebruiken voor real-time apps, zoals het doorzoeken van je fotogalerij terwijl je over straat loopt.

Dit artikel zet een race met hoge inzet uit tussen deze twee benaderingen met behulp van een dataset genaamd Flickr30k, die 31.000 afbeeldingen bevat met door mensen geschreven beschrijvingen. Om de race echt eerlijk en moeilijk te maken, hebben de onderzoekers niet zomaar willekeurige foto's naar de modellen gegooid. Ze creëerden "harde negatieven" — foto's die erg lijken op het juiste antwoord maar net niet helemaal kloppen, ontworpen om zelfs de slimste systemen te misleken. Ze testten vier zwaargewichten: Gemini Embedding 2 en Amazon Nova 2 (de universele vertalers) tegenover GPT-4.1 en Claude Sonnet 4.6 (de super-slimme bibliothecarissen).

De resultaten waren een schok voor de snelheidskampioenen, maar een opluchting voor de nauwkeurigheidsfans. Wanneer het aankwam op het vinden van het juiste antwoord, lagen de universele vertalers en de super-slimme bibliothecarissen nek aan nek. De studie toonde aan dat Gemini Embedding 2, GPT-4.1 en Claude Sonnet 4.6 statistisch gezien hetzelfde presteerden. Ze waren zo dicht bij elkaar dat je ze op basis van nauwkeurigheid alleen niet van elkaar kon onderscheiden; ze slaagden er allemaal in om de juiste afbeelding ongeveer 80% van de tijd te kiezen in deze lastige scenario's. Het artikel weerlegt expliciet het idee dat de bibliothecarissen superieur zijn in nauwkeurigheid, en laat zien dat de nieuwe embedding-modellen net zo scherp zijn in het vinden van de juiste naald in de hooiberg. Eén model, Amazon Nova 2, bleef echter achter en vond het juiste antwoord ongeveer 13 procentpunt minder vaak, waarschijnlijk omdat het was ingesteld op algemene taken in plaats van dit specifieke type beeldzoekopdrachten.

Maar het echte verhaal gaat niet alleen over wie de race om nauwkeurigheid wint; het gaat over wie de marathon volbrengt. Hier splitsen de twee benaderingen zich radicaal af. De super-slimme bibliothecarissen (LLM's) moeten voor elke vraag naar elke foto in de groep kijken. De paper mat dit en stelde vast dat het rangschikken van 1.000 queries de bibliothecarissen meer dan 6.100 seconden (voor GPT-4.1) en 9.415 seconden (voor Claude Sonnet 4.6) kostte. Dat zijn uren wachten. In contrast hiermee werken de universele vertalers (embedding-modellen) anders. Ze kunnen de geheime codes voor alle foto's één keer vooraf berekenen, zoals het voorzien van elke boek in een bibliotheek met een streepjescode voordat je überhaupt binnenloopt. Zodra deze "pre-computatie" voltooid was, duurde het vinden van de juiste foto voor 1.000 queries minder dan 2 seconden.

De auteurs concluderen dat hoewel de super-slimme bibliothecarissen briljant zijn in redeneren en het zij-aan-zij vergelijken van afbeeldingen, de universele vertalers de duidelijke winnaars zijn voor alles dat direct moet gebeuren. Als je een app bouwt waarbij een gebruiker een grote collectie afbeeldingen in een oogwenk moet kunnen doorzoeken, zijn de embedding-modellen de betere keuze. De bibliothecarissen zijn nog steeds nuttig als je fotocollectie elke seconde verandert of erg klein is, waardoor de pre-computatiestap nutteloos wordt, maar voor snelheid en schaalbaarheid hebben de nieuwe embedding-modellen bewezen dat ze de nauwkeurigheid van de reuzen kunnen evenaren terwijl ze duizend keer sneller zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →