← Nieuwste papers
💻 computer science

Training-Free Pseudo-Fusion for Composed Image Retrieval with Diffusion Models and Multimodal Large Language Models

Dit artikel introduceert PeFuse, een training-vrij framework voor Composed Image Retrieval dat vooraf getrainde Diffusiemodellen en Multimodale Grote Taalmodellen benut om compositionele queries via generatieve conversie om te zetten naar single-modality retrieval-taken, waarmee competitieve prestaties worden behaald zonder specifieke taakgerichte training.

Oorspronkelijke auteurs: Fan Xu, Luis A. Leiva

Gepubliceerd 2026-08-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Fan Xu, Luis A. Leiva

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je door een enorme digitale bibliotheek loopt waar elk boek een afbeelding is. Traditionele zoekmachines laten je een plaatje vinden door een andere afbeelding te tonen, maar ze hebben moeite wanneer je wilt zeggen: "Laat me diezelfde jurk zien, maar dan in het rood en met lange mouwen." Deze specifieke uitdaging, bekend als composed image retrieval, vraagt computers om een verzoek te begrijpen dat een visuele referentie combineert met een tekstuele instructie. Jarenlang vereiste het oplossen hiervan het bouwen van aangepaste, complexe software die moeizaam getraind moest worden op enorme hoeveelheden gelabelde gegevens. Als de gegevens veranderden of het verzoek te specifiek werd, faalden deze systemen vaak. Onderzoekers zochten al lang naar een manier om deze zoekopdrachten te laten werken zonder dat daar zware, aangepaste training voor nodig was, in de hoop een systeem te creëren dat elke nieuwe opdracht onmiddellijk kan begrijpen, simpelweg door gebruik te maken van de krachtige hulpmiddelen die het al bezit.

Een team onderzoekers aan de Universiteit van Luxemburg heeft nu een manier gedemonstreerd om dit te bereiken zonder enige nieuwe training. Ze ontwikkelden een methode genaamd PeFuse, die fungeert als een slimme vertaler tussen de visuele en de tekstuele werelden. In plaats van te proberen een computer vanaf nul te leren hoe hij een afbeelding en een zin samen moet voegen, gebruikt hun systeem twee bestaande, vooraf getrainde kunstmatige intelligentie-tools om het verzoek volledig te herschrijven. De ene tool, een multimodale groot taalmodel, is uitzonderlijk goed in het lezen van afbeeldingen en het schrijven van beschrijvingen. De andere, een diffusiemodel, is een krachtige beeldgenerator die nieuwe afbeeldingen kan creëren op basis van tekst. De onderzoekers ontdekten dat door deze tools te gebruiken om een gemengd verzoek om te zetten in één enkele, pure vorm—ofwel het hele verzoek om te zetten in een nieuwe afbeelding of in een gedetailleerde tekstuele beschrijving—ze het resultaat konden aansluiten bij standaard zoekmachines die hier oorspronkelijk niet voor ontworpen waren.

De onderzoekers testten deze aanpak op verschillende standaard datasets met modeartikelen, foto's uit de algemene context en complexe scènes. Ze ontdekten dat de meest effectieve strategie was om het gemengde verzoek om te zetten in een tekstuele beschrijving en vervolgens te zoeken naar afbeeldingen die bij die tekst pasten. In dit scenario leest het taalmodel de referentiefoto en de instructie van de gebruiker, en schrijft vervolgens een nieuwe, precieze zin die precies vangt wat de gebruiker zoekt. Deze nieuwe zin wordt vervolgens ingevoerd in een standaard beeldzoekmachine. Verrassend genoeg werkte deze eenvoudige vertaalstap beter dan het genereren van een nieuwe afbeelding vanuit het verzoek en het zoeken naar vergelijkbare plaatjes. Hoewel het beeldgeneratietool nieuwe afbeeldingen kon creëren, bevatten die afbeeldingen vaak subtiele, onnatuurlijke gebreken die de zoekmachine in verwarring brachten. De tekstuele beschrijvingen bleven echter helder en semantisch accuraat, waardoor de zoekmachine de juiste matches met hoge precisie kon vinden.

De studie onderzocht ook wat er gebeurt wanneer het systeem het omgekeerde probeert te doen: het omzetten van de doelafbeeldingen in de database naar tekst om te matchen met het verzoek van de gebruiker. Hoewel dit beter werkte dan het direct matchen van afbeeldingen tegen afbeeldingen, bleef het achter bij de tekst-naar-beeld aanpak. De onderzoekers ontdekten dat de kwaliteit van het uiteindelijke zoekresultaat sterk afhankelijk was van de specifieke tools die werden gekozen. Zo verbeterde het gebruik van een groter, krachtiger taalmodel de resultaten over het algemeen, hoewel de winst soms klein was. Ze onderzochten ook hoe verschillende instellingen van de beeldgenerator de uitkomst beïften, waarbij ze ontdekten dat het gebruik van te veel stappen om een afbeelding te genereren of het proberen te dwingen van de afbeelding om te veel op de originele referentie te lijken, de zoekprestaties juist verslechterde. Het ideale punt was een modaal aantal stappen en een lage instelling voor hoe strikt de generator zich aan de originele afbeelding hield, waardoor er genoeg vrijheid was om de nieuwe tekstuele instructies te incorporeren.

Wat dit werk bijzonder significant maakt, is dat het geen nieuwe data vereist en geen hertraining van de onderliggende modellen nodig heeft. Het systeem is volledig "training-vrij", wat betekent dat het onmiddellijk kan worden ingezet op nieuwe datasets of in nieuwe domeinen zonder de maanden aan voorbereiding die gewoonlijk vereist zijn. De onderzoekers toonden aan dat door deze bestaande tools simpelweg aan elkaar te koppelen, zij de prestaties van complexe systemen die specifiek voor deze taak getraind waren, konden evenaren of zelfs overtreffen. Dit suggereert dat de toekomst van deze technologie wellicht niet ligt in het bouwen van grotere, gespecialiseerde modellen, maar in het vinden van slimmere manieren om de krachtige, algemene tools die we al hebben te gebruiken. Door het probleem te behandelen als een vertaaltaak in plaats van een fusietaken, hebben de onderzoekers een pad geopend voor meer flexibele en aanpasbare beeldzoeksystemen die menselijke intentie kunnen begrijpen zonder dat ze vanaf de grond af aan moeten worden onderwezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →