← Nieuwste papers
💻 computer science

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

TIPSv2 is een nieuw model voor visueel-taalvoortraining dat de uitlijning van beeldpatches met tekst verbetert door een geavanceerde distillatie, een verbeterde iBOT++-objectief en efficiëntere trainingsstrategieën, wat leidt tot sterke prestaties op diverse downstream-taken.

Oorspronkelijke auteurs: Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washin
Gepubliceerd 2026-04-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washington Ramos, Krzysztof Choromanski, Mojtaba Seyedhosseini, Howard Zhou, André Araujo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een kunstenaar bent die foto's bekijkt en probeert te beschrijven wat erop te zien is. De kunstenaars van vandaag (de AI-modellen) zijn heel goed in het zeggen: "Dit is een foto van een hond." Maar als je vraagt: "Waar precies op de foto zit de hond, en waar zijn zijn oren en staart?", dan raken ze vaak in de war. Ze weten wat het is, maar niet precies waar het zit.

Dit is het probleem dat de onderzoekers van Google DeepMind in hun nieuwe paper, TIPSv2, proberen op te lossen. Ze hebben een manier bedacht om AI-modellen niet alleen te leren wat ze zien, maar ook precies te begrijpen waar de dingen zitten in de afbeelding, en dit te koppelen aan woorden.

Hier is hoe ze dat doen, vertaald in een simpel verhaal:

1. Het Probleem: De "Grote Meester" vs. de "Lerende Leerling"

In de wereld van AI is het vaak zo dat de grootste, krachtigste modellen (de "Grote Meesters") heel goed zijn in het begrijpen van een hele foto als één geheel. Maar als je ze vraagt om de details te beschrijven (bijvoorbeeld: "Waar zit de panda?"), presteren ze soms zelfs slechter dan kleinere modellen.

De onderzoekers ontdekten iets verrassends: toen ze een kleinere leerling lieten kijken naar de grote meester en probeerden de leerling te laten "nabootsen" (dit heet distillatie), werd de leerling plotseling heel goed in het koppelen van woorden aan specifieke plekken op de foto. De kleine leerling leerde de meester zelfs iets bij!

2. De Oplossing: iBOT++ (De "Alles-Kijker")

De oude methode om deze AI's te trainen was als een spelletje "Vind de vermomde stukjes". Je bedekte een groot deel van de foto (de "maskering") en vroeg de AI om te raden wat er onder zat. De AI leerde alleen kijken naar de bedekte stukjes.

De onderzoekers bedachten een nieuwe methode, iBOT++.

  • De oude methode: "Kijk alleen naar de bedekte stukjes en probeer die te raden."
  • De nieuwe methode (iBOT++): "Kijk naar alles! Naar de bedekte stukjes, maar ook naar de stukjes die je al kunt zien."

De analogie:
Stel je voor dat je een schilderij bekijkt.

  • De oude AI was als iemand die alleen naar de lege plekken op het canvas staart en probeert te raden wat er had moeten staan.
  • De nieuwe AI (TIPSv2) kijkt naar het hele schilderij, ook naar de kleuren en vormen die al duidelijk zichtbaar zijn. Door te leren van alles wat hij ziet, niet alleen van wat hij moet raden, wordt hij veel beter in het koppelen van woorden (zoals "poot" of "oog") aan de juiste plek op het schilderij.

3. Slimmer Leren: De "Hoofd-EMA"

Normaal gesproken gebruiken AI-modellen een trucje waarbij ze een "leraar" hebben die langzaam meebeweegt met de "leerling" om stabiel te blijven. Dit kost echter heel veel computerkracht en geheugen, alsof je twee identieke zware rugzakken moet dragen.

De onderzoekers bedachten een slimme truc: Hoofd-EMA.
In plaats van de hele zware rugzak (het hele model) te laten meebewegen, laten ze alleen de "hoofd" (de laatste stap waar het antwoord uitkomt) meebewegen.

  • Vergelijking: Het is alsof je een zware leraar hebt die je helpt. In plaats van dat de hele leraar meeloopt met je, laat je alleen zijn "hand" (de hoofd) meebewegen om je te corrigeren. Je bespaart hierdoor enorm veel energie (computergeheugen), maar je leert nog steeds net zo goed.

4. Rijkere Verhalen: Meerdere Soorten Bijschriften

Tot nu toe kregen de AI's vaak maar één soort beschrijving bij een foto, zoals een simpele titel ("Hond in park"). Soms was dat te vaag.
TIPSv2 gebruikt nu meerdere soorten verhalen tegelijk:

  1. Een simpele titel (van internet).
  2. Een iets gedetailleerdere beschrijving (gegenereerd door een andere AI).
  3. Een heel rijk, creatief verhaal (gegenereerd door de slimme Google Gemini AI).

De analogie:
Stel je voor dat je een foto van een panda ziet.

  • De ene beschrijving zegt: "Panda".
  • De andere zegt: "Panda die op een tak ligt".
  • De derde zegt: "Een schattige baby-panda die in 2004 in de Bronx Zoo op een tak slaapt, met zijn pootjes bungelend".

Door de AI te laten oefenen met al deze verschillende niveaus van detail, wordt hij veel robuuster. Hij leert niet alleen dat het een panda is, maar ook hoe hij eruitziet, waar hij zit en wat hij doet.

Wat levert dit op?

Door deze drie trucjes samen te voegen (kijken naar alles, niet alleen naar wat ontbreekt; slimme geheugenbesparing; en rijke verhalen), is TIPSv2 ontstaan.

  • Resultaat: De AI kan nu heel precies aangeven waar dingen zijn op een foto, zelfs zonder dat hij daar ooit voor is getraind (dit heet "zero-shot").
  • Voorbeeld: Als je vraagt "Waar is de hond?", kan de AI de hond precies omcirkelen op de foto, terwijl oudere modellen vaak de hele foto als één blok zagen.

Kortom: TIPSv2 is een nieuwe generatie AI die niet alleen "weet" wat ze ziet, maar ook precies "weet" waar het zit, en dat doet ze op een manier die veel minder computerkracht kost dan voorheen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →