← Nieuwste papers
🤖 AI

Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

Dit artikel introduceert "Analysis-by-Proxy", een framework dat onthult hoe Vision-Language Models die worden gebruikt als conditionele encoders voor beeldbewerking er niet in slagen om cruciale lokalisatiesignalen te propageren in een enkele forward pass, aangezien deze ruimtelijke representaties verborgen blijven in tussenliggende lagen in plaats van de vooraf gedefinieerde conditioningpunten te bereiken die door huidige pipelines worden gebruikt.

Oorspronkelijke auteurs: Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik

Gepubliceerd 2026-07-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Het "Slimme" Model versus de "Onhandige" Redacteur

Stel je voor dat je een briljante, hoogopgeleide architect hebt (het Vision-Language Model, of VLM). Deze architect is geweldig in het bekijken van een foto en een geschreven instructie zoals: "Verwijder de bij op de bovenkant van de zonnebloem," en weet direct precies waar die bij zich bevindt. Als je de architect vraagt om het aan te wijzen, heeft hij het in 89% van de gevallen goed.

Echter, wanneer je deze architect inhuurt als voorman voor een bouwploeg (de Image Editing Pipeline), gaat het mis. De voorman vertelt de ploeg: "Ga de bij repareren," maar de ploeg eindigt met het verven van de verkeerde bloem, het verwijderen van de hele zonnebloem, of het hallucineren van een bij die er niet was. De ploeg krijgt het slechts in 57% van de gevallen goed.

Het Mysterie: Waarom weet de architect het antwoord perfect, maar faalt de bouwploeg zo erg?

De Hypothese van het Papier: De "Eénrichtingsweg" versus het "Gesprek"

De auteurs ontdekten dat het probleem niet is dat de architect slecht is in het vinden van bijen. Het probleem is hoe de architect gevraagd wordt om de klus te klaren.

  • De Superkracht van de Architect: De architect is getraind om een gesprek te voeren. Als je een vraag stelt, denkt de architect, geeft antwoord, denkt opnieuw na en verfijnt zijn antwoord. Dit "heen-en-weer" (genoemd autoregressieve generatie) helpt hem om diep in zijn geheugen te graven om de exacte locatie van de bij te vinden.
  • De Bouwklus: Bij het bewerken van afbeeldingen wordt de architect gedwongen om in stilte te werken. Hij krijgt de foto en de instructie, en moet onmiddellijk een enkele set instructies uitspuwen. Hij mag niet "hardop denken" of een gesprek genereren.

Het papier betoogt dat wanneer je de architect dwingt om in deze "stille, one-shot" modus te werken, de specifieke details over waar de bij zich bevindt, diep in zijn brein begraven raken. De uiteindelijke instructies die hij naar de ploeg stuurt, zijn te vaag, ook al weet de architect het antwoord eigenlijk wel.

De Oplossing: De "Spion" (Analysis-by-Proxy)

Omdat de architect in deze stille modus niet direct met ons zal praten, hebben de onderzoekers een Spion uitgevonden, die ze een Proxy noemen.

  1. De Opstelling: In plaats van de architect te vragen een lang verhaal te schrijven (wat hij in deze modus niet kan), plaatsten de onderzoekers een kleine, superintelligente detective (de Proxy) in de hersenen van de architect.
  2. De Missie: De enige taak van de detective is om naar de interne gedachten van de architect te kijken (de verborgen lagen van het neurale netwerk) en te proberen de coördinaten van de bij te raden.
  3. De Ontdekking: De detective ontdekte dat de informatie over de "locatie van de bij" niet in de laatste gedachten van de architect zat (de laatste laag). Het zat verborgen in de middelste lagen, als een geheim briefje dat tussen vrienden in een klaslokaal wordt doorgegeven.
    • Analogie: Stel je voor dat de architect een bibliotheek is. De laatste laag is het "Samenvattingsboek" bij de receptie—het is te algemeen. De middelste lagen zijn de specifieke planken waar de gedetailleerde kaarten worden bewaard. De bouwploeg las alleen het Samenvattingsboek, maar de kaart lag eigenlijk op Plank 15.

De "Dynamische" Twist: Het is niet altijd Plank 15

De onderzoekers ontdekten iets nog interessanter. De locatie van het "geheime briefje" verandert afhankelijk van de vraag.

  • Als je vraagt naar een bij op een zonnebloem, ligt de kaart op Plank 15.
  • Als je vraagt naar een bij op een andere bloem, ligt de kaart misschien op Plank 18.

De standaard bewerkingstools waren als een bibliothecaris die altijd naar Plank 20 keek, ongeacht de vraag. Daarom bleven ze falen. Het "geheim" verplaatst zich op basis van de specifieke afbeelding en tekst.

Hoe ze het hebben opgelost

De onderzoekers gebruikten hun Spion (de Proxy) om het geheime briefje in de middelste lagen te vinden, de coördinaten te lezen, en vervolgens fysiek een kader rond de bij te tekenen op de foto voordat ze deze aan de bouwploeg overhandigden.

  • Het Resultaat: Toen de bouwploeg het kader zag dat door de Spion was getekend, stopten ze met gokken. Ze wisten precies waar ze moesten werken. Het bewerken werd nauwkeurig en ze stopten met het verven van de verkeerde bloemen.

De Kernboodschap

Dit papier leert ons dat alleen omdat een slim AI-model weet waar iets is, betekent dit niet dat de tools die het model gebruiken het ook kunnen zien.

  • Oude Manier: Vraag het slimme model om een definitieve samenvatting en hoop dat deze gedetailleerd genoeg is. (Dat is meestal niet zo).
  • Nieuwe Manier: Gebruik een lichtgewicht "spion" om in de middelste lagen van het model te kijken, de specifieke details te vinden die daar verborgen liggen, en die details rechtstreeks aan de bewerkingstool te geven.

Door dit te doen, bewezen de onderzoekers dat de "onhandige" bewerkingsfouten niet kwamen doordat de AI dom was; het kwam doordat de bewerkingspipeline op de verkeerde plek naar het antwoord zocht.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →