← Nieuwste papers
💻 computer science

DiffSpot: Can VLMs Spot Fine-Grained Visual Differences in Web Interfaces?

Dit artikel introduceert DiffSpot, een door code gestuurde benchmark die aantoont dat zelfs de meest geavanceerde vision-language-modellen moeite hebben om fijne visuele verschillen in webinterfaces te detecteren, met een lage recall zelfs bij eenvoudige wijzigingen, en die laat zien dat de moeilijkheid van detectie aanzienlijk varieert per CSS-eigenschap in plaats van per pixelgrootte of semantische afstand.

Oorspronkelijke auteurs: Linhao Zhang, Aiwei Liu, Yuan Liu, Xiao Zhou

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Linhao Zhang, Aiwei Liu, Yuan Liu, Xiao Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je twee bijna identieke foto's van een webpagina hebt. Op de ene foto is een knop blauw; op de andere is het een iets lichtere blauwtint. Of misschien is de tekst net een klein beetje dikker gedrukt. Voor een mens kan het vinden hiervan een seconde knijpen kosten. Maar voor een Kunstmatige Intelligentie (KI) die afbeeldingen "ziet", is dit als proberen een enkele zandkorrel te vinden die van kleur is veranderd op een strand.

Dit artikel, getiteld DiffSpot, introduceert een nieuwe test om te zien hoe goed moderne KI-modellen zijn in het opsporen van deze kleine, specifieke wijzigingen op websites. Hier is de uitleg in eenvoudige termen:

1. Het Probleem: KI is geweldig in het grote geheel, slecht in de details

Huidige KI-modellen (zogenaamde Vision-Language Models of VLM's) zijn als briljante kunstkritici. Ze kunnen naar een foto kijken en je vertellen: "Dit is een zonnige dag op het strand met een gezin dat speelt." Ze zijn uitstekend in het begrijpen van het algemene verhaal.

Ze worstelen echter met de "kleine lettertjes". Als je ze vraagt: "Is de kleur van die specifieke knop veranderd van donkerblauw naar lichtblauw?", dan missen ze dit vaak. Ze kunnen zeggen: "Nee, alles ziet er hetzelfde uit," of ze kunnen een verandering verzinnen die niet heeft plaatsgevonden (zoals zeggen dat de tekst is veranderd terwijl dat niet zo is).

2. De Oplossing: Het bouwen van een "Vind het Verschil"-spel met regels

De onderzoekers wilden dit vermogen testen, maar ze konden niet zomaar mensen vragen om verschillen op willekeurige websites te vinden. Mensen zijn bevooroordeeld; ze merken grote, voor de hand liggende dingen op, maar missen subtiele. Bovendien is het bijna onmogelijk om op het echte internet twee webpagina's te vinden die exact hetzelfde zijn, behalve dan één klein detail.

Dus bouwde het team DiffSpot, een op maat gemaakt testpakket. Denk hierbij aan een ontwerper van videospel-niveaus die een perfecte "vind het verschil"-puzzel van scratch bouwt.

  • Hoe ze het bouwden: In plaats van screenshots te maken en te hopen op het beste, begonnen ze met de computercode (HTML/CSS) die een webpagina bouwt.
  • De "Mutatie": Ze namen een stukje code, veranderden slechts één kleine instelling (zoals het maken van een knop 5% lichter), en genereerden vervolgens opnieuw de afbeelding.
  • De "Grounding Gate": Dit is een kwaliteitscontrole-stap. Soms verpest het veranderen van één regel code per ongeluk de hele paginalay-out. De onderzoekers gebruikten een digitale "poortwachter" om te controleren: Is de verandering precies gebeurd waar we wilden, en nergens anders? Als de verandering oversloeg naar andere delen van de pagina, gooiden ze die testcase weg.

Het resultaat is een dataset van 4.400 paren afbeeldingen. Sommigen hebben een kleine, specifieke verandering (zoals een lettertype dat iets dikker wordt), en sommigen hebben helemaal geen verandering.

3. De Test: 13 Top-KI's op de proef stellen

Ze namen 13 van de slimste KI-modellen van vandaag (inclusief modellen van Google, OpenAI, Anthropic en anderen) en vroegen hen om naar deze paren te kijken en de verschillen op te sommen. Ze gaven de KI geen hints of voorbeelden; het was een "blinde test".

De Resultaten: De KI Worstelt
Zelfs de beste KI-modellen slaagden er niet in om de meerderheid van de veranderingen op te sporen.

  • De Score: Het best presterende model vond slechts ongeveer 41% van de daadwerkelijke veranderingen. Dat betekent dat het ongeveer 6 van de 10 veranderingen miste.
  • De Hard Mode: Wanneer de veranderingen zeer subtiel waren (het "Hard"-niveau), deden de modellen het nog slechter, met minder dan 23% van de veranderingen gevonden.
  • Het Hallucinatie-probleem: Sommige modellen waren zo enthousiast om een verschil te vinden dat ze dingen verzinselden. Ze beweerden dat een knop van kleur veranderde terwijl dat niet zo was. Anderen waren zo voorzichtig dat ze "geen verandering" zeiden, zelfs toen er wel een was.

4. De Verrassende Ontdekking: Het gaat om Wat er veranderde, niet Waar

De onderzoekers verwachtten dat de moeilijkheidsgraad zou afhangen van het type website (bijvoorbeeld dat winkelwebsites misschien moeilijker zijn dan nieuwswebsites). Ze hadden het mis.

  • Het "Wat" telt: De moeilijkheid hing volledig af van welke eigenschap er veranderde.
    • Als de KI een verandering in tekst of positie (het verplaatsen van een item) moest opsporen, deed het het redelijk.
    • Als de KI een verandering in verlopen (kleurovergangen) of regelafstand (ruimte tussen tekstregels) moest opsporen, presteerde het vreselijk, zelfs als het visuele verschil groot was.
  • Het "Waar" maakt niet uit: Het maakte niet uit of de verandering op een financiële website of een reizenblog stond. Het vermogen van de KI om de verandering op te sporen was consistent over alle onderwerpen.

5. Waarom Dit Belangrijk Is (Volgens het Artikel)

Het artikel concludeert dat, hoewel KI beter wordt in het algemeen begrijpen van afbeeldingen, het nog steeds "blind" is voor de specifieke, fijnmazige details waar een gebruikersinterface uit bestaat.

  • Pixelgrootte is niet het antwoord: Je zou kunnen denken: "Als de verandering groot genoeg is, zal de KI het zien." De studie toonde aan dat dit niet waar is. Zelfs grote pixelveranderingen in bepaalde categorieën (zoals verlopen) werden gemist, terwijl kleine veranderingen in andere (zoals tekst) werden opgepikt.
  • De "Magie" ontbreekt: De KI faalt niet alleen in het zien van de pixels; het faalt in het begrijpen van het concept van de verandering (bijvoorbeeld "deze tekst is dikker").

Samenvattend:
DiffSpot is een strenge "vind het verschil"-test voor KI. Het onthult dat zelfs de slimste KI-modellen van vandaag lijken op een persoon die probeert een menu te lezen in een donkere kamer: ze kunnen je vertellen dat er een restaurant is, maar ze kunnen niet betrouwbaar vertellen of de prijs van de soep met een paar cent is veranderd. Het artikel bewijst dat KI, om webinterfaces echt te beheersen, veel beter moet worden in het opmerken van de kleine, specifieke details.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →