← Nieuwste papers
💬 NLP

Multimodal Model Diffing for Feature Discovery and Control

Dit artikel introduceert MMDiff, een multimodal model-diffing framework dat gebruikmaakt van sparse autoencoders om specifieke kenmerken in Multimodale Large Language Models te isoleren, te detecteren en causaal te controleren, waardoor gerichte verbeteringen in ruimtelijk begrip, OCR en veiligheid mogelijk worden terwijl de algemene prestaties behouden blijven.

Oorspronkelijke auteurs: Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald Clark

Gepubliceerd 2026-08-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald Clark

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot hebt gebouwd die boeken kan lezen, naar plaatjes kan kijken en vragen over zowel tekst als beeld kan beantwoorden. Je hebt hem geleerd om behulpzaam te zijn, maar soms raakt hij in de war, verzint hij feiten (hallucineert) of zegt hij iets onveiligs wanneer hij een lastige afbeelding te zien krijgt. Het probleem is dat, binnen de "hersenen" van deze robot, alles een verwarrende bende van wiskunde is. Het is als een gigantische bibliotheek waar alle boeken aan elkaar geplakt zitten, en je kunt niet zien welke specifieke pagina verantwoordelijk is voor het slechte gedrag van de robot of voor zijn verbazingwekkende vermogen om een kat op een foto te herkennen. Wetenschappers willen dit oplossen, maar ze hebben een manier nodig om naar binnen te kijken en de exacte "schakelaars" of "knoppen" te vinden die deze specifieke vaardigheden aansturen.

Om dit te doen, gebruiken onderzoekers een hulpmiddel genaamd een Sparse Autoencoder (SAE). Denk aan een SAE als een magische vertaler die de rommelige, verwarde gedachten van de robot neemt en deze afbreekt in een lijst van eenvoudige, duidelijke "ideeën" of "kenmerken" (features). In plaats van een wazige wolk van data, wordt de hersenstructuur van de robot plotseling georganiseerd in een woordenboek waarin elk item een enkel concept is, zoals "rood", "gevaar" of "links". Maar hier komt de crux: wanneer je een robot die alleen tekst begrijpt leert om te zien, voegt hij niet alleen nieuwe kenmerken toe; hij husselt vaak de oude ook weer door elkaar. Het is alsof je een woordenboek van Engelse woorden neemt en plotseling het woord "apple" gebruikt om "een rode auto" te betekenen. Dit maakt het moeilijk om te weten welke kenmerken daadwerkelijk het nieuwe visuele werk verrichten en welke slechts overblijfselen zijn van de teksttraining.

Dit is waar het nieuwe onderzoek, MMDiff, in beeld komt. De onderzoekers, Hunar Batra en zijn team van Oxford en Microsoft, realiseerden zich dat je, om de specifieke "visuele schakelaars" te vinden, niet alleen naar de uiteindelijke robot kunt kijken, maar deze moet vergelijken met zijn "tekst-alleen" versie van vóórdat hij leerde te zien. Ze ontwikkelden een methode genaamd Multimodal Model Diffing. Stel je twee identieke tweelingen voor: één die alleen boeken heeft gelezen, en één die ook heeft geleerd de wereld te zien. Door hun hersenen zij aan zij te vergelijken, brengt MMDiff exact in kaart welke delen van de hersenen zijn veranderd of zijn aangepast voor visie.

Het team ontdekte dat dit "diffing"-proces ongelooflijk krachtig is. Ze ontdekten dat door deze veranderde kenmerken te isoleren, ze het gedrag van de robot met verbazingwekkende precisie konden aansturen. Zo vonden ze specifieke kenmerken die verantwoordelijk zijn voor het begrijpen van ruimtelijke relaties (zoals weten of een beker boven een tafel staat). Wanneer ze deze specifieke kenmerken "uitzetten", daalde het vermogen van de robot om ruimtelijke vragen te beantwoorden met ongeveer 12%, terwijl het vermogen om algemene vragen te beantwoorden precies hetzelfde bleef. Het was alsof je de "links/rechts"-schakelaar uitzette zonder de "wat is dit?"-schakelaar te breken.

Ze ontdekten ook kenmerken die gekoppeld zijn aan veiligheid. Toen ze de kenmerken identificeerden en verwijderden die de robot kwetsbaar maakten voor onveilige visuele trucs, verbeterde het succespercentage van de robot bij het negeren van die trucs met 24%. Nog beter: ze konden de robot "sturen" door deze kenmerken harder of zachter te zetten. Door de juiste kenmerken te versterken, verbeterden ze het vermogen van de robot om tekst in afbeeldingen te lezen (OCR) met 1,8% en zijn ruimtelijk inzicht met 3,6%, allemaal zonder de hele robot opnieuw te hoeven trainen.

Het artikel sluit expliciet de mogelijkheid uit dat je simpelweg een nieuw woordenboek vanaf nul kunt trainen op de multimodale robot en verwacht dat je de specifieke visuele kenmerken gemakkelijk zult vinden. Ze toonden aan dat zonder de robot te vergelijken met de tekst-alleen versie (het "diffing"-gedeelte), de kenmerken door elkaar raken en je de specifieke vaardigheden die je wilt controleren niet kunt isoleren. Ze ontdekten ook dat het simpelweg kijken naar welke kenmerken vaak worden geactiveerd niet genoeg is; je moet controleren of die kenmerken tijdens het trainingsproces daadwerkelijk zijn geroteerd of van betekenis zijn veranderd.

Kortom, MMDiff werkt als een hoogtechnologische "zoeken en vervangen"-tool voor AI-hersenen. Het vertelt ons niet alleen dat de robot iets doet; het vertelt ons exact welk klein onderdeel van de hersenen dat doet, waardoor we specifieke gedragingen zoals het lezen van tekst, het begrijpen van ruimte of het waarborgen van veiligheid kunnen bijsturen, verbeteren of repareren, terwijl de rest van de intelligentie van de robot onaangetast blijft. Dit suggereert dat we in de toekomst deze krachtige AI-systemen veel veiliger en effectiever kunnen auditeren en controleren, zodat ze precies doen wat we van hen willen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →