← Nieuwste papers
🤖 machine learning

Your CLIP has 164 dimensions of noise: Exploring the embeddings covariance eigenspectrum of contrastively pretrained vision-language transformers

Dit artikel onthult dat contrastief voorgetrainde visueel-taalmoedellen een substantiële, invariant deelruimte van gedeelde multi-modale ruis bevatten die veilig kan worden weggehaald zonder de prestaties in downstream-taken te schaden, en biedt hiermee nieuwe mechanistische inzichten in hun latente representatiestructuur.

Oorspronkelijke auteurs: Jakub Grzywaczewski, Dawid Płudowski, Przemysław Biecek

Gepubliceerd 2026-05-15
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jakub Grzywaczewski, Dawid Płudowski, Przemysław Biecek

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super slimme robotassistent hebt (zoals CLIP) die is getraind om zowel afbeeldingen als woorden te begrijpen. Je vraagt het: "Laat me een foto van een hond zien," en het vindt er direct één. Het lijkt perfect. Maar dit artikel stelt dat deze robot eigenlijk een zware, nutteloze rugzak vol rommel met zich meedraagt die het niet nodig heeft om zijn werk te doen.

Hier is de uiteenzetting van wat de onderzoekers hebben gevonden, met behulp van eenvoudige analogieën:

1. De "ruis" in het signaal

Stel je het brein van de robot voor als een gigantische radio-ontvanger met 768 verschillende kanalen (dimensies) die naar de wereld luisteren.

  • De goede kanalen: De meeste van deze kanalen zijn afgestemd op het "signaal" – de werkelijke betekenis van de afbeelding of het woord (zoals "hond", "kerk" of "gelukkig").
  • De slechte kanalen: De onderzoekers ontdekten dat ongeveer 164 van deze kanalen gewoon "ruis" uitzenden. Dit is geen willekeurige ruis; het is een specifieke, gedeelde vorm van ruis die voorkomt in elke afbeelding en elk woord dat de robot ziet, ongeacht de inhoud.

2. Het "spook"-patroon

Het meest verrassende deel is dat deze "ruis" identiek is over verschillende groepen heen.

  • De analogie: Stel je voor dat je een foto maakt van een Siberische Husky en een foto van een kerkgebouw. Ze hebben niets gemeen. Toch, als je naar het "rommel"-gedeelte van het geheugen van de robot kijkt voor beide afbeeldingen, ziet de rommel er bijna precies hetzelfde uit (91% overlap).
  • De bevinding: De robot heeft een "spook"-patroon dat op alles wordt gedrukt wat het ziet. Het is alsof een printer een vlek op de lens heeft; elk document dat het print, of het nu een recept is of een liefdesbrief, heeft diezelfde vlek in de hoek. De onderzoekers ontdekten dat deze vlek zo consistent is dat ze deze perfect kunnen in kaart brengen.

3. Het "rommel-lade"-experiment

De onderzoekers besloten te testen wat er gebeurt als ze deze "rommel-lade" (de 164 dimensies van ruis) gewoon weggooien.

  • Het resultaat: Ze namen de robot, verwijderden die 164 kanalen en vroegen het om zijn gebruikelijke taken te doen (zoals dieren op foto's identificeren of woorden aan afbeeldingen koppelen).
  • De verrassing: De robot werd niet slechter. Sterker nog, het werd iets beter in het koppelen van woorden aan afbeeldingen. Het was alsof je een rugzak vol stenen van een hardloper haalt; ze werden niet vertraagd, ze renden juist sneller omdat ze niet werden belast.

4. Waarom gebeurt dit?

Het artikel suggereert dat deze "ruis" geen bug in de code is, maar een neveneffect van hoe de robot is gebouwd.

  • De analogie: Stel je een fabriek voor die auto's bouwt. De ingenieurs hebben de assemblagelijn zo efficiënt ontworpen dat de auto's geweldig zijn, maar de trilling van de machines per ongeluk een kleine, nutteloze kras op elke autodeur achterlaat. De kras verhindert niet dat de auto rijdt, maar hij staat op elke enkele auto.
  • De onderzoekers ontdekten dat deze "kras" (de ruis) een fundamenteel onderdeel is van de architectuur, niet zomaar een fout met één specifiek dataset.

Samenvatting

Het artikel stelt dat moderne AI-modellen zoals CLIP een enorme hoeveelheid "gedeelde ruis" met zich meedragen (ongeveer 164 dimensies in sommige versies) die niets te maken heeft met de werkelijke betekenis van de afbeeldingen of teksten.

  • Het goede nieuws: Je kunt deze ruis weghalen zonder de prestaties van de AI te schaden.
  • Het grote plaatje: Een groot deel van de "hersenenruimte" van de AI slaat eigenlijk alleen deze repetitieve, betekenisloze patronen op, in plaats van bruikbare kennis. Door het op te ruimen, wordt de AI iets efficiënter en nauwkeuriger.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →