← Nieuwste papers
💻 computer science

Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

Het artikel stelt Lens voor, een lichtgewicht, vraag-geconditioneerd framework dat visuele redundantie in Multimodale Grote Taalmodellen vermindert door adaptief latente ruis te injecteren in irrelevante beeldtokens, waardoor de fijnmazige redeneer- en grondingsprestaties aanzienlijk worden verbeterd zonder de modelbackbone aan te passen.

Oorspronkelijke auteurs: Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li

Gepubliceerd 2026-06-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een puzzel probeert op te lossen, maar iemand heeft een enorme stapel extra, ongerelateerde puzzelstukjes bovenop de stukjes die je eigenlijk nodig hebt gegooid. Dat is in essentie het probleem waar Multimodale Large Language Models (MLLM's) tegenaan lopen wanneer ze naar een afbeelding kijken.

Deze modellen zijn ongelooflijk slim in lezen en praten, maar wanneer ze naar een foto kijken, zien ze alles als een lange lijst van kleine stukjes (tokens). Als je vraagt: "Hoeveel vliegtuigen zijn er in deze lucht?", ziet het model de vliegtuigen, maar het ziet ook de wolken, de vogels, de bomen op de achtergrond en de textuur van het gras. Al deze "afleidende" stukjes raken vermengd, waardoor het voor het model moeilijk wordt om zich te concentreren op de specifieke aanwijzingen die het nodig heeft om je vraag te beantwoorden.

De meeste huidige oplossingen proberen het model harder of langer te laten nadenken door meer stappen aan het redeneerproces toe te voegen. Het is alsof je een verwarde detective vertelt: "Schrijf gewoon een langer verslag over alles wat je ziet." Maar het artikel stelt dat dit niet goed werkt, omdat de detective nog steeds verdrinkt in irrelevante details.

Maak kennis met LENS (Latent Noise Mask).

Zie LENS niet als een hulpmiddel dat meer informatie toevoegt, maar als een slimme noise-cancelling koptelefoon voor de ogen van het model.

Hier is hoe het werkt, met behulp van een eenvoudige analogie:

1. De "Lens Evidence Token" (De Slimme Spotter)

Stel je voor dat het model een kleine, tijdelijke assistent heeft (de Lens Evidence Token of LET) die naar de afbeelding en de vraag samen kijkt.

  • De Taak: Deze assistent scant snel de afbeelding en geeft een score aan elk afzonderlijk stukje van de foto.
  • Het Resultaat: Als een stukje van de afbeelding een vliegtuig is (en je vroeg naar vliegtuigen), geeft de assistent het een hoge score (een groen licht). Als een stukje een wolk of een boom is, geeft het een lage score (een rood licht).
  • Cruciaal Punt: Deze assistent verandert de afbeelding niet; hij rangschikt alleen de stukjes op basis van wat je hebt gevraagd.

2. De "Latent Noise Mask" (De Volumeknop)

Zodra de assistent de stukjes heeft gerangschikt, gooit LENS de stukjes met een "lage score" niet weg. Iets weggooien is riskant; als de assistent een fout maakt, kan het model een cruciale aanwijzing verliezen. In plaats daarvan gebruikt LENS een volumeknop.

  • Hoge Score Stukjes (Het Bewijs): Deze worden met rust gelaten. Ze zijn luid en duidelijk.
  • Lage Score Stukjes (De Afleiders): LENS voegt een speciaal soort "statische ruis" of "noise" toe aan deze stukjes. Het verwijdert ze niet, maar maakt ze wazig en onbetrouwbaar. Het is alsohad je het volume van het achtergrondgepraat omlaag draait, zodat het model alleen de belangrijke stem kan horen.

Waarom is dit beter?

Het artikel beweert dat in plaats van het model te leren om "langer na te denken" (wat meer rommel toevoegt), het beter is om op te schonen wat het al ziet.

  • Geen Chirurgie: De hersenen van het model (de backbone) blijven exact hetzelfde. We snijden geen delen uit de afbeelding en we veranderen de structuur van het model niet.
  • Zachte Onderdrukking: In plaats van delen van de afbeelding agressief te verwijderen (wat het model kan breken als het een fout maakt), dempt LENS de afleidingen op een zachte manier.
  • Efficiëntie: Het voegt slechts een heel klein beetje extra werk toe, zoals een snelle blik door de assistent, maar het resultaat is een veel duidelijker beeld voor het model om de puzzel op te lossen.

De Resultaten

Wanneer de onderzoekers deze "noise-cancelling" aanpak testten op diverse taken:

  • Visual Question Answering (VQA): De modellen werden aanzienlijk beter in het beantwoorden van specifieke vragen (zoals het tellen van objecten of het lezen van tekst in een afbeelding) omdat ze minder snel in de war raakten door de achtergrond.
  • Grounding: De modellen werden veel beter in het precies aanwijzen van de locatie van een object in een afbeelding, omdat de "ruis" van vergelijkbare objecten in de buurt werd gedempt.

Kortom: Het artikel suggereert dat om AI beter te laten zien, we niet alleen meer tijd moeten geven om na te denken; we moeten het helpen om de ruis te negeren zodat het zich op het signaal kan concentreren. LENS is het hulpmiddel dat het volume van de irrelevante delen van een afbeelding zachter zet, zodat het model het antwoord duidelijk kan horen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →