← Nieuwste papers
🤖 AI

Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders

Dit onderzoek weerlegt de aanname dat meer visuele encoders in multimodale grote taalmodellen altijd beter presteren, en toont aan dat systematisch maskeren van redundante encoders vaak de prestaties verbetert en leidt tot efficiëntere modellen met lagere latentie.

Oorspronkelijke auteurs: Yizhou Wang, Song Mao, Yang Chen, Yufan Shen, Yinqiao Yan, Pinlong Cai, Ding Wang, Guohang Yan, Zhi Yu, Xuming Hu, Botian Shi

Gepubliceerd 2026-02-16
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yizhou Wang, Song Mao, Yang Chen, Yufan Shen, Yinqiao Yan, Pinlong Cai, Ding Wang, Guohang Yan, Zhi Yu, Xuming Hu, Botian Shi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: Waarom je niet altijd meer camera's nodig hebt om een foto te begrijpen

Stel je voor dat je een heel slimme robot bouwt die foto's kan bekijken en er vragen over kan beantwoorden. Dit noemen we een "Multimodaal Groot Taalmodel" (MLLM). Om deze robot slimmer te maken, hebben onderzoekers de afgelopen tijd een trend opgepakt: meer camera's.

De gedachte was simpel: "Als één camera goed is, zijn er zeker vijf nog beter!" Ze dachten dat elke camera een ander soort "oog" had. De ene zou goed zijn in het zien van grote lijnen, de andere in het lezen van kleine tekst, en weer een andere in het herkennen van voorwerpen. Door ze allemaal aan te sluiten, hoopten ze een super-robot te maken.

Maar in dit nieuwe onderzoek (van de auteurs Wang, Mao en collega's) ontdekten ze iets verrassends: die extra camera's zijn vaak alleen maar rommel.

Hier is hoe het werkt, uitgelegd in simpele taal:

1. De "Overvolle Kamer" Analogie

Stel je voor dat je een vergadering hebt met vijf experts om een probleem op te lossen.

  • Expert A is een briljant fotograaf die elk detail ziet.
  • Expert B is een tekstlezer die alleen op borden let.
  • Expert C, D en E zijn ook experts, maar ze zeggen precies hetzelfde als Expert A, of ze verwarren de groep met onzin.

In de huidige AI-modellen zitten vaak al die experts in één kamer. De robot luistert naar iedereen, maar dat kost veel tijd en energie. Het onderzoek laat zien dat als je Experts C, D en E de kamer uitstuurt, de vergadering niet slechter verloopt. Sterker nog: soms gaat het zelfs beter, omdat de robot niet meer wordt afgeleid door de overbodige geluiden.

2. De "Speciale Ogen" (Redundantie)

De onderzoekers ontdekten dat voor bepaalde taken, zoals het lezen van tekst in een foto (OCR) of het interpreteren van grafieken, één specifieke camera al 90% van het werk doet.

  • Het is alsof je een sleutel hebt die perfect past in een slot. Je hoeft niet vijf sleutels tegelijk in het slot te proppen; dat werkt alleen maar stroef.
  • Voor andere taken, zoals "wat zie je op deze foto?", zijn de camera's vaak uitwisselbaar. Ze zien allemaal ongeveer hetzelfde. Het toevoegen van een zesde camera levert dan nauwelijks extra kennis op, maar kost wel veel rekenkracht.

3. De Nieuwe Meetlat: De "Nuttigheids-meter"

Om dit te bewijzen, hebben de onderzoekers twee nieuwe meetinstrumenten bedacht:

  • De "Bijdrage-meter" (CUR): Deze meet hoeveel nut een camera toevoegt als de anderen al aan het werk zijn. Als de meter op nul staat (of zelfs negatief), betekent het: "Deze camera doet alleen maar schade of is nutteloos."
  • De "Grootte-kloof" (IG): Dit meet het verschil tussen de beste en de slechtste camera. Een grote kloof betekent dat de robot sterk afhankelijk is van één camera en de anderen negeert.

4. Het Grote Resultaat: Minder is Meer

Wat deden ze toen ze dit wisten? Ze haalden de overbodige camera's eruit.

  • Snelheid: De robot werd veel sneller, omdat hij niet meer hoefde te wachten op de "dode" camera's.
  • Kosten: Het trainen van de robot kostte 34% minder tijd en energie.
  • Prestaties: Het meest verbazingwekkende? De robot met twee camera's deed bijna net zo goed als de robot met vijf camera's (meer dan 90% van de prestatie).

Conclusie voor de Gemiddelde Mens

Deze studie breekt met de oude regel: "Hoe meer, hoe beter."
Het is alsof je een auto bouwt met vijf motoren. Je denkt dat hij dan sneller gaat, maar hij wordt alleen maar zwaarder, duurder in brandstof en moeilijker te besturen. Door de overbodige motoren eraf te halen, rijd je net zo snel, maar ben je veel zuiniger en efficiënter.

Voor de toekomst van AI betekent dit dat we slimme systemen kunnen bouwen die lichter, sneller en goedkoper zijn, zonder dat ze minder slim worden. We hoeven niet alles te stapelen; we moeten alleen de juiste stukken kiezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →