← Nieuwste papers
💻 computer science

When More Foundation Models Means Less: Diagnosing and Addressing Multi-View Fusion Failure

Dit artikel stelt vast dat het willekeurig samenvoegen van meerdere fundamentele modellen vaak de prestaties verslechtert door redundantie en misalignement, en stelt KAGES voor, een label-bewuste, efficiënte gulzigheid-gebaseerde selectiemethode die de compositie van de view-set optimaliseert om superieure downstream-nauwkeurigheid te bereiken met een compacte, taak-gealigneerde encoder-subset.

Oorspronkelijke auteurs: Yibo Liu, Bowen Jiang

Gepubliceerd 2026-08-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yibo Liu, Bowen Jiang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het moderne tijdperk van kunstmatige intelligentie hebben onderzoekers toegang tot een enorme bibliotheek aan vooraf getrainde computerprogramma's, die vaak fundamentele modellen (foundation models) worden genoemd. Dit zijn massieve systemen die al patronen hebben leren herkennen, taal hebben leren begrijpen of afbeeldingen hebben leren interpreteren door enorme hoeveelheden gegevens te bestuderen. Denk aan hen als deskundige instrumenten die weliswaar geslepen zijn, maar nog niet zijn toegepast op een specifieke taak. Jarenlang was de standaardaanpak om een nieuw probleem met deze instrumenten op te lossen het combineren van zoveel mogelijk van deze modellen, uitgaande van de veronderstelling dat meer informatie altijd tot betere resultaten leidt. De logica was simpel: als één instrument een afbeelding op één manier ziet en een ander op een andere manier, zou het samenvoegen ervan een perfect, allesomvattend beeld moeten creëren. Dit idee, bekend als multi-view learning, is al lang een hoeksteen van hoe wetenschappers proberen intelligentere systemen te bouwen door verschillende bronnen van informatie samen te voegen.

Echter, een nieuwe studie daagt dit fundamentele geloof uit. Onderzoekers van de Beijing University of Posts and Telecommunications ontdekten dat wanneer je begint met het mengen van een groot aantal van deze vooraf getrainde experts, het toevoegen van meer niet noodzakelijkerwijs de uiteindelijke resultaten beter maakt. Sterker nog, na een bepaald punt kan het toevoegen van een ander instrument de resultaten zelfs verslechteren. Het team ontdekte dat de beste prestaties meestal worden bereikt door een kleine, specifieke groep van deze modellen te selecteren in plaats van een grote, willekeurige collectie te gebruiken. Ze observeerden dat terwijl de eerste paar modellen die aan de mix worden toegevoegd frisse en nuttige inzichten bieden, de daaropvolgende toevoegingen vaak informatie herhalen die het systeem al heeft of verwarrende signalen introduceren die niets met de taak te maken hebben. Dit fenomeen creëert een curve waarbij de prestaties snel stijgen, een piek bereiken en vervolgens beginnen te dalen naarmate er meer modellen in de mix worden gedwongen.

Om dit probleem op te lossen, ontwikkelden de onderzoekers een nieuwe methode genaamd KAGES, die fungeert als een slimme selector voor deze AI-modellen. In plaats van blindelings elk beschikbaar instrument samen te voegen, evalueert KAGES zorgvuldig welke specifieke modellen gecombineerd moeten worden en hoeveel er gebruikt moeten worden. Het werkt door te meten hoe goed de gecombineerde informatie van een groep modellen overeenkomt met de juiste antwoorden voor een specifieke taak, zonder dat er eerst een nieuw systeem getraind hoeft te worden om ze te testen. De methode voegt gulzig (greedily) het volgende beste model toe dat de meeste nieuwe, nuttige informatie biedt, terwijl modellen die simpelweg het reeds bekende herhalen of ruis toevoegen, worden vermeden. Deze aanpak stelt het systeem in staat om te stoppen met het toevoegen van modellen precies op het moment dat de extra informatie niet langer nuttig is, waardoor de uiteindelijke combinatie compact en zeer effectief wordt.

Het team testte dit idee bij een breed scala aan taken, waaronder het herkennen van objecten in afbeeldingen, het identificeren van texturen en zelfs het begrijpen van taal. In elk geval ontdekten zij dat de "meer is beter"-aanname faalde. Bij sommige taken piekte de prestatie nadat slechts drie of vier modellen waren gecombineerd, en het toevoegen van meer zorgde voor een daling in de nauwkeurigheid. Bijvoorbeeld, bij een taak die het herkennen van verkeersborden betrof, presteerde het systeem het best met een zeer kleine set modellen, terwijl bij een taak betreffende geolocatie één enkel model al zo goed was dat het toevoegen van anderen geen voordeel bood en soms zelfs de prestaties verslechterde. De onderzoekers merkten ook op dat het ideale aantal modellen verandert afhankelijk van hoeveel data er beschikbaar is; met meer data kan het systeem enkele extra modellen aan voordat de prestaties beginnen af te nemen, maar de piek wordt altijd bereikt met een verrassend klein aantal.

De resultaten toonden aan dat KAGES consequent andere methoden overtrof, inclusief die methoden die probeerden alle beschikbare modellen te combineren of die simpelweg modellen kozen die van elkaar verschilden. Door te focussen op de kwaliteit van de combinatie in plaats van de kwantiteit, was KAGES in staat om het ideale punt te vinden waar de modellen het meest effectief samenwerken. In veel gevallen presteerde het bijna net zo goed als een perfecte, theoretische selector die elke mogelijke combinatie zou moeten testen om de beste te vinden, maar deed het veel sneller en zonder voor elke test nieuwe systemen te hoeven trainen. Deze ontdekking suggereert dat de toekomst van het bouwen van krachtige AI-systemen niet ligt in het verzamelen van meer instrumenten, maar in de zorgvuldige, intelligente selectie van de juiste instrumenten. Naarmate de bibliotheek van beschikbare AI-modellen blijft groeien, zal het vermogen om het perfecte kleine team van experts te kiezen belangrijker dan ooit worden, waardoor de uitdaging van het beheren van enorme middelen wordt omgezet in een kans voor precisie en efficiëntie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →