← Nieuwste papers
💻 computer science

Rank-Gated and Sparse Low-Rank Adaptation for Efficient Fine-Tuning of Vision--Language Models

Dit artikel introduceert Rank-Gated LoRA (RG-LoRA), een methode die leerbare belangrijksgewichten toekent aan LoRA-rangcomponenten om post-training pruning voor geheugenefficiëntie mogelijk te maken, maar initiële experimenten op Qwen3-VL-8B tonen aan dat zonder expliciete sparsiteitsregularisatie de gates er niet in slagen betekenisvolle sparsiteit te leren, wat resulteert in verwaarloosbare latentie- of VRAM-winsten ondanks het valideren van het voorgestelde train-prune-evaluate mechanisme.

Oorspronkelijke auteurs: Qinwu Xu

Gepubliceerd 2026-09-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qinwu Xu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Moderne kunstmatige intelligentiesystemen die afbeeldingen kunnen zien en tekst kunnen lezen, worden ongelooflijk krachtig, maar ze worden ook steeds massiever. Deze vision-language modellen zijn gebouwd met miljarden parameters, wat de interne instellingen zijn waarmee de machine leert. Om deze reuzen een nieuwe taak te leren, zoals het lezen van een medisch dossier of het begrijpen van een complex diagram, moesten onderzoekers traditioneel elke instelling aanpassen. Dit proces is als het proberen te renoveren van een wolkenkrabber door elke baksteen te vervangen; het vereist enorme hoeveelheden computergeheugen en tijd, wat het voor de meeste onderzoekers vaak onmogelijk maakt om dit te doen. Om dit op te lossen, ontwikkelden wetenschappers een kortere weg genaamd Low-Rank Adaptation. In plaats van het hele gebouw aan te raken, voegt deze methode een kleine, lichtgewicht aanbouw toe aan het model die de nieuwe taak leert, terwijl de oorspronkelijke, massieve structuur onaangetast blijft. Het is een standaardinstrument om deze grote modellen bruikbaar te maken zonder de rekenkracht uit de boeken te laten lopen.

Echter, zelfs deze lichtgewicht aanbouwen hebben een verborgen inefficiëntie. Wanneer onderzoekers ze creëren, moeten ze vooraf raden hoeveel "capaciteit" de aanbouw nodig heeft voordat ze beginnen met trainen. Ze kiezen een vaste grootte, en het model gebruikt elk deel van die grootte, zelfs als slechts een fractie ervan eigenlijk nodig is voor de taak. Het is als het bouwen van een koffer met twintig vakjes wanneer je er slechts vijf nodig hebt, terwijl je toch het gewicht van alle twintig moet dragen. Het nieuwe onderzoek van Qinwu Xu aan de University of Texas at Austin stelt een eenvoudige vraag: wat als het model zelf kan beslissen welke delen van de aanbouw nuttig zijn en welke niet, en vervolgens de nutteloze delen fysiek kan verwijderen?

De onderzoekers introduceerden een methode die ze Rank-Gated LoRA noemen. Stel je de kleine aanbouw voor als een stapel transparante vellen, waarbij elk vel een andere manier vertegenwoordigt waarop het model van de gegevens kan leren. In standaardmethoden wordt het model gedwongen om alle vellen in de stapel te gebruiken, ongeacht of ze helpen. In deze nieuwe aanpak hebben de onderzoekers een piepkleine, leerbare schakelaar aan elk vel toegevoegd. Tijdens het trainingsproces leert het model de schakelaars voor de behulpzame vellen op "aan" te zetten en de schakelaars voor de niet-behulpzame vellen op "uit". Zodra de training is voltooid, kunnen de onderzoekers de vellen die op "uit" stonden fysiek eruit snijden. Het resultaat is een veel kleinere, efficiëntere aanbouw die hetzelfde werk doet, maar minder ruimte inneemt en minder energie vereist om te draaien.

Om te testen of dit idee werkt, paste het team het toe op een groot vision-language model genaamd Qwen3-VL-8B-Instruct. Ze trainden het model op een mix van drie verschillende datasets die betrokken waren bij grafieken, tekst in afbeeldingen en vragen over documenten. Ze vergeleken hun nieuwe methode met de standaard, vaste versie. De resultaten lieten zien dat de nieuwe methode net zo goed kon leren als de standaardversie, waarbij een nauwkeurigheid van ongeveer 81,56 procent werd bereikt op de testvragen, wat zeer dicht bij de 81,95 procent lag die door de standaardmethode werd bereikt. Dit bewees dat het model effectief kon leren, zelfs terwijl het de potentie droeg om kleiner te zijn.

Het meest interessante deel van het experiment kwam na de voltooiing van de training. De onderzoekers namen het getrainde model en begonnen de minst belangrijke vellen één voor één te verwijderen, om te zien hoe klein ze de aanbouw konden maken voordat het model begon te falen. Ze ontdekten dat het model verrassend robuust was. Zelfs nadat drie van de acht oorspronkelijke vellen waren verwijderd, waardoor er slechts vijf overbleven, verbeterde de prestatie van het model zelfs licht op een specifieke validatieset, tot 81,26 procent. Dit suggereert dat de oorspronkelijke, grotere aanbouw een extra gewicht met zich mee droeg dat het model niet hielp bij het denken. Door het weg te snijden, presteerde het model net zo goed, zo niet beter, met minder materiaal.

Ondanks dit succes waren de onderzoekers voorzichtig om te vermelden wat hun experiment niet bewezen heeft. Hoewel het model de tolerantie had om delen te laten verwijderen, leerden de schakelaars zelf niet automatisch uit te schakelen tijdens het trainingsproces. Ze bleven in een bijna identieke positie staan als waar ze mee begonnen, wat betekent dat het model niet vanzelf ontdekte welke delen nutteloos waren. De onderzoekers moesten handmatig beslissen welke delen ze achteraf zouden wegsnijden. Bovendien, omdat de aanbouw van zichzelf al vrij klein was, maakte het inkorten ervan het model niet aanzienlijk sneller of gebruikte het veel minder computergeheugen in realtime. Het zware werk werd nog steeds gedaan door de massieve, bevroren ruggengraat van het hoofdmodel, dus de besparingen van de kleine aanbouw waren te klein om te meten in de algehele snelheid.

De studie concludeert dat de mechanisme werkt: het is mogelijk om een model te trainen met extra capaciteit en vervolgens de ongebruikte delen chirurgisch te verwijderen zonder de capaciteit om afbeeldingen en tekst te begrijpen te schaden. Echter, om dit een echte doorbraak in efficiëntie te laten worden, moet toekomstig werk het model leren om de schakelaars tijdens de training zelf uit te zetten en de methode te testen op veel grotere aanbouwen waar de besparingen aanzienlijker zouden zijn. Voor nu staat het onderzoek als een bewijs van concept, dat laat zien dat deze digitale instrumenten kunnen worden bijgesneden nadat ze zijn gebouwd, wat de weg vrijmaakt voor meer efficiënte en aanpasbare kunstmatige intelligentie in de toekomst.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →