← Nieuwste papers
💻 computer science

Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation

Dit artikel daagt de aanname uit dat parameterrredundantie in Vision-Language-Action (VLA) modellen uniform is door gestructureerde divergentiepatronen tijdens de VLM-naar-VLA-adaptatie te onthullen, wat leidt tot een nieuwe multi-module gezamenlijke pruning-strategie die een significante parameterreductie (12%–30%) bereikt terwijl 90% van de oorspronkelijke prestaties behouden blijft zonder dat post-pruning herstel vereist is.

Oorspronkelijke auteurs: Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu

Gepubliceerd 2026-07-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, wereldberoemde chef hebt (het Vision-Language Model, of VLM) die recepten kan beschrijven, ingrediënten kan identificeren en met ongelooflijk veel detail over eten kan praten. Nu wil je deze chef veranderen in een robot die ook echt kan koken in een echte keuken (het Vision-Language-Action Model, of VLA).

Om dit te doen, neem je de hersenen van de chef en voeg je een paar nieuwe "spier"-verbindingen toe, zodat ze een mes kunnen oppakken en een pan kunnen roeren. Maar dit is het probleem: de hersenen van de chef zijn enorm, vol met miljoenen neuronen. De robot is traag, duur in gebruik en neemt veel ruimte in beslag. Je wilt de hersenen inkrimpen om ze sneller te maken, maar je bent doodsbang dat je het verkeerde deel wegsnijdt en de robot verandert in een nutteloze klomp metaal.

De Oude Manier: "Snijden en Hopen"

Traditioneel probeerden ingenieurs, wanneer ze de hersenen van deze robots wilden verkleinen, gewoon onderdelen weg te snijden waarvan ze dachten dat ze "overbodig" waren.

  • Het resultaat: De robot stopte onmiddellijk met werken. Hij vergat hoe hij een kopje moest vasthouden of zijn arm moest bewegen.
  • De oplossing: Ingenieurs zeiden dan: "O ja, dat is te verwachten." Vervolgens besteedden ze dagen of weken aan het opnieuw aanleren (fine-tuning) van de robot om hem weer werkend te krijgen.
  • De grote vraag van het artikel: De auteurs van dit artikel vragen zich af: "Als we de robot alles opnieuw moeten aanleren nadat we hem hebben ingekrompen, was het deel dat we verwijderden dan wel echt 'overbodig'? Of hebben we per ongeluk zijn handen en ogen weggesneden?"

Ze stellen dat het vertrouwen op het opnieuw aanleren verhult dat we vitale delen hebben weggesneden. Als een onderdeel echt nutteloos is, zou de robot perfect blijven functioneren, zelfs nadat je het hebt verwijderd, zonder dat er hulp nodig is.

De Nieuwe Ontdekking: De "Groeikaart"

De auteurs keken naar de hersenen van de robot vóór en nádat hij leerde koken. Ze vergeleken de "oude chef-hersenen" (VLM) met de "nieuwe robot-hersenen" (VLA).

Ze ontdekten dat de hersenen niet willekeurig veranderden. Ze veranderden in zeer specifieke, georganiseerde patronen, zoals een kaart die precies laat zien waar de nieuwe "spier"-verbindingen groeiden.

  • Sommige delen veranderden veel: Dit waren de delen die leerden om de arm van de robot te besturen.
  • Sommige delen bleven hetzelfde: Dit waren de delen die nog steeds alleen maar een tomaat of een lepel hoefden te herkennen.
  • Sommige delen veranderden op vreemde manieren: In sommige lagen waren de veranderingen enorm; in andere waren ze minuscuul.

Ze realiseerden zich dat deze "veranderkaart" (die ze Δ\DeltaW noemen) een geheime gids is. Het vertelt je precies welke delen van de hersenen het zware werk doen voor de robot en welke delen slechts overblijfselen zijn uit het oude leven van de chef.

Het Experiment: De "Gecontroleerde Chirurgie"

Om hun theorie te bewijzen, voerden ze een "gecontroleerde chirurgie" uit op de hersenen van de robot. In plaats van te gokken, gebruikten ze hun "veranderkaart" om te beslissen wat ze moesten snijden.

  1. De Verkeerde Snede: Ze probeerden de delen weg te snijden die niet veel veranderden (in de veronderstelling dat dit veilige overblijfselen waren). Resultaat: De robot stortte onmiddellijk in. Hij kon niet meer bewegen.
  2. De Juiste Snede: Ze probeerden de delen weg te snijden die juist veel veranderden (in de veronderstelling dat dit de nieuwe, actieve delen waren). Resultaat: Verrassend genoeg bleef de robot bijna perfect functioneren!

De Analogie: Stel je een huis voor. De oude chef woonde daar en had een bibliotheek vol boeken (de VLM). Toen de robot er introk, bouwde hij een nieuwe sportschool in de kelder (de VLA-adaptatie).

  • De Oude Manier was om willekeurig muren neer te halen. Als het huis instortte, zouden ze de muren later gewoon weer opbouwen.
  • De Nieuwe Manier was om naar de blauwdrukken van de nieuwe sportschool te kijken. Ze realiseerden zich dat de nieuwe steunbalken van de sportschool de onderdelen waren die veranderden. Ze ontdekten dat de oude boeken in de bibliotheken, die helemaal niet veranderden, eigenlijk degenen waren die het dak omhoog hielden! Door de onderdelen van de nieuwe sportschool te snijden die daadwerkelijk redundant waren (of de veranderde onderdelen die essentieel waren te behouden), konden ze het huis verkleinen zonder dat het instortte.

De Resultaten: Kleiner, Sneller, Geen Her-training

Door middel van deze "veranderkaart"-strategie slaagden ze erin om twee beroemde robot-hersenen (OpenVLA en π\pi0.5) met 12% tot 30% te verkleinen.

  • De Magie: Ze deden dit zonder enige her-training of fine-tuning. De robot werkte onmiddellijk na de ingreep.
  • De Vergelijking: Wanneer ze andere populaire snijmethoden probeerden (zoals "snijd de grootste getallen weg" of "snijd de meest gebruikte getallen weg"), faalden de robots volledig, tenzij ze een lange tijd opnieuw getraind werden.
  • De Efficiëntie: Ze bespaarden veel geheugen (waardoor de robot op kleinere, goedkopere computers past) terwijl ze ongeveer 90% van de oorspronkelijke prestaties behielden.

De Belangrijkste Les

De paper concludeert dat we niet simpelweg moeten gokken wat we moeten wegsnijden of moeten vertrouwen op het achteraf oplossen van fouten. Door te kijken naar hoe de hersenen veranderden toen ze leerden bewegen, kunnen we de "overbodige" delen met precisie vinden. Dit stelt ons in staat om kleinere, snellere en efficiëntere robots te bouwen die met beperkte middelen kunnen draaien, simpelweg door de specifieize "groei" te begrijpen die plaatsvond toen de chef een robot werd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →