← Nieuwste papers
💻 computer science

Eddy-VL 1.9B: Structural Pruning and Layered Distillation for Edge-Deployable Multimodal Embedding

Het artikel introduceert Eddy-VL 1.9B, een gecomprimeerd multimodaal embedding-model ontworpen voor edge-implementatie dat 91,7% van de prestaties van zijn 2,13B-leraar bereikt, terwijl het door middel van probe-gestuurde structurele pruning en gelaagde kennisdistillatie het aantal parameters met 9,5% en de latentie met 10% vermindert.

Oorspronkelijke auteurs: HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

Gepubliceerd 2026-07-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers tegelijkertijd kunnen "zien" en "lezen", waarbij ze een afbeelding van een kat die op een mat zit net zo goed begrijpen als de woorden "kat op mat". Dit is het domein van multimodale AI, een tak van de wetenschap waar machines leren om afbeeldingen, tekst en video te verbinden in één enkele, gedeelde taal. Om dit te doen, fungeren deze AI-modellen als gigantische vertalers die alles wat ze zien omzetten in een lange lijst met getallen die een embedding worden genoemd. Denk aan een embedding als een unieke vingerafdruk voor een stuk content; als twee vingerafdrukken erg vergelijkbaar zijn, weet de computer dat de content gerelateerd is.

Er is echter een addertje onder het gras. De slimste vertalers zijn meestal de zwaarste. Ze zijn als massieve, cloud-gebaseerde supercomputers die een constante, snelle internetverbinding nodig hebben om te werken. Maar wat als je in een geheime kelder, een bewijsstukkenkamer van de politie, of een afgelegen veldstation bent waar het internet is afgesneden? Je hebt een vertaler nodig die slim genoeg is om complexe aanwijzingen te begrijpen, maar klein genoeg om op een lokale laptop of een handheld apparaat te passen. Dit is de uitdaging van edge deployment: het mogelijk maken van krachtige AI die offline werkt, snel is en zonder een cloudverbinding.

Maak kennis met Eddy-VL 1.9B, een nieuw model dat specifiek is ontworpen voor deze "air-gapped" situaties waar privacy en snelheid alles zijn. De onderzoekers achter dit project begonnen met een zeer slimme, maar zeer zware, leraar-model genaamd Qwen3-VL-Embedding-2B. Deze leraar is als een briljante professor met 28 lagen diep nadenken, maar hij is te lomp om in een rugzak te dragen. Het team stelde een eenvoudige vraag: Kunnen we deze professor inkrimpen zonder dat hij vergeet hoe hij moet lesgeven?

Ze hebben niet zomaar willekeurige stukken weggehakt; ze gebruikten een slimme strategie genaamd structural pruning. Stel je het brein van de leraar voor als een gebouw van 28 verdiepingen. De onderzoekers gebruikten een speciale "sonde" om te meten hoeveel elke verdieping het werk van de verdiepingen direct erboven en eronder herhaalde. Ze ontdekten vier specifieke verdiepingen die veel redundant werk verrichtten—zoals het hebben van vier identieke kopieermachines op een rij wanneer er één genoeg zou zijn. Ze verwijderden deze vier verdiepingen, waardoor het gebouw van 28 verdiepingen naar 24 verdiepingen ging.

Maar hier komt het lastige deel: wanneer je verdiepingen uit een gebouw verwijdert, kunnen de mensen die op de bovenste verdieping wonen de weg kwijtraken. Om dit op te lossen, gebruikte het team layered distillation. Denk hierbij aan een meesterarchitect (de oorspronkelijke 28-verdiepingen tellende leraar) die een nieuwe, kleinere architect (de 24-verdiepingen tellende leerling) begeleidt. De leraar zegt niet alleen "bouw het"; hij laat de leerling precies zien hoe hij moet denken bij elke stap. Ze gebruikten een techniek genaamd CKA (die meet hoe vergelijkbaar de gedachten van twee lagen zijn) om ervoor te zorgen dat de middelste lagen van de leerling precies zo dachten als die van de leraar, en ze gebruikten een speciale "Matryoshka"-methode voor het uiteindelijke antwoord, zodat de leerling antwoorden van verschillende groottes kon geven, afhankelijk van de behoefte.

Het resultaat is Eddy-VL 1.9B. Het is een model met ongeveer 1,93 miljard parameters, dat 3,85 GB weegt—klein genoeg om op veel moderne apparaten te passen. In tests slaagde dit "gekrompen" model erin om ongeveer 91,7% van de intelligentie van de oorspronkelijke leraar te behouden. Terwijl de oorspronkelijke leraar een 68,9 scoorde op een enorme test met 78 verschillende taken (genaamd MMEB-V2), scoorde Eddy-VL een 63,2. Dat mag als een daling klinken, maar onthoud dat het model vier volledige lagen van het denken heeft verloren! Zonder de speciale onderwijstechnieken zou de score naar 56,8 zijn gekelderd. Het distillatieproces heeft succesvol 6,4 punten van dat verloren terrein teruggewonnen.

Het model kreeg ook een snelheidssprong. Omdat het minder lagen heeft om te verwerken, draait het ongeveer 10% sneller dan de oorspronkelijke versie, wat 136,4 milliseconden per afbeelding kost in plaats van 150,0 milliseconden. Dit lijkt misschien geen groot verschil, maar in een echte wereldonderzoek waarbij je duizenden in beslag genomen foto's offline scant, tellen die extra seconden op tot uren aan bespaarde tijd.

De onderzoekers waren zorgvuldig in het benoemen van de punten waar het model nog steeds moeite mee heeft. Hoewel het bijna net zo goed werd als de leraar in het begrijpen van complexe relaties tussen woorden en afbeeldingen (een score van 86,1% op één test vergeleken met de 86,4% van de leraar), had het nog steeds wat moeite met een specifiek type puzzel genaamd Winoground, waar het een 6,8 scoorde tegenover de 8,5 van de leraar. Dit suggereert dat hoewel het model uitstekend is voor algemene retrieval, sommige zeer lastige logische puzzels nog steeds een volledig, niet-gepruned brein vereisen.

Uiteindelijk is Eddy-VL 1.9B geen wondermiddel dat elk probleem oplost, maar het is een krachtig hulpmiddel voor een zeer specifieke taak. Het bewijst dat je een enorme, cloud-zware AI kunt nemen en deze kunt comprimeren tot een lichtgewicht, offline-klaar pakket zonder te veel van zijn ziel te verliezen. Voor onderzoekers, forensische experts en iedereen die werkt op plaatsen waar internet een luxe is die ze zich niet kunnen veroorloven, biedt dit model een manier om het licht aan te houden en de intelligentie hoog te houden, direct aan de rand van het netwerk.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →