← Nieuwste papers
💻 computer science

Unlocking the Edge deployment and ondevice acceleration of multi-LoRA enabled one-for-all foundational LLM

Deze paper presenteert een hardwarebewust raamwerk dat de efficiënte implementatie van een veelzijdige, meertalige LLaMA-fundamentele taalmodel op Samsung Galaxy-smartphones mogelijk maakt door dynamische LoRA-schakeling, multi-stream decoding en Dynamic Self-Speculative Decoding te combineren, wat leidt tot aanzienlijke verbeteringen in geheugengebruik en latentie zonder kwaliteitsverlies.

Oorspronkelijke auteurs: Sravanth Kodavanti, Sowmya Vajrala, Srinivas Miriyala, Utsav Tiwari, Uttam Kumar, Utkarsh Kumar Mahawar, Achal Pratap Singh, Arya D, Narendra Mutyala, Vikram Nelvoy Rajendiran, Sharan Kumar Allur, Eun
Gepubliceerd 2026-04-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sravanth Kodavanti, Sowmya Vajrala, Srinivas Miriyala, Utsav Tiwari, Uttam Kumar, Utkarsh Kumar Mahawar, Achal Pratap Singh, Arya D, Narendra Mutyala, Vikram Nelvoy Rajendiran, Sharan Kumar Allur, Euntaik Lee, Dohyoung Kim, HyeonSu Lee, Gyusung Cho, JungBae Kim

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, superintelligente bibliotheek in je broekzak wilt dragen. Dat is wat deze paper doet: het legt uit hoe Samsung het mogelijk heeft gemaakt om een zeer slimme kunstmatige intelligentie (een "Large Language Model" of LLM) direct op je telefoon te laten werken, zonder dat je internet nodig hebt.

Hier is hoe ze dat voor elkaar hebben gekregen, vertaald naar alledaagse taal en met een paar leuke vergelijkingen.

1. Het Probleem: De Zware Koffer

Stel je voor dat deze slimme AI een enorme, zware koffer is. Op een server (een grote computer in een datacenter) is het geen probleem om deze koffer te dragen; er is veel ruimte en kracht. Maar op je telefoon? Daar is de ruimte krap, de batterij snel leeg en de koffer is veel te zwaar om mee te nemen.

Vroeger moest je voor elke taak (zoals "schrijf een e-mail" of "vertaal dit") een andere, aparte koffer hebben. Dat zou je telefoon direct platleggen.

2. De Oplossing: De "Magische" Basis

De onderzoekers van Samsung hebben een slimme truc bedacht. In plaats van acht verschillende zware koffers, hebben ze één basis-koffer gemaakt. Dit is hun "Foundation Model" (gebaseerd op LLaMA).

Maar hoe kun je dan toch verschillende taken doen?

  • De LoRA-stickers: Stel je voor dat je die ene basis-koffer hebt, maar je kunt er verschillende "stickers" of "modules" op plakken. Als je een e-mail wilt schrijven, plak je de "e-mail-sticker" erop. Wil je iets beleefd formuleren? Dan plak je de "beleefdheid-sticker" erop.
  • Het Geniale: Deze stickers zijn zo klein en licht dat ze er bijna geen gewicht bijvoegen. En het beste deel: je hoeft de koffer niet te vervangen of te herbouwen. Je plakt de sticker erop terwijl je de koffer vasthoudt, en poef, je kunt direct een andere taak uitvoeren. Dit noemen ze "Multi-LoRA enablement".

3. Snelheid: De "Toneelgroep" in plaats van de "Solostart"

Normaal gesproken vraagt een telefoon aan de AI: "Geef me een antwoord in een formele stijl." De AI denkt na, geeft een antwoord. Dan vraag je: "Geef me nu een antwoord in een grappige stijl." De AI moet opnieuw helemaal van voren af aan beginnen denken. Dat duurt lang.

De onderzoekers hebben een nieuwe manier bedacht, die ze Concurrent Token Generation noemen.

  • De Vergelijking: Stel je voor dat de AI een toneelgroep is. In plaats van dat één acteur eerst een ernstige scène speelt, en daarna de zelfde acteur de scène opnieuw speelt maar dan grappig, laten ze acht acteurs tegelijk op het toneel staan.
  • Ze gebruiken dezelfde script (de basis), maar elke acteur speelt een andere versie (formeel, beleefd, grappig, etc.) tegelijkertijd.
  • Het Resultaat: In plaats van 8 keer te wachten, krijg je alle 8 de opties in één keer. Dat is tot 6 keer sneller.

4. De "Voorspeller": De Dynamische Gokker

Het laatste probleem is dat AI vaak woord voor woord moet denken, wat traag is.

  • De Vergelijking: Stel je voor dat je een tekst schrijft. Normaal denk je: "Ik ga het woord 'snel' schrijven." Dan wacht je even, en denk je: "En daarna 'voetbal'."
  • De onderzoekers hebben een methode bedacht genaamd Dynamic Self-Speculative Decoding.
  • Hoe het werkt: De AI is nu een beetje een gokker. Ze zegt: "Ik ga het woord 'snel' schrijven, maar ik gok er ook alvast op dat het daarna 'voetbal' en 'wedstrijd' wordt." Ze schrijft die woorden alvast op een los velletje papier (de "voorspelling").
  • Vervolgens checkt ze heel snel: "Was mijn gok goed?" Als ja, dan heeft ze 3 woorden geschreven in de tijd dat ze er normaal 1 had geschreven. Als nee, dan corrigeert ze het.
  • Omdat ze vaak goed gokt, gaat het schrijven 2 keer sneller.

5. De Resultaten: Alles in je Broekzak

Door al deze trucjes samen te voegen (de kleine stickers, de toneelgroep en de snelle gokker), hebben ze het volgende bereikt:

  • Geen internet nodig: Alles gebeurt op je Samsung Galaxy S24 of S25. Je privacy is veilig, want je data verlaat je telefoon niet.
  • Snelheid: Het is 4 tot 6 keer sneller dan zonder deze trucjes.
  • Veel talen: Het werkt in 9 verschillende talen, van Nederlands en Engels tot Koreaans en Japans.
  • Geen kwaliteitsverlies: Ondanks dat ze de "koffer" hebben verkleind (door getallen te ronden, wat ze "quantization" noemen), blijft de AI net zo slim als de grote versie.

Conclusie

Kortom: Samsung heeft een manier gevonden om een gigantische, slimme computer in een klein, energiezuinig apparaat te proppen. Ze hebben de "zware koffer" vervangen door een slimme basis met wisselbare stickers, een team dat tegelijk werkt, en een gokker die vooruit denkt. Hierdoor kun je nu echt slimme AI-functies gebruiken op je telefoon, zonder dat je batterij direct leeg is of dat je wacht op een antwoord.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →