← Nieuwste papers
💻 computer science

Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models

Dit artikel stelt een privacy-gecentreerd edge-cloud collaboratief framework voor de inferentie van grote taalmodellen voor, dat gebruikmaakt van endpoint-geauthenticeerde KV-caches en versleutelde gegevensoverdracht om latentie en bandbreedtegebruik aanzienlijk te verminderen, terwijl de gebruikersprivacy op heterogene apparaten behouden blijft.

Oorspronkelijke auteurs: Yi Li, Chen Li, Jiexiong Liu

Gepubliceerd 2026-07-16
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yi Li, Chen Li, Jiexiong Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligent robotbrein hebt dat verhalen kan schrijven, wiskundige problemen kan oplossen en kan chatten als een mens. Dit noemen we een Large Language Model (LLM). Maar hier zit de crux: deze breinen zijn zo enorm groot en hongerig naar stroom dat ze meestal niet in je telefoon of laptop passen. Ze leven op gigantische, krachtige computers in de cloud. Dus wanneer je je telefoon een vraag stelt, moet je telefoon je vraag over het internet naar de cloud schreeuwen, wachten tot de gigantische hersenen hebben nagedacht, en dan luisteren naar het antwoord. Dit werkt geweldig, maar het heeft twee grote problemen. Ten eerste is het traag omdat het heen en weer schreeuwen tijd kost. Ten tweede is het riskant omdat je de cloud je geheime gedachten, je privégeschiedenis en je exacte woorden moet vertellen. Het is alsoals een dagboekfragment naar een vreemde sturen, alleen maar om een reactie te krijgen.

Om dit op te lossen, hebben wetenschappers geprobeerd de taken te splitsen: laat je telefoon de makkelijke delen doen en stuur de moeilijke delen naar de cloud. Maar zelfs dat is lastig. Als je te veel data stuurt, is het traag. Als je te weinig stuurt, raakt de cloud in de war. En als je je ruwe gedachten stuurt, loopt je privacy nog steeds risico. Dit artikel onderzoekt een nieuwe manier om dit spel van "verstoppertje spelen" met je gegevens te spelen. Het stelt een slim partnerschap voor waarbij jouw apparaat en de cloud samenwerken als een detective en een bibliothecaris. Het apparaat houdt de meest gevoelige aanwijzingen (zoals je privégeschiedenis en specifieke woordenschat) verborgen, terwijl de cloud het zware werk doet van het lezen van de boeken. Het doel is om het robotbrein snel genoeg te maken om direct met je te chatten, maar privaat genoeg zodat de cloud nooit je ruwe geheimen ziet.

De Detective en de Bibliothecaris: Een Nieuwe Manier om met AI te Chatten

Hoe werkt dit nieuwe systeem dan eigenlijk? De auteurs van dit artikel, Yi Li, Chen Li en Jiexiong Liu van KunlunMeta, hebben een framework gebouwd dat ze "edge–cloud collaborative inference" noemen. Denk aan een spannend spelletief "Telefoontje" waarbij je een bericht door een drukke kamer wilt doorgeven, maar je wilt niet dat de persoon in het midden (de cloud) weet waar het bericht over gaat, en je wilt niet dat ze te lang doen over het herhalen ervan.

In deze nieuwe opstelling fungeert jouw apparaat (de "edge") als een slimme detective, en de cloud fungeert als een enorme, krachtige bibliothecaris. Hier is de goocheltruc:

1. De Detective doet het huiswerk (Privacy Eerst)
In plaats van je ruwe vraag naar de cloud te schreeuwen, doet jouw apparaat eerst wat huiswerk. Het zet je woorden om in een geheime code (genaamd "embeddings") en beslist precies hoeveel van je eerdere gesprekshistorie de cloud mag zien. Het is alsof de detective de bibliothecaris een lijst overhandigt van alleen de boeken die de bibliothecaris mag controleren, zonder ooit de werkelijke dossierstukken van de detective te onthullen. Het apparaat houdt ook een speciale "conceptversie" bij van wat het denkt dat het antwoord zou kunnen zijn. Dit wordt "speculative decoding" genoemd. Het is alsof de detective de volgende zin van een verhaal raadt voordat de bibliothecaris de huidige pagina zelfs maar heeft uitgelezen.

2. De Bibliothecaris doet het zware werk (Maar Alleen Wat Nodig Is)
De cloud ontvangt deze geheime code en de "toestemmingsverklaring" (de cache authorization). De cloud ziet je ruwe woorden niet; het ziet alleen de wiskunde. Het gebruikt zijn superkrachtige brein om de geautoriseerde geschiedenis te lezen en de moeilijke delen te verwerken. Cruciaal is dat de cloud niet het volledige antwoord in één keer berekent. Het berekent alleen het deel van het antwoord dat de detective nog niet had geraden. Dit wordt "split vocabulary projection" genoemd. Stel je voor dat de cloud alleen de laatste paar woorden van een zin hoeft op te schrijven, terwijl jouw apparaat de rest invult op basis van zijn eigen lokale kennis.

3. De Handdruk (Snel en Veilig)
Zodra de cloud zijn deel heeft voltooid, stuurt het een klein, versleuteld stukje van het antwoord terug naar jouw apparaat. Jouw apparaat combineert dan zijn eigen gok met het stukje van de cloud om het definitieve antwoord te vormen. Omdat ze samenwerken, hoeven ze niet te wachten tot de hele zin is geschreven voordat ze naar de volgende gaan. Ze kunnen "speculeren" en hun werk parallel controleren. Om alles veilig te houden, wordt alle data die tussen hen heen en weer vliegt versleuteld met een speciaal slot (AES-GCM encryptie), zodat zelfs als een hacker meeluistert, ze alleen maar wartaal zien.

De Resultaten: Sneller, Kleiner en Veiliger

De onderzoekers bouwden een prototype van dit systeem en testten het op verschillende soorten apparaten: een standaardcomputer met alleen een CPU (zoals een basis kantoor-PC), een krachtige computer met een grafische kaart (GPU), en een klein ingebed apparaat (zoals een slimme thermostaat of een auto-computer).

Ze ontdekten dat dit detective-en-bibliothecaris-team aanzienlijk sneller is dan de oude manieren van werken.

  • Snelheid: Vergeleken met een "naïef" gesplitst systeem (waarbij ze het model gewoon in tweeën hakken zonder de fancy privacytrucs), verminderde deze nieuwe methode de tijd die nodig is om elk woord te genereren met wel 46,1% op GPU-apparaten. Op een standaard CPU was het nog steeds 29,4% sneller.
  • Databesparing: Omdat ze alleen de delen van het antwoord sturen die strikt noodzakelijk zijn, daalde de hoeveelheid data die van de cloud terugkwam met wel 67,4% wanneer het gesprek in het Engels was (wat een kleinere subset van woorden gebruikt).
  • Kwaliteit: Het belangrijkste deel is dat de antwoorden nog steeds net zo goed zijn. Het systeem produceerde antwoorden die voor 98,6% identiek waren aan wat het volledige cloudmodel op zichzelf zou hebben gezegd. Het kleine verschil kwam voornamelijk doordat de wiskunde iets vereenvoudigd werd om op kleinere apparaten te passen.

Wat dit Systeem Niet Is

Het is belangrijk om te begrijpen wat dit artikel niet beweert. De auteurs zijn heel duidelijk dat dit geen magisch schild is dat de cloud volledig blind maakt. De cloud ziet nog steeds de "feature tensors" (de geheime codes) en de "draft tokens" (de gokjes). Als een zeer slimme hacker met veel extra kennis probeert de geheime code terug te ontcijferen, zouden ze nog steeds iets over jouw input kunnen leren. Het artikel stelt expliciet dat dit geen formele garantie is van "differential privacy" (een strikte wiskundige definitie van privacy). In plaats daarvan biedt het een praktische, systeemniveau beschermingslaag. Het maakt het veel moeilijker voor de cloud om je ruwe dagboek te zien, maar het maakt het dagboek niet onzichtbaar voor een superdetective met de juiste tools.

Daarnaast sluit het artikel de mogelijkheid uit dat je het hele gigantische brein gewoon op je telefoon kunt draaien. Voor de meeste consumentenapparaten is de wiskunde nog steeds te zwaar. De "endpoint-only" oplossing (waarbij de telefoon alles doet) was veel langzamer en produceerde antwoorden van lagere kwaliteit vergeleken met de collaboratieve aanpak.

Waarom dit Belangrijk is

Dit artikel suggereert dat we niet hoeven te kiezen tussen een snelle, slimme AI en een private AI. Door het apparaat en de cloud te behandelen als een team waarbij het apparaat de sleutels van de meest gevoelige delen van het gesprek vasthoudt, kunnen we het beste van beide werelden krijgen. Het systeem past zich aan aan welk apparaat je ook hebt, of het nu een krachtige gaming-PC is of een kleine chip in je auto, waardoor een private, snelle AI-chat een realistische mogelijkheid wordt voor de toekomst. De auteurs hebben deze resultaten gemeten in een gecontroleerde laboratoriumsetting, en hoewel de cijfers veelbelovend zijn, zal de echte test zijn hoe goed dit standhoudt in de rommelige, onvoorspelbare echte wereld. Maar voor nu is het een grote stap richting een slimme assistent die je geheimen respecteert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →