← Nieuwste papers
🤖 machine learning

Device-Cloud Collaborative LLM Inference with Multi-Modal, Multi-Task, Multi-Turn Conversations

Dit artikel introduceert TMO, een device-cloud collaboratief LLM-inferentiesysteem dat gebruikmaakt van een met beperkte middelen geoptimaliseerde reinforcement learning-strategie om offloading-beslissingen dynamisch te optimaliseren over multi-modale, multi-task en multi-turn gesprekken, waardoor een balans wordt gevonden tussen responskwaliteit, latentie en kosten, terwijl de beperkingen van lokale middelen bij on-device implementatie en de communicatieoverhead van cloud-only oplossingen worden overwonnen.

Oorspronkelijke auteurs: Liangqi Yuan, Dong-Jun Han, Shiqiang Wang, Christopher G. Brinton

Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Liangqi Yuan, Dong-Jun Han, Shiqiang Wang, Christopher G. Brinton

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligent, gigantisch brein hebt dat in een verre cloud leeft, en een piepklein, vinnig brein dat rechtstreeks in je zak zit. Het gigantische brein kan alles zien, alles horen en onmogelijke puzzels oplossen, maar het duurt lang voordat het met je communiceert en het kost veel "digitale munten" om te gebruiken. Het zakkenbrein is super snel en gratis te gebruiken, maar het is een beetje vergeetachtig en begrijpt alleen woorden, geen foto's of complexe scènes.

Dit is exact het probleem waar de onderzoekers achter TMO (Three-M Offloading) een oplossing voor zoeken. Ze hebben een slimme "verkeersregelaar" gebouwd die beslist of hij voor elke vraag die je stelt, je zakkenbrein het werk laat doen of de vraag naar het gigantische cloudbrein stuurt. Maar hier komt de twist: je stelt niet slechts één vraag. Je voert een lang, meerregelig gesprek (zoals vragen: "Wat eten we vanavond?", gevolgd door "Waar staan de borden?" en daarna "Kun je het licht aanzetten?"). Bovendien maak je misschien foto's of video's om het brein te helpen begrijpen wat er gebeurt.

De onderzoekers ontdekten dat simpelweg gokken of altijd het grote brein gebruiken een slecht idee is. In plaats daarvan hebben ze een speciale besluitvormer getraind met behulp van Reinforcement Learning (denk aan een videogame waarin de AI leert door dingen te proberen en punten te scoren voor snelheid, goedkoop zijn en nauwkeurigheid). Deze AI leerde een spel van "Resource Management" spelen met hoge inzet.

De Grote Ontdekking
De belangrijkste bevinding is dat deze slimme controller drie lastige zaken tegelijkertijd kan jongleren: Multi-modal (tekst, foto's, video's), Multi-task (berichten bewerken, verloren voorwerpen vinden, aanbevelingen geven) en Multi-turn (het gesprek gaande houden).

In hun tests, waarbij meer dan 21.000 gesprekssessies werden uitgevoerd met een aangepaste dataset genaamd M4A1, lieten de resultaten van het TMO-systeem zien dat het andere methoden kon verslaan. Het slaagde erin om de kwaliteit van de reacties hoog te houden (een score van rond de 1,06 op hun schaal), terwijl de wachttijd werd beperkt tot ongeveer 13,07 seconden en de kosten laag bleven op 0,01371 USD (of 13,71 duizendsten van een dollar). Het belangrijkste is dat dit gebeurde zonder de regels te overtreden: het overschreed nooit de tijdslimiet van 30 seconden of de bestedingslimiet van 0,05 USD.

Waar ze "Nee" tegen zeiden
Het artikel is heel duidelijk over wat niet werkt. Ze testten het gebruik van een "Router" (een andere AI die gewoon het antwoord raadt zonder te leren) en vonden dat dit faalde. Sommige routers waren te lui en negeerden alle foto's, terwijl anderen te hebberig waren en voor elke vraag elke foto verstuurden, wat geld en tijd verspilde. De onderzoekers argumenteerden ook tegen het gebruik van "Expert"-data (waarbij een mens het perfecte antwoord aan de AI laat zien). Ze merkten op dat zelfs mensen moeite hebben om het perfecte moment te bepalen om een foto te sturen of van brein te wisselen in een lang gesprek, dus bouwden ze hun systeem met behulp van gerandomiseerde acties. Dit dwong de AI om de regels van het spel zelf te leren, in plaats van simpelweg een mens na te bootsen die misschien aan het gissen is.

Hoe zeker zijn ze?
De auteurs zijn vol vertrouwen over hun resultaten, maar ze benadrukken voorzichtig dat dit simulaties en experimenten zijn gebaseerd op hun specifieke dataset, en nog geen magische oplossing voor elke situatie in de echte wereld. Ze bewezen dat hun systeem beter werkt dan de "State-of-the-Art" (SOTA) methoden die ze testten, zoals AIwRG en PerLLM, door duizenden proeven uit te voeren.

Bijvoorbeeld, toen ze testten wat er gebeurt als de cloud supertraag wordt (waardoor de wachttijd 10 keer langer wordt), schakelde hun systeem slim terug naar het zakkenbrein om te voorkomen dat de tijdslimiet werd overschreden. Toen ze verschillende soorten apparaten testten, van een kleine Raspberry Pi tot een krachtige iPhone 15 Pro, paste het systeem zich perfect aan, wat aantoont dat het niet uitmaakt welk type hardware je hebt, zolang het de regels maar kent.

De "Onzekerheid"-truc
Een van de coolste onderdelen is hoe ze omgingen met het feit dat AI-antwoorden een beetje onvoorspelbaar kunnen zijn. Soms krijgt dezelfde vraag een iets andere score. Om dit op te lossen, gebruikten ze een "nearest neighbor"-strategie. Stel je voor dat je de score van een nieuwe vraag probeert te raden; in plaats van blind te gokken, kijkt het systeem naar de 5 dichtstbijzijnde vragen die het eerder heeft gezien (zijn buren) en middelt hun scores. Dit hielp het systeem stabiel te blijven, zelfs wanneer de data een beetje rommelig was.

De Kern van het Verhaal
Het artikel suggereert dat we door deze slimme, op middelen bewuste leermethode het beste van beide werelden kunnen hebben: de snelheid en lage kosten van een apparaat, gecombineerd met de superintelligente, multi-visuele kracht van de cloud. Het is nog geen opgelost probleem voor de hele wereld, maar in hun simulaties liet TMO zien dat het de rommelige, realistische complexiteit van het praten met een AI kan aanpakken—terwijl het foto's, video's en lange gesprekken beheert zonder je budget of je geduld te overschrijden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →