TrimMoE A communication aware and adaptive depth framework for distributed edge inference
TrimMoE is een communicatiebewust, adaptief diepteframework voor gedistribueerde edge-inferentie dat de latentie en het verkeer tussen servers vermindert door dynamisch laagoverslaan, vertrouwen-gebaseerde vroege exits en substitutie-executie te combineren, terwijl wordt gegarandeerd dat de degradatie van de taalkwaliteit binnen een geconfigureerd budget blijft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je het internet voor als een enorme, bruisende stad waar gigantische, superintelligente robots (genaamd Large Language Models) wonen. Deze robots zijn ongelooflijk getalenteerd in het schrijven van verhalen, het oplossen van wiskundige problemen en het chatten met ons, maar ze zijn ook enorm groot en hunkeren naar stroom. Omdat ze te groot zijn om in een enkele smartphone of een kleine lokale computer te passen, moeten we ze opdelen en ze in veel verschillende gebouwen verspreid door de stad laten wonen. Dit wordt "distributed edge inference" genoemd.
Maar er is een verkeersopstopping. Elke keer als de robot moet nadenken, moet hij vaak een bericht naar een ander gebouw sturen om een specifieke expert om hulp te vragen. Als de gebouwen ver uit elkaar liggen of de wegen traag zijn, komt de robot vast te zitten terwijl hij wacht tot het bericht bij het juiste gebouw is aangekomen. Lange tijd probeerden ingenieurs dit op te lossen door snellere wegen aan te leggen of betere bezorgwagens te gebruiken om de berichten sneller naar het juiste gebouw te krijgen. Maar wat als het echte probleem niet het verkeer is, maar het feit dat de robot om hulp vraagt die hij eigenlijk niet nodig heeft? Wat als hij de vraag geheel kan overslaan, of kan stoppen met nadenken zodra hij het antwoord al weet? Dit is de grote vraag die dit artikel aanpakt: in plaats van alleen de levering sneller te maken, kunnen we de robot ervoor zorgen dat hij helemaal geen onnodige ritten maakt?
Het artikel introduceert een slim nieuw systeem genaamd TrimMoE (wat klinkt als "het overtollige vet wegsnijden" van een model). Denk aan het brein van de robot als een lange gang met veel deuren, waarbij elke deur leidt naar een andere expert. Op de oude manier zou de robot door elke deur lopen, zelfs als de experts achter de latere deuren gewoon herhaalden wat de eerdere experts zeiden, of als de robot halverwege de gang het antwoord al had gevonden. Dit verspilde tijd en verstikte de wegen tussen de gebouwen.
TrimMoE verandert het spel door de robot twee superkrachten te geven. Ten eerste leert het om deuren over te slaan. Als de robot beseft dat een specifieke expert niet erg belangrijk is voor de huidige taak, loopt hij er gewoon langs zonder aan te kloppen. Ten tweede leert het om vroegtijdig te stoppen. Als de robot genoeg vertrouwen heeft dat hij het juiste antwoord heeft, stopt hij volledig met het lopen door de gang en gaat hij direct naar de finishlijn.
Maar hier komt het lastige deel: je kunt niet zomaar dingen overslaan of stoppen, anders geeft de robot misschien een stom antwoord. De auteurs hebben een slimme "verkeerregelaar" gebouwd die beslist wanneer er precies overgeslagen of gestopt moet worden. Voordat de robot begint met werken, bestudeert deze regelaar een reeks oefenopdrachten om te leren welke deuren meestal belangrijk zijn en welke slechts opvulling zijn. Het stelt ook een strikt "kwaliteitsbudget" in. Stel je voor dat je een klein zakgeld hebt aan "fouten" die je mag maken. Het systeem besteedt dit zakgeld heel zorgvuldig, alleen wanneer het overslaan van een deur een enorme hoeveelheid tijd bespaart, zodat de robot nooit zijn zakgeld opmaakt en een slecht antwoord geeft.
Het systeem wordt ook heel slim over waar de robot zich bevindt. Als de robot zich momenteel in Gebouw A bevindt, maar de volgende expert die hij nodig heeft in Gebouw B zit (ver weg), dan controleert het systeem: "Is deze expert belangrijk?" Als dat niet zo is, slaat het de rit naar Gebouw B over en blijft het in Gebouw A. Als de expert belangrijk is, stuurt het de robot erheen. Maar als de robot al voldoende vertrouwen heeft, stopt het de hele reis daar direct, wat alle toekomstige ritten naar andere gebouwen bespaert.
De onderzoekers testten dit idee op een echt testbed met 10 verschillende servers (computers) die allemaal verschillende groottes en snelheden hadden, verbonden via reguliere internetlijnen (geen super-snelle, speciale kabels). Ze gebruikten drie verschillende versies van slimme robots, waaronder een grote genaamd Mixtral-8x7B. De resultaten waren indrukwekkend. Door TrimMoE te gebruiken, verkortten ze de gemiddelde wachttijd voor de reactie van de robot met wel 62,8%. Dat is alsof je een wachttijd van 10 minuten omzet in slechts 3 minuten! Ze verminderden ook de hoeveelheid data die tussen de gebouwen reisde met 77,2%, wat betekent dat de netwerkwegen veel minder druk waren.
Het belangrijkste is dat de robot niet dommer werd. Ondanks dat hij stappen oversloeg en vroegtijdig stopte, bleef de kwaliteit van zijn antwoorden zeer hoog; de nauwkeurigheid daalde in de slechtste gevallen met minder dan 2%. Het systeem bewees dat door slim te zijn over wanneer te stoppen en wat over te slaan, je deze gigantische AI-modellen veel sneller en goedkoper kunt laten draaien zonder hun intelligentie te verliezen. Het gaat er niet om snellere wegen aan te leggen; het gaat erom te beseffen dat je niet naar de winkel hoeft te rijden als je het artikel al in je zak hebt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.