← Nieuwste papers
💻 computer science

Efficient Zeroth-Order Federated Finetuning of Language Models on Resource-Constrained Devices

Dit artikel stelt een nieuwe zeroth-order federated learning-methode voor die modellen in blokken splitst en perturbaties strategisch toewijst om efficiënt hergebruik van tussenliggende activaties mogelijk te maken, waarmee een reductie van 3x in de computationele vraag wordt bereikt voor het finetunen van grote taalmodellen op apparaten met beperkte middelen, terwijl de geheugen- en communicatievoordelen van federated learning behouden blijven.

Oorspronkelijke auteurs: Mohamed Aboelenien Ahmed, Kilian Pfeiffer, Ramin Khalili, Heba Khdr, Jörg Henkel

Gepubliceerd 2026-06-19
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Mohamed Aboelenien Ahmed, Kilian Pfeiffer, Ramin Khalili, Heba Khdr, Jörg Henkel

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantisch, ongelooflijk slim robotbrein hebt (een Large Language Model) dat je een nieuwe truc wilt leren. Normaal gesproken heb je om dit brein te onderwijzen een enorme supercomputer nodig met enorme hoeveelheden geheugen en veel tijd. Maar wat als je dit brein wilt onderwijzen met behulp van duizenden kleine, zwakke apparaten zoals smartphones of smart home-gadgets, zonder ooit hun privédata naar een centrale computer te sturen? Dit wordt Federated Learning genoemd.

Het probleem is dat deze kleine apparaten te zwak zijn om de "backpropagation"-methode (de standaard manier om AI te onderwijzen) aan te kunnen, die veel tijdelijke data vereist om op te slaan. Als ze dit proberen, raken ze het geheugen kwijt en crashen ze.

De Oude Oplossing: Zeroth-Order Optimization (ZO)

Om het geheugenprobleem op te lossen, hebben onderzoekers een methode ontwikkeld genaamd Zeroth-Order Optimization (ZO).

  • De Analogie: Stel je voor dat je probeert het laagste punt in een mistige vallei te vinden (de beste manier om de robot te onderwijzen) zonder een kaart te zien. De oude manier van onderwijzen (backpropagation) is als een GPS die je precies vertelt welke kant beneden is. De ZO-methode is als met een stok in de grond prikken. Je prikt in willekeurige richtingen om te voelen of het omhoog of omlaag gaat.
  • Het Nadeel: Om een goed idee te krijgen van welke kant de weg naar beneden is, moet je veel, veel keren in de grond prikken in verschillende richtingen. Hoewel dit geheugen bespaart (je hebt geen GPS-kaart nodig), is het erg traag en rekenkundig zwaar omdat je zo vaak moet prikken.

De Nieuwe Oplossing: FedSPZO

De auteurs van dit artikel stellen een nieuwe methode voor genaamd FedSPZO (Federated Split-Perturbation Zeroth-Order Optimization). Ze hebben een slimme manier gevonden om het "prikproces" veel sneller te maken zonder aan nauwkeurigheid in te boeten.

Zo hebben ze het gedaan, met behulp van een Twee-Staps Keuken analogie:

  1. De Keuken Splitsen: Stel je voor dat het robotbrein een keuken is met twee secties:

    • Sectie A (Het Voorbereidingsstation): Een grote ruimte waar ingrediënten worden gehakt en gemengd. Dit is het "eerste blok" van het model.
    • Sectie B (De Oven): Een kleinere ruimte waar het uiteindelijke koken gebeurt. Dit is het "tweede blok".
  2. De Oude Manier (Inefficiënt): Om te achterhalen hoe de hele keuken verbeterd kan worden, zou de oude methode willekeurig de gehele keuken (zowel het voorbereidingsstation als de oven) veranderen en het eten proeven. Daarna zou het de keuken weer veranderen, en weer, en weer. Omdat de keuken enorm groot is, duurt het lang om na elke kleine verandering het eten te proeven.

  3. De FedSPZO Manier (Efficiënt):

    • Stap 1: Ze veranderen alleen het Voorbereidingsstation (Sectie A) een klein beetje. Ze laten de Oven (Sectie B) exact hetzelfde.
    • Stap 2: Ze nemen de output van het Voorbereidingsstation en halen deze door de Oven heel, heel vaak, waarbij ze telkens slechts kleine willekeurige veranderingen aanbrengen alleen in de Oven.
    • De Magie: Omdat het Voorbereidingsstation niet is veranderd, hoeft de keuken de ingrediënten niet telkens opnieuw te "hakken" elke keer dat ze de Oven testen. Ze kunnen de gehakt ingrediënten (tussenliggende activaties) gewoon hergebruiken en zich alleen richten op het testen van de Oven.
    • Resultaat: Ze krijgen een zeer nauwkeurig beeld van hoe de Oven (en het Voorbereidingsstation indirect) verbeterd kan worden met veel minder totale "proefstappen" dan voorheen.

Wat Hebben Ze Ontdekt?

De onderzoekers hebben dit getest op verschillende beroemde AI-modellen (zoals RoBERTa, OPT en LLaMA) en ontdekten:

  • Snelheid: Hun nieuwe methode is tot wel 3 keer sneller (in termen van computerberekeningen) dan andere vergelijkbare "prikmethoden".
  • Geheugen: Het gebruikt nog steeds heel weinig geheugen, waardoor het perfect is voor kleine apparaten zoals telefoons, net als de originele "prikmethode".
  • Communicatie: Het stuurt slechts minuscule hoeveelheden data terug naar de centrale server (alleen getallen, niet het hele brein), wat geweldig is voor trage internetverbindingen.
  • Nauwkeurigheid: De robot leerde de nieuwe trucs bijna net zo goed als de standaard, zware methoden, met slechts een minimale daling in prestaties.

De Kernboodschap

Beschouw FedSPZO als een slimme manier om een gigantische robot te onderwijzen met een zwerm van kleine, zwakke apparaten. In plaats van elk apparaat een enorme, geheugenverslindende berekening te laten doen, breken ze de taak op in twee delen. Ze doen het zware werk één keer en hergebruiken dat werk vervolgens om veel snel te verschillende kleine veranderingen te testen. Dit maakt het mogelijk om krachtige AI te trainen op apparaten die dat normaal gesproken niet zouden kunnen, waarbij tijd, batterij en data worden bespaard.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →