← Nieuwste papers
🤖 machine learning

RepetitionCurse: Measuring and Understanding Router Imbalance in Mixture-of-Experts LLMs under DoS Stress

Dit artikel introduceert RepetitionCurse, een goedkope black-box-aanval die misbruik maakt van het ontbreken van load-balancingbeperkingen in Mixture-of-Experts-taalmodellen door gebruik te maken van eenvoudige repetitieve tokenpatronen om ernstige routeringsconcentratie af te dwingen, waardoor rekenkundige knelpunten ontstaan en de inferentielatentie en beschikbaarheid van de dienst aanzienlijk verslechteren.

Oorspronkelijke auteurs: Ruixuan Huang, Qingyue Wang, Hantao Huang, Yudong Gao, Dong Chen, Shuai Wang, Wei Wang

Gepubliceerd 2026-05-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ruixuan Huang, Qingyue Wang, Hantao Huang, Yudong Gao, Dong Chen, Shuai Wang, Wei Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een enorme, high-tech bibliotheek voor waar duizenden boeken (de "experts") op verschillende planken (de "GPU's") worden bewaard. Wanneer een bibliothecaris (de "router") een verzoek ontvangt, pakt hij niet zomaar één boek; hij kiest de top paar beste boeken om de vraag te beantwoorden. Om het proces snel te houden, splitst de bibliotheek het werk op: sommige planken verwerken de eerste paar boeken, anderen de volgende batch, en ze werken allemaal tegelijkertijd. Zo werken moderne AI-modellen die Mixture-of-Experts (MoE) worden genoemd. Ze zijn ontworpen om uiterst efficiënt te zijn door het werk gelijkmatig te verdelen.

Echter, een nieuw paper met de naam "RepetitionCurse" onthult een sluwe fout in de werking van deze bibliotheek.

Het Probleem: De "Kopieer-Plak" Truc

De onderzoekers ontdekten dat als je de bibliothecaris een vraag stelt met een zeer vreemd, repetitief patroon (zoals het typen van "AI AI AI AI..." keer op keer), de bibliothecaris in de war raakt.

Normaal gesproken kijkt de bibliothecaris naar de betekenis van je woorden om te beslissen welke boeken hij moet kiezen. Maar wanneer je een repetitief patroon gebruikt, stopt de bibliothecaris met het zoeken naar betekenis en begint hij als een gebroken plaat te handelen. In plaats van het werk over alle planken te verspreiden, besluit de bibliothecaris plotseling dat slechts één specifieke plank de juiste boeken heeft voor dit repetitieve patroon.

Het Resultaat: Een File

Hier is wat er vervolgens gebeurt:

  1. De Flesnek: Al het werk wordt op die ene plank gedumpt. De bibliothecarissen op die plank rennen wanhopig rond, in een poging alle boeken te vinden.
  2. De Werkloze Arbeiders: Ondertussen staan de bibliothecarissen op alle andere planken nietsdoend rond te wachten tot de drukke plank klaar is.
  3. De Vertraging: Omdat het hele systeem moet wachten tot die ene trage plank bijhaalt voordat het kan doorgaan met de volgende stap, komt de hele bibliotheek tot stilstand.

In de wereld van AI wordt deze vertraging Time-to-First-Token (TTFT) genoemd. Het is de tijd die het de AI kost om zijn eerste woord te zeggen. Onder normale omstandigheden is dit snel. Onder deze "RepetitionCurse"-aanval kan het de AI 2 tot 3 keer langer kosten om te beginnen met spreken.

Waarom Dit Belangrijk Is

Het paper noemt dit een Denial-of-Service (DoS)-aanval. Het is alsof iemand een fastfoodrestaurant binnenloopt en 1.000 identieke, ingewikkelde burgers tegelijk bestelt. De keuken raakt verstopt bij het maken van die specifieke burgers, en plotseling moet de persoon die gewoon een simpele koffie wilde een uur wachten.

  • De Aanval is Eenvoudig: Je hoeft geen hacker-genie te zijn. Je hoeft alleen maar repetitieve woorden te typen. Het paper noemt dit een "black-box"-aanval, wat betekent dat je niet hoeft te weten hoe het brein van de AI van binnen werkt; je hoeft alleen maar te weten dat het herhalen van woorden het evenwicht verstoort.
  • Het Werkt Overal: De onderzoekers testten dit op 139 verschillende AI-modellen (inclusief populaire modellen zoals Mixtral en Qwen). Ze ontdekten dat bijna allemaal kwetsbaar zijn.
  • Hoe Meer Je Skaalt, Hoe Erger Het Wordt: Ironisch genoeg, hoe krachtiger het AI-systeem is (met meer computers die parallel werken), hoe makkelijker het is om het te breken. De onderzoekers ontdekten dat het gebruik van meer computers om het werk te splitsen de file juist erger maakt wanneer deze aanval wordt gebruikt.

De Conclusie

Het paper concludeert dat het verdelen van het werk over veel computers AI wel sneller maakt, maar ook een zwak punt creëert. Als iemand een simpele, repetitieve truc gebruikt, kan hij het systeem dwingen zijn eigen efficiëntieregels te negeren, waardoor het dramatisch vertraagt en mogelijk zijn beloften aan gebruikers breekt (zoals "we zullen binnen 2 seconden antwoorden").

De auteurs suggereren dat, totdat AI-bedrijven een betere manier hebben gevonden om het werk automatisch in evenwicht te brengen, ze misschien voorzichtig moeten zijn met hoeveel computers ze tegelijkertijd gebruiken, of ze riskeren dat hun systemen gegijzeld worden door een simpele "AI AI AI"-lus.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →