Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents
Vortex is een systeem dat een in Python ingebedde frontend combineert met een efficiënte backend om snelle prototyping en implementatie van sparse attention-algoritmen mogelijk te maken, waardoor AI-agenten automatisch ontwerpen kunnen ontdekken die tot 3,46× hogere doorvoer bereiken dan full attention, terwijl ze deze winsten uitbreiden naar opkomende grootschalige architecturen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme bibliotheek runt (een Large Language Model, of LLM) waar een bibliothecaris (de AI) een heel lang verhaal moet schrijven, woord voor woord.
Elke keer dat de bibliothecaris een nieuw woord schrijft, moet hij terugkijken naar alles wat hij tot nu toe heeft geschreven om te controleren of het nieuwe woord er wel bij past. In een traditionele bibliotheek moet de bibliothecaris door elke plank lopen, elk boek controleren en elke zin lezen om de relevante delen te vinden. Naarmate het verhaal langer wordt (duizenden woorden), wordt dit "wandelen en controleren" ongelooflijk traag en uitputtend. Dit is het probleem van Full Attention.
Sparse Attention is als het geven van een slimme afkorting aan de bibliothecaris: "Kijk alleen naar de laatste 5 pagina's en de 3 belangrijkste hoofdstukken aan het begin." Dit bespaart een enorme hoeveelheid tijd. Het bouwen van deze afkortingen is echter momenteel een nachtmerrie voor ingenieurs. Het is also van een aangepast, hogesnelheidstreinspoor voor elke nieuwe afkortingsidee die je hebt. Als je een nieuw idee wilt testen, moet je het hele spoor vanaf nul opnieuw opbouwen, wat weken duurt.
Ontmoet Vortex.
Vortex is een nieuw systeem dat fungeert als een "Universele Bouwer van Treinsporen" voor deze afkortingen. Zo werkt het, met behulp van eenvoudige analogieën:
1. Het Probleen: De "Gepageteerde" Bibliotheek
Moderne bibliotheken slaan boeken niet op in één lange, aaneengesloten rij. Om ruimte te besparen, slaan ze boeken op in verspreide, niet-aaneengesloten dozen (genaamd Paged Attention).
- De Oude Manier: Als je een computer wilde vertellen om naar specifieke verspreide dozen te kijken, moest je complexe, laag-niveau code schrijven om elke doos te vinden, te pakken en in volgorde te zetten. Het was alsof je een robot vroeg om specifieke korrels zand op een strand te vinden door ze één voor één op te graven.
- De Vortex-Manier: Vortex introduceert een nieuwe manier van denken genaamd vTensor. Het geeft de bibliothecaris een "magische kaart". Je hoeft niet te weten waar de dozen zich fysiek bevinden; je zegt gewoon: "Ik wil de bovenste 5 meest relevante dozen," en de magische kaart handelt de rommelige details af van het vinden ervan in de verspreide opslag.
2. De Taal: vFlow (Het "Receptenboek")
Vortex komt met een programmeertaal genaamd vFlow.
- De Analogie: Stel je voor dat je een chef-kok bent. In plaats van code te schrijven om de computer te vertellen hoe hij elke wortel precies moet snijden, schrijf je gewoon een recept: "Neem de wortels, snijd ze, en meng met de uien."
- Hoe het helpt: Onderzoekers (en zelfs AI-agenten) kunnen "recepten" schrijven voor nieuwe soorten afkortingen (sparse attention algoritmen) in slechts een paar regels code. Ze hoeven geen experts te zijn in de rommelige hardware-details. Ze beschrijven alleen wat ze willen doen, en Vortex bepaalt vervolgens hoe het efficiënt te doen.
3. De AI-Agent: De "Autonome Uitvinder"
Dit is het meest opwindende deel. Het paper laat zien dat Vortex zo gemakkelijk in gebruik is dat AI-agenten (computerprogramma's ontworpen om als mensen te handelen) het zelf kunnen gebruiken om nieuwe afkortingen uit te vinden.
- Het Experiment: De onderzoekers vroegen AI-agenten om "20 nieuwe manieren te verzinnen om de bibliothecaris te versnellen."
- Het Resultaat: De AI-agenten kopieerden niet alleen oude ideeën; ze creëerden gloednieuwe, diverse recepten. Een van deze door AI gegenereerde afkortingen maakte de bibliothecaris 3,46 keer sneller dan de standaardmethode, zonder dat de nauwkeurigheid van het verhaal verloren ging.
- De Loop: De AI bleef proberen, falen en de recepten aanpassen gedurende 18 uur. Het vond uiteindelijk een perfecte balans tussen snelheid en nauwkeurigheid die mensen misschien over het hoofd hadden gezien.
4. De Resultaten: Het Versnellen van de Toekomst
Vortex is niet alleen voor kleine modellen; het werkt op de grootste, meest complexe bibliotheken ter wereld.
- De Grote Modellen: Het team testte Vortex op een enorm model (MiniMax-M2.7) met 229 miljard parameters, draaiend op supercomputerchips (NVIDIA B200). Zelfs daar maakten de afkortingen van Vortex het systeem 1,37 keer sneller.
- Nieuwe Architecturen: Ze gebruikten het ook op een nieuw type bibliotheekontwerp genaamd MLA (gebruikt door modellen zoals DeepSeek en GLM). Ze ontwierpen een aangepaste afkorting hiervoor in vFlow en kregen een versnelling van 4,7 keer.
Samenvatting
Beschouw Vortex als een vertaler en een bouwploeg in één.
- Het vertaalt complexe, rommelige hardware-regels naar eenvoudige, leesbare recepten.
- Het stelt mensen en AI-agenten in staat om snel nieuwe "afkortingen" te verzinnen, te testen en te implementeren voor het lezen van lange teksten.
- Het verandert wat voorheen een maandenlang engineeringproject was in een kwestie van uren, waardoor we snellere manieren vinden om AI-modellen te draaien zonder hun intelligentie op te offeren.
Het paper beweert dat door het experimenteren makkelijk te maken, Vortex al heeft geholpen bij het ontdekken van algoritmen die aanzienlijk sneller zijn dan alles wat momenteel in productie wordt gebruikt, wat bewijst dat we AI sneller en efficiënter kunnen maken zonder te wachten op nieuwe hardware.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.