← Nieuwste papers
💬 NLP

CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention

CoSA is een trainingsvrij, tweestaps sparse attention-framework dat een Kernel-Aware Proxy koppelt aan een Ordered-Skipping Kernel om blokselectie en het overslaan van blokken dynamisch te optimaliseren, waardoor significante versnellingen in de inferentie en verminderde latentie voor long-context LLM's worden bereikt, terwijl een hoge nauwkeurigheid behouden blijft onder strikte computationele budgetten.

Oorspronkelijke auteurs: Yufei Xue, Lin Niu, Hong Liu, Siran Liu, Hanyong Shao, Wei Liu, Guanghua Yu, Jianchen Zhu, Jun Zhang

Gepubliceerd 2026-07-29
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yufei Xue, Lin Niu, Hong Liu, Siran Liu, Hanyong Shao, Wei Liu, Guanghua Yu, Jianchen Zhu, Jun Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme encyclopedie van 128.000 pagina's probeert te lezen om één enkele vraag te beantwoorden. In de wereld van Kunstmatige Intelligentie worden deze "encyclopedieën" Large Language Models (LLM's) genoemd, en het "leesproces" is hoe ze context begrijpen. Het probleem is dat de standaardmanier waarop deze modellen lezen, lijkt op een bibliothecaris die erop staat elke pagina van het boek te lezen, van het allereerste woord tot het allerlaatste, voordat ze zelfs maar kunnen beginnen na te denken over je vraag. Naarmate het boek langer wordt, wordt deze "alles-lezen"-aanpak pijnlijk traag en duur, alsof je een marathon probeert te lopen terwijl je een rugzak vol bakstenen draagt.

Om dit op te lossen, hebben wetenschappers geprobeerd de bibliothecaris te leren wat selectiever te zijn, een techniek genaamd "sparse attention" (ijle aandacht). In plaats van elke pagina te lezen, probeert het model te raden welke pagina's belangrijk zijn en slaat de rest over. Meestal omvat dit twee stappen: eerst kijkt een snelle "proxy" (een snelle gokker) naar het boek en markeert de belangrijke pagina's met een eenvoudige "Ja/Nee"-lijst. Ten tweede volgt een "kernel" (de eigenlijke werker) die lijst en doet het zware werk. Het is een redelijk systeem, maar het heeft een gebrek: wanneer het boek enorm groot wordt en je heel strikt moet zijn over welke pagina's je overslaat om tijd te besparen, begint de snelle gokker fouten te maken, en de werker volgt die slechte lijst blindelings op. Het resultaat is dat het model sneller wordt maar belangrijke details vergeet, zoals een bibliothecaris die de climax van een verhaal overslaat omdat hij dacht dat het saai was.

Dit is waar een nieuwe methode genaamd CoSA (Co-Designed Sparse Attention) in beeld komt. De onderzoekers achter CoSA realiseerden zich dat de "gokker" en de "werker" geïsoleerd van elkaar werkten, wat ervoor zorgde dat het systeem onder druk bezweek. Ze besloten het hele proces zo te ontwerpen dat ze als een team samenwerken. In plaats van de werker alleen een eenvoudige "Ja/Nee"-lijst te overhandigen, overhandigt de nieuwe "gokker" (een Kernel-Aware Proxy, of KAP) een prioriteitenlijst. Het zegt niet alleen "lees deze pagina"; het zegt: "Lees deze pagina eerst, dan deze, en dan deze."

Hier is de magische truc: de werker (een Ordered-Skipping Kernel, of OSK) gebruikt deze prioriteitenlijst om de volgorde waarin de pagina's worden gelezen te herschikken. Door de meest kritieke pagina's eerst te lezen, bouwt de werker heel vroeg in het proces een "lopende score" op van wat belangrijk is. Omdat het model de belangrijkste zaken direct weet, kan het zelfs nog meer pagina's later in het proces met vertrouwen overslaan zonder in de war te raken. Het is alsof je een mysterieserie leest en de detective je zegt: "Lees de eerste drie hoofdstukken om de moordenaar te vinden, dan kun je de volgende vijftig hoofdstukken over tuiniertechnieken veilig overslaan."

Het artikel laat zien dat deze teamwork-aanpak een game-changer is. Bij tests op modellen die contexten lazen van wel 128.000 tokens (ongeveer de omvang van een lange roman), slaagde CoSA erin om het "aandachtsgedeelte" van het proces 4,93 keer te versnellen en de tijd die nodig is om het eerste woord te genereren met 2,53 keer te verkorten. Cruciaal is dat dit werd gedaan zonder dat het model zijn vermogen verloor om het verhaal te begrijpen of complexe redeneerproblemen op te lossen. De onderzoekers ontdekten dat door de proxy en de kernel met elkaar te laten communiceren en een specifieke volgorde van operaties te laten delen, ze veel agressiever konden zijn in het overslaan van werk, terwijl het model nog steeds slim bleef. Het blijkt dat in de wereld van AI weten wanneer je een pagina leest net zo belangrijk is als weten welke pagina je moet lezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →