Learning how to Forget: Fine-tuning for Long-Context Sparse Attention
Dit artikel introduceert een fine-tuning methode voor transformer-modellen die efficiënte long-context inferentie met sparse attention op gemiddelde hardware mogelijk maakt door modellen te laten co-adapteren met diverse KV cache-policies, wat vaak exact attention-benaderingen overtreft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Moderne kunstmatige intelligentiesystemen die menselijke tekst genereren, vertrouwen op een mechanisme dat fungeert als een kortetermijngeheugen, waardoor ze kunnen onthouden wat er eerder in een gesprek of een lang document is gezegd. Dit geheugen wordt opgeslagen in een digitale buffer die groter wordt bij elk nieuw woord dat het systeem verwerkt. Om deze systemen over lange stukken tekst goed te laten functioneren, moet dit geheugen enorm zijn, maar de computerhardware die nodig is om het te huisvesten is duur en beperkt. Wanneer de geheugenbuffer vol raakt, moet het systeem beslissen welke oude stukken informatie het wegwerpt om ruimte te maken voor de nieuwe. Als het de verkeerde informatie weggooit, verliest het systeem zijn vermogen om te redeneren of vragen accuraat te beantwoorden. Dit creëert een moeilijke afweging: het klein houden van het geheugen bespaart geld en zorgt ervoor dat het systeem op standaardapparatuur kan draaien, maar het brengt het risico met zich mee dat de context die nodig is om slim te zijn, verloren gaat.
Onderzoekers proberen dit al lang op te lossen door het systeem te leren selectief te zijn over wat het behoudt, een proces dat bekende staat als 'sparse attention'. Echter, een nieuwe studie onthult een kritiek gebrek in hoe deze systemen tot nu toe zijn getraind. De meeste bestaande methoden trainen de AI met een perfect, onbeperkt geheugen en dwingen het vervolgens om later met een beperkt geheugen te werken. De onderzoekers ontdekten dat deze aanpak faalt omdat de AI nooit heeft geleerd hoe het moet functioneren onder de specifieke beperkingen waarmee het in de praktijk geconfronteerd zou worden. Door het model vanaf het begin te trainen om bewust te vergeten en zich aan te passen aan een vaste geheugengrootte, toonde het team aan dat het systeem aanzienlijk beter kan presteren dan diegenen die met onbeperkte middelen zijn getraind, zelfs wanneer het draait op één enkele, redelijk krachtige computerchip.
Het team, onder leiding van wetenschappers van Amazon Web Services en de Universiteit van Amsterdam, heeft een nieuwe manier ontwikkeld om deze grote taalmodellen te finetunen. In plaats van massale supercomputers te gebruiken om een perfect geheugen te simuleren, hebben ze de modellen geleerd om mee te adapteren met een specifief geheugenbeheerbeleid. Stel je een bibliothecaris voor die getraind is om boeken te organiseren in een bibliotheek met oneindige planken, om er later voor te worden verteld dat hij in een kleine kamer met slechts één plank moet werken. De bibliothecaris die getraind is in de grote bibliotheek zou waarschijnlijk moeite hebben met het prioriteren van wat hij moet bewaren in de kleine kamer. In tegenstelling hiertoe traint de methode die in dit artikel wordt voorgesteld de bibliothecaris direct in de kleine kamer, waardoor hij precies leert welke boeken hij moet houden en welke hij moet weggooien op basis van de regels van die specifieke ruimte. Dit stelt het model in staat om het ritme van zijn eigen beperkingen te leren kennen, in plaats van te proberen de gewoontes van het hebben van te veel ruimte te afleren.
De onderzoekers testten deze aanpak op een model met vier miljard parameters, een omvang die substantieel maar beheersbaar is. Ze voerden hun experimenten uit op een enkele grafische kaart met 40 gigabyte aan geheugen, een opstelling die betaalbaar is voor veel organisaties in vergelijking met de clusters van tientallen kaarten die vereist zijn door eerdere methoden. Ze vergeleken deze nieuwe trainingsmethode met de standaardmethode, die een techniek genaamd 'sequence parallelism' gebruikt om de geheugenbelasting over meerdere dure apparaten te verdelen. De resultaten lieten zien dat de modellen die met de nieuwe methode zijn getraind, vaak beter presteerden dan de standaardmodellen, vooral wanneer de taak vereiste dat het systeem specifieke, beknopte antwoorden genereerde in plaats van lange, uitweidende teksten. In verschillende tests met complexe vragen en data-extractie produceerde de standaardmethode outputs die veel te lang waren en vol stonden met willekeurige, zinloze getallen, terwijl de nieuwe methode leerde om op het juiste moment te stoppen en de correcte enkele waarde te verstrekken.
Een cruciaal onderdeel van dit succes was het verbeteren van de "heavy-hitter oracle", een populaire strategie om te beslissen welke informatie behouden moet worden. Deze strategie werkt door bij te houden aan welke stukken informatie het model in de loop van de tijd de meeste aandacht besteedt. De onderzoekers ontdekten dat de originele versie van deze strategie traag en inefficiënt was. Ze hebben de onderliggende code herschreven om veel sneller te werken, waardoor het systeem deze belangscores kan berekenen zonder het hele proces te vertragen. Deze optimalisatie betekende dat het systeem slimme beslissingen kon nemen over wat het moest vergeten in realtime, zonder de enorme rekenkracht te vereisen die gewoonlijk bij dergelijke taken hoort. Het team heeft ook een nieuwe open-source softwarebibliotheek uitgebracht om deze technieken beschikbaar te maken voor anderen, met als doel de drempel te verlagen voor iedereen die lang-contextuele AI-systemen wil bouwen zonder een fortuin aan hardware nodig te hebben.
De studie benadrukt dat de manier waarop een model wordt getraind net zo belangrijk is als de hardware waarop het draait. Wanneer de onderzoekers het model dwongen om met exact dezelfde geheugenbeperkingen te trainen als waar het tijdens het gebruik mee te maken krijgt, leerde het om effectief met die beperkingen om te gaan. In één specifieke test met JSON-data faalde de standaardmethode volledig, waarbij het niet in staat was de juiste datapunten te vinden, terwijl de nieuwe methode erin slaagde deze ongeveer de helft van de tijd te identificeren. Dit suggereert dat het vermogen om lange contexten aan te kunnen niet alleen een kwestie is van meer geheugen hebben, maar van het systeem leren hoe het het geheugen dat het heeft, moet beheren. De bevindingen wijzen erop dat voor veel toepassingen de meest effectieve weg vooruit niet is om grotere computers te bouwen, maar om de software efficiënter te leren omgaan met de middelen die het al bezit.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.