← Nieuwste papers
💬 NLP

OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention

Het artikel introduceert Online Scaled DeltaNet (OSDN), een lineair attentiemodel dat de Delta-regel verbetert door een online-bijgewerkte diagonale preconditioner voor schaling per feature op te nemen, waardoor bewezen super-geometrische convergentie wordt bereikt en het associatieve herinneren in context aanzienlijk wordt verbeterd, terwijl hardware-efficiënte parallelisme behouden blijft.

Oorspronkelijke auteurs: Chenyu Zhou, Hongpei Li, Yuerou Liu, Jianghao Lin, Dongdong Ge, Yinyu Ye

Gepubliceerd 2026-05-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chenyu Zhou, Hongpei Li, Yuerou Liu, Jianghao Lin, Dongdong Ge, Yinyu Ye

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een heel lang verhaal te onthouden zodat je later vragen erover kunt beantwoorden. In de wereld van AI heet dit "in-context learning". De AI leest het verhaal (de context) en werkt zijn interne geheugen bij om belangrijke details te onthouden.

Lange tijd was de beste manier om dit te doen vergelijkbaar met een gigantische bibliotheek met een perfect register (genaamd "Softmax Attention"). Maar deze bibliotheek is traag en neemt een enorme hoeveelheid ruimte in beslag. Nieuwere, snellere methoden (zoals DeltaNet) gedragen zich meer als iemand die aantekeningen maakt in een klein notitieboekje. Ze zijn snel en efficiënt, maar ze worstelen soms met het onthouden van specifieke details als het verhaal te lang wordt of als dezelfde woorden vaak voorkomen. Ze hebben de neiging om de aantekeningen met elkaar te "vervagen".

Dit artikel introduceert een nieuwe methode genaamd OSDN (Online Scaled DeltaNet) om dat vervagen op te lossen. Hieronder wordt uitgelegd hoe het werkt, met behulp van eenvoudige analogieën:

1. Het Probleem: De "One-Size-Fits-All" Pen

Stel je voor dat de AI in zijn notitieboekje schrijft. Elke keer als hij een nieuw woord ziet (een "token"), schrijft hij een notitie.

  • Oude methode (DeltaNet): De AI gebruikt één pen met een vaste inktstroom. Als hij een klein, delicaat detail moet schrijven, is de pen te dik en wordt het vervaagd. Als hij een groot, vet kopje moet schrijven, is de pen te dun en raakt de inkt op. Hij behandelt elk stukje informatie met exact dezelfde "stapgrootte" of intensiteit.
  • Het probleem: Sommige feiten in het verhaal zijn zeldzaam en hebben een sterke, duidelijke notitie nodig. Andere zijn gebruikelijk en vereisen een lichte aanraking. Het gebruik van dezelfde "penkracht" voor alles leidt tot fouten bij het herinneren.

2. De Oplossing: De "Slimme, Verstelbare Pen" (OSDN)

OSDN geeft de AI een slimme, verstelbare pen. In plaats van één vaste instelling heeft de pen een draaiknop voor elke letter van het alfabet (of elk kenmerk van de data).

  • Hoe het leert: Terwijl de AI het verhaal leest, controleert hij voortdurend: "Heb ik die notitie goed geschreven?" Als de notitie te vaag is, draait hij de volgende keer de knop voor die specifieke letter hoger. Als hij te donker is, draait hij hem lager.
  • De magische truc: Het artikel bewijst dat deze "draaiknop" geen ingewikkelde, trage computer nodig heeft om te worden berekend. Het kan direct worden afgeleid, gewoon door naar het geschreven woord te kijken. Dit stelt de AI in staat zijn snelheid te behouden terwijl hij veel slimmer wordt over hoe hij schrijft.

3. Het "Vergeten"-mechanisme (APF)

Soms verandert het verhaal van onderwerp. Een feit dat aan het begin belangrijk was, kan aan het einde irrelevant zijn.

  • Het probleem: Als de AI zijn pen blijft aanpassen op basis van oude onderwerpen, kan hij in de war raken wanneer het verhaal overschakelt naar een nieuw onderwerp.
  • De oplossing (APF): OSDN bevat een functie genaamd Adaptive Preconditioner Forgetting. Denk hierbij aan een knop voor een "vers blad". Als de AI merkt dat het onderwerp is verschoven, reset hij zachtjes zijn penknoppen voor het nieuwe onderwerp, zodat hij niet vastzit aan instellingen uit het vorige hoofdstuk.

4. Waarom dit belangrijk is (De resultaten)

De auteurs hebben dit getest op AI-modellen van verschillende maten (van klein tot zeer groot).

  • De "geheugentest": Ze gaven de AI een verhaal en vroegen hem vervolgens om specifieke details te herinneren, vooral wanneer die details tweemaal voorkwamen (zoals een personage dat wordt geïntroduceerd en later weer wordt genoemd).
  • Het resultaat:
    • Op een gemiddelde grootte verbeterde OSDN het vermogen om herhaalde details te onthouden met 32% vergeleken met de oude methode.
    • Op een enorme grootte (1,3 miljard parameters) verbeterde het het geheugenherinneren met 39%, terwijl de AI even goed bleef in algemene taken (zoals zinnen schrijven of algemene vragen beantwoorden).
    • Cruciaal: dit deed hij zonder de AI significant te vertragen. Het is alsof je de motor van een auto upgrade om preciezer te zijn zonder de auto zwaarder of trager te maken.

Samenvatting

Denk aan OSDN als het leren van een AI om een betere notitie-maker te zijn. In plaats van alles met dezelfde druk te krabbelen, leert hij harder te drukken op belangrijke, zeldzame details en lichter op gebruikelijke. Hij weet ook wanneer hij het bord schoon moet vegen voor een nieuw onderwerp. Dit stelt de AI in staat complexe verhalen veel beter te onthouden zonder zijn snelheid of efficiëntie te verliezen.

Wat het artikel NIET beweert:

  • Het beweert niet dat dit AI "bewust" maakt of in staat stelt emoties te voelen.
  • Het beweert niet dat dit alle AI-problemen oplost (zoals redeneren of wiskunde); het richt zich specifiek op het vermogen om informatie uit een lange tekst te onthouden en op te halen.
  • Het suggereert niet dat dit klaar is voor medische diagnose of kritieke real-world implementatie; het is een doorbraak in het onderzoek naar hoe AI-modellen sequenties van tekst verwerken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →