← Nieuwste papers
🤖 machine learning

Local Attention Mechanism: Boosting the Transformer Architecture for Long-Sequence Time Series Forecasting

Dit artikel introduceert het Local Attention Mechanism (LAM), een efficiënt O(n log n) aandachtsalgoritme dat is afgestemd op de continuïteit van tijdreeksen, dat wanneer het in Transformers wordt geïntegreerd, de huidige state-of-the-art modellen in long-horizon forecasting overtreft, terwijl het tegelijkertijd een nieuwe dataset-suite voorstelt om evaluatiekloven aan te pakken.

Oorspronkelijke auteurs: Ignacio Aguilera-Martos, Andrés Herrera-Poyatos, Julián Luengo, Francisco Herrera

Gepubliceerd 2026-07-29
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ignacio Aguilera-Martos, Andrés Herrera-Poyatos, Julián Luengo, Francisco Herrera

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de toekomst probeert te voorspellen door naar een lange, kronkelende weg te kijken. Misschien is het het pad van een aandelenmarkt, de stroom van elektriciteit in een stad, of de beweging van een taxi door het verkeer. Dit is de wereld van tijdreeksvoorspelling (time series forecasting): het gebruik van gegevens uit het verleden om te raden wat er hierna gebeurt. Lange tijd hadden computers moeite om het "grote plaatje" te zien wanneer de weg te lang werd. Ze waren erg goed in het onthouden van de laatste paar stappen, maar raakten in de war of raakten het geheugen kwijt wanneer ze gevraagd werd om weken of maanden vooruit te kijken.

Maak kennis met de Transformer, een type kunstmatige intelligentie dat beroemd werd door het lezen en schrijven van menselijke taal. Denk aan een Transformer als een super slimme detective die alle aanwijzingen in een verhaal tegelijkertijd kan bekijken, in plaats van woord voor woord te lezen. Deze "alles-tegelijk"-superkracht, genaamd attention (aandacht), stelt de detective in staat om verre punten met elkaar te verbinden. Echter, wanneer deze wordt toegepast op lange tijdreeksen, heeft deze detective een probleem: om elke enkele aanwijzing met elke andere aanwijzing te verbinden, moet hij een enorme hoeveelheid wiskunde uitvoeren. Het is alsof je probeert elk persoon op een feestje aan iedereen anders voor te stellen; het aantal handdrukken groeit zo snel dat het feestje tot stilstand komt. Dit artikel pakt die specifieke verkeersopstopping aan met de vraag: Hoe kunnen we de superkracht van de detective behouden zonder hem onmogelijk veel werk te laten doen?

De auteurs van dit artikel introduceren een slim nieuw hulpmiddel genaamd de Local Attention Mechanism (LAM). Hun belangrijkste bevinding is dat je voor tijdreeksgegevens eigenlijk niet elke eerdere aanwijzing nodig hebt om de toekomst te voorspellen; je moet vooral kijken naar de momenten die direct aan het huidige moment grenzen. Door zich alleen te concentreren op deze "lokale" buurten, creëerden ze een methode die wiskundig bewezen veel sneller is en minder geheugen vereist dan de traditionele aanpak. In hun tests was deze nieuwe methode niet alleen sneller; ze voorspelde de toekomst ook beter dan de huidige topmodellen, zelfs wanneer er ver in de toekomst werd gekeken.

Het Probleem: De Overbelasting van de Detective

Om te begrijpen waarom dit nieuwe hulpmiddel nodig is, laten we kijken naar hoe de standaard Transformer werkt. Stel je een detective voor die een mysterie probeert op te lossen op basis van een dagboek. De standaardmethode, genaamd Full Attention, vereist dat de detective elke pagina van het dagboek leest en elke pagina met elke andere pagina vergelijkt om verbanden te vinden. Als het dagboek 1.000 pagina's heeft, moet de detective ongeveer 1.000.000 vergelijkingen maken. Als het dagboek 10.000 pagina's heeft, springt dat naar 100.000.000 vergelijkingen. Dit is wat wetenschappers kwadratische complexiteit (Θ(n2)\Theta(n^2)) noemen. Naarmig het dagboek langer wordt, explodeert de hoeveelheid werk, en raakt de computer het geheugen kwijt of duurt het eeuwen voordat het klaar is.

Bovendien wijzen de auteurs erop dat hoewel deze "kijk naar alles"-aanpak goed werkt voor taal (waarbij een woord aan het begin van een zin gerelateerd kan zijn aan een woord aan het eind), het vaak overdreven is voor tijdreeksgegevens. In tijdreeksen—zoals temperatuur of elektriciteitsverbruik—wordt wat er nu gebeurt meestal het meest beïnvloed door wat er vlak hiervoor gebeurde. De verbinding met iets dat drie dagen geleden gebeurde, is vaak veel zwakker. Toch verspilt de standaard Transformer energie aan het berekenen van die zwakke verbindingen alsof het sterke verbindingen zijn.

De Oplossing: De Buurtwacht

De auteurs stellen de Local Attention Mechanism (LAM) voor. In plaats van de detective het hele dagboek te laten lezen, zegt LAM tegen hem: "Kijk alleen naar de laatste paar pagina's, en misschien een paar pagina's van een specifiek patroon, maar negeer de rest."

Ze ontwierpen dit mechanisme om gebruik te maken van de "continuïteit" van de tijd. In de echte wereld veranderen dingen niet plotseling; ze stromen. Als je de temperatuur om 14:00 uur voorspelt, is de temperatuur om 13:59 uur een enorme aanwijzing, maar de temperatuur van afgelopen dinsdag is minder relevant. LAM gebruikt een wiskundig "masker" (een filter) om het irrelevante, verre verleden buiten te sluiten.

De magie van LAM is niet alleen dat het dingen negeert; het is hoe het ze negeert. De auteurs ontwikkelden een specifiek algoritme met behulp van tensoralgebra (een chique manier om gegevens in blokken te organiseren) dat de computer in staat stelt om de nutteloze berekeningen volledig over te slaan. In plaats van n2n^2 werk te verrichten, verricht LAM werk dat proportioneel is aan nlognn \log n. Om dat in perspectief te plaatsen: als een standaard methode 100 uur nodig heeft om een lange dataset te verwerken, kan LAM slechts enkele uren nodig hebben. Het is alsof je overstapt van het controleren van elk huis in een stad naar alleen de huizen op je eigen straat en de paar straten daarnaast te controleren.

De Resultaten: Sneller en Slimmer

Het team heeft het hulpmiddel niet alleen gebouwd; ze hebben het op de proef gesteld. Ze vergeleken hun door LAM verbeterde Transformer met de huidige state-of-the-art modellen, inclus_ief een populair model genaamd Informer en verschillende oudere statistische methoden.

  1. Betere Voorspellingen: In experimenten met real-world data zoals elektriciteitsverbruik, weerpatronen en taxarijden, maakte het LAM-model consequent minder fouten dan de concurrentie. Het was bijzonder goed in het voorspellen van de verre toekomst (lange horizonten), waar andere modellen de mist in gingen.
  2. Efficiëntie: Het LAM-model was aanzienlijk kleiner en lichter. Terwijl het Informer-model meer dan 12 miljoen parameters had (de "hersencellen" van de AI), behaalde het LAM-model betere resultaten met slechts ongeveer 6 miljoen.
  3. De "Eerlijke" Test: De auteurs waren voorzichtig om ervoor te zorgen dat de vergelijking eerlijk was. Ze testten LAM tegen de eigen speciale aandachtsmethode van Informer (genaamd ProbAttention), maar hielden de rest van de computerarchitectuur exact hetzelfde. Zelfs in deze directe confrontatie won LAM, wat bewees dat de verbetering voortkwam uit de nieuwe aandachtsmethode zelf, en niet alleen uit een nieuwer computerontwerp.

Een Oproep voor Betere Data

Het artikel maakt ook een kritische observatie over de instrumenten die worden gebruikt om deze modellen te testen. De auteurs stellen dat de standaard datasets die in dit veld worden gebruikt, te klein en te simpel zijn. Het is alsof je een student probeert te leren autorijden met alleen een lege parkeerplaats. Problemen in de echte wereld, zoals het voorspellen van het verkeer voor een hele stad of de elektriciteit voor een enorm netwerk, omvatten miljoenen gegevenspunten en complexe patronen.

Om dit op te lossen, introduceerden de auteurs een nieuwe set datasets voor testen. Deze bevatten:

  • IHEP: Meer dan 2 miljoen records van huishoudelijk elektriciteitsverbruik.
  • NYTaxi: Meer dan 2 miljoen records van taxarijden in New York City.
  • RPB: Gegevens over batterij- en zonne-energieverbruik.
  • TiNA: Een enorme dataset met meer dan 38 miljoen records van een industriële mijnbouwmachine.

Toen ze hun modellen testten op deze enorme, real-world datasets, werd het voordeel van LAM nog duidelijker. De oudere modellen crashten vaak of raakten het geheugen kwijt omdat de data te groot was, terwijl LAM soepel en nauwkeurig bleef draaien.

Wat Dit Betekent

Het artikel concludeert dat voor tijdreeksvoorspelling op lange termijn de "kijk naar alles"-aanpak niet alleen traag is, maar vaak ook onnodig. Door ons te concentreren op de lokale omgeving van de tijd, kunnen we AI bouwen die sneller is, goedkoper is in gebruik en verrassend nauwkeuriger is.

De auteurs suggereren dat hoewel hun methode een sterke stap voorwaarts is, het vakgebied nog steeds betere benchmarks en strengere tests nodig heeft. Ze beweerden niet dat ze elk probleem in de voorspellingsleer hadden opgelost, maar ze hebben een krachtig nieuw venster geboden waardoor we naar de toekomst kunnen kijken—één die scherp, efficiënt en gericht is op wat er echt toe doet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →