← Nieuwste papers
💬 NLP

PaTH Attention: Position Encoding via Accumulating Householder Transformations

Dit artikel introduceert PaTH, een flexibele, datagegevensafhankelijke positie-encodering gebaseerd op geaccumuleerde Householder-transformaties die de standaard Rotary Position Encoding (RoPE) overtreft in taalmodelleringstaken, terwijl het efficiënte parallelle training en de mogelijkheid biedt om vooraf getrainde RoPE-modellen te converteren.

Oorspronkelijke auteurs: Songlin Yang, Yikang Shen, Kaiyue Wen, Shawn Tan, Mayank Mishra, Liliang Ren, Rameswar Panda, Yoon Kim

Gepubliceerd 2026-02-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Songlin Yang, Yikang Shen, Kaiyue Wen, Shawn Tan, Mayank Mishra, Liliang Ren, Rameswar Panda, Yoon Kim

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Het "Blinde" Geheugen

Stel je een groot taalmodel voor (zoals degene waar je nu mee praat) als een zeer intelligente bibliothecaris die een lang boek leest om je vragen te beantwoorden. Om het verhaal te begrijpen, moet de bibliothecaris niet alleen weten wat de woorden zijn, maar ook waar ze in het boek voorkomen.

Huidige modellen gebruiken een systeem genaamd RoPE (Rotary Position Encoding) om de posities van woorden te onthouden. Denk aan RoPE als een vaste, vooraf gedrukte liniaal.

  • Als je een woord van pagina 1 naar pagina 2 verplaatst, verschuift de liniaal het met een vast bedrag.
  • De Fout: Deze liniaal is "blind" voor de inhoud. Het behandelt het woord "appel" en het woord "raket" precies hetzelfde, simpelweg omdat ze op dezelfde plek staan. Het geeft niet om de vraag of het verhaal over een vrucht of een ruimteschip gaat. Hierdoor raakt de bibliothecaris soms in de war wanneer het verhaal complexe, stapsgewijze logica vereist (zoals het bijhouden wie welk item bezit in een lange lijst).

De Oplossing: PaTH (De "Slimme" Liniaal)

De auteurs introduceren PaTH, een nieuwe manier om posities te onthouden. In plaats van een vaste liniaal is PaTH als een dynamische, vormveranderende liniaal die van vorm verandert op basis van het verhaal dat het leest.

  • Hoe het werkt: Terwijl de bibliothecaris elk woord leest, past PaTH een speciale wiskundige "draai" toe (een zogenaamde Householder-transformatie) op het geheugen van eerdere woorden.
  • De Analogie: Stel je voor dat je door een gang loopt met spiegels.
    • RoPE: De spiegels zijn vast. Ongeacht wat je draagt, je reflectie ziet er hetzelfde uit.
    • PaTH: De spiegels zijn slim. Als je een rode hoed draagt, draait de spiegel je reflectie op een bepaalde manier. Als je een blauwe hoed draagt, draait de spiegel je reflectie op een andere manier. De "draai" hangt af van de werkelijke inhoud (de hoed) die je vasthoudt.

Dit stelt het model in staat om een "pad" van geheugen op te bouwen dat zich aanpast aan de specifieke data die het verwerkt, waardoor het veel beter wordt in het oplossen van puzzels die het bijhouden van toestanden vereisen (zoals het onthouden van de waarde van een variabele in een computercode).

De Magische Truc: Het Snel Doen

Normaal gesproken zou het maken van een liniaal die voor elk woord van vorm verandert ongelooflijk traag en rekenintensief zijn. Het zou zijn alsof je de hoeken van alle spiegels in de gang opnieuw moet berekenen elke keer dat je een stap zet.

De tweede grote bijdrage van het paper is een versnellingsalgoritme (vergelijkbaar met iets dat FlashAttention wordt genoemd).

  • De Analogie: In plaats van de hele gang elke keer opnieuw te berekenen, hebben de auteurs een slimme afkorting gevonden. Ze realiseerden zich dat als je de spiegels in kleine blokken groepeert, je de "draai" voor het hele blok in één keer kunt berekenen met een compacte wiskundige formule.
  • Het Resultaat: Ze hebben een systeem gebouwd dat bijna net zo snel werkt als het oude systeem met de vaste liniaal (RoPE), maar wel de "slimme, veranderende" voordelen van het nieuwe systeem behoudt.

Wat Hebben Ze Bewezen?

De auteurs hebben dit nieuwe systeem op twee manieren getest:

  1. Synthetische Puzzels (De "Leerwielen"):
    Ze gaven het model eenvoudige logische spelletjes, zoals een "Flip-Flop" spel waarbij het moet onthouden wanneer voor het laatst een schakelaar werd omgezet, of een "Woordprobleem" spel dat complexe wiskundige regels bevat.

    • Resultaat: De oude modellen (RoPE) faalden vaak bij deze puzzels omdat ze in de war raakten door de sequentie. Het nieuwe PaTH-model loste ze bijna perfect op, zelfs met minder lagen van de "hersenen" dan de anderen.
  2. Echte Taaltaken:
    Ze trainden modellen op echte teksten (boeken, code, gesprekken).

    • Resultaat: PaTH-modellen waren beter in het begrijpen van lange contexten (zeer lange boeken lezen zonder het begin te vergeten) en presteerden beter op taken met redeneringen, vooral in programmeren en wiskunde.
    • Bonus: Ze lieten zien dat je een bestaand model dat getraind is met de oude "vaste liniaal" (RoPE) kunt omzetten naar het gebruik van de "slimme liniaal" (PaTH) met slechts een klein beetje extra training, zonder helemaal opnieuw te hoeven beginnen.

De Kernboodschap

PaTH is een nieuwe manier voor AI om de volgorde van woorden te onthouden. In plaats van een rigide systeem dat voor iedereen hetzelfde is, gebruikt het een flexibel systeem dat verandert op basis van de woorden zelf. De auteurs hebben ontdekt hoe ze dit flexibele systeem snel genoeg kunnen laten draaien om praktisch bruikbaar te zijn, wat resulteert in AI-modellen die beter zijn in logica, het bijhouden van informatie over lange afstanden en het begrijpen van complexe sequenties.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →