← Nieuwste papers
💬 NLP

Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

Het artikel stelt Pair-In, Pair-Out (PIPO) voor, een unificerend raamwerk dat latente inputcompressie combineert met multi-token outputvoorspelling en een lichtgewicht op vertrouwen gebaseerd acceptatiemechanisme om aanzienlijke snelheidswinsten in latentie en verbeterde redeneerprestaties in grote taalmodellen te bereiken zonder de overhead van een afzonderlijke verificatiepass.

Oorspronkelijke auteurs: Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

Gepubliceerd 2026-05-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een groot taalmodel (LLM) voor als een zeer slim, maar zeer traag, schrijver die verhalen één woord per keer schrijft. Om een moeilijk wiskundeprobleem op te lossen of complexe code te schrijven, moet deze schrijver hardop nadenken en een lange "gedachtenketen" genereren voordat hij het definitieve antwoord schrijft. Het probleem is dat het schrijven van één woord, stoppen, nadenken en het schrijven van het volgende woord ongelooflijk traag en duur is.

Het artikel introduceert een nieuwe methode genaamd PIPO (Pair-In, Pair-Out) om deze schrijver veel sneller te maken zonder dat hij meer fouten maakt. Hier is hoe het werkt, met eenvoudige analogieën:

1. Het Probleem: De "Eén-stap-voor-een" Bottleneck

Momenteel werkt de schrijver als een persoon die op een typemachine typt: hij typt één letter, drukt op "Enter", wacht tot de machine verwerkt, typt de volgende letter, en zo verder. Zelfs als de schrijver slim is, is de machine traag omdat hij slechts één letter per cyclus kan verwerken.

2. De Oplossing: De "Dubbeldekker"-Bus (PIPO)

PIPO verandert de verkeersregels. In plaats dat de schrijver één woord per keer verwerkt, laat PIPO hem twee woorden tegelijk verwerken.

  • Pair-In (De Compressie): Stel je voor dat de schrijver een stapel van twee letters ontvangt (bijvoorbeeld "T" en "h"). In plaats van ze apart in de machine te voeren, vouwt een speciale "compressor" ze samen tot één compact pakket (een latente representatie). Het is alsof je een grote kaart vouwt tot een klein zakdoekje zodat hij door een smalle deur past.
  • De Reis: De machine verwerkt dit enkele "gevouwen" pakket.
  • Pair-Out (Het Ontvouwen): Zodra de machine klaar is, spuugt hij niet zomaar één letter uit. Hij heeft een speciale "ontvouwende" kop die het resultaat neemt en direct twee letters produceert: het verwachte volgende woord en een voorspeld conceptwoord (bijvoorbeeld "e" en " ").

Het Resultaat: De schrijver schrijft nu twee letters voor elke enkele machinecyclus. Dit verdubbelt effectief de schrijfsnelheid.

3. Het Risico: Het "Gokspel"

Er is een addertje onder het gras. Het voorspellen van het tweede woord is een gok. Als de gok verkeerd is, kan de hele zin onzin worden.

  • Oude Manier (Speculatieve Decoding): Vroeger moest de schrijver om te controleren of een gok goed was, stoppen, een enorme "verificatie"-test uitvoeren (zoals een senior redacteur die het hele concept opnieuw leest), en dan beslissen of de gok goed was. Deze verificatiestap was zo traag dat hij de snelheidswinst tenietdeed.
  • PIPO's Manier (Het Zekerheidsmeter): PIPO installeert een tiny, supersnelle "zekerheidsmeter" direct naast de schrijver. Deze meter is getraind om naar de twee woorden te kijken en direct te zeggen: "Ik ben 95% zeker dat dit tweede woord correct is," of "Ik weet het niet zeker, laten we het overslaan."
    • Als de meter "Go" zegt, houdt de schrijver beide woorden.
    • Als de meter "Nee" zegt, houdt de schrijver het eerste woord en vervangt het tweede door een "leegte" (padding) om het ritme gaande te houden.

4. Het Geheime Ingrediënt: Leren van Fouten (On-Policy Distillation)

Hoe leert de "zekerheidsmeter" zo nauwkeurig te zijn zonder een trage redacteur?

Het artikel gebruikt een slimme trainingstruc genaamd On-Policy Distillation.

  • Stel je voor dat de schrijver (de student) probeert een verhaal te schrijven.
  • Een super-slimme leraar (een groter, vooraf getraind model) schrijft het verhaal ook.
  • Het systeem vergelijkt de gok van de student met het antwoord van de leraar.
  • De Magie: Het systeem realiseert zich dat de "leraar" precies dezelfde baan doet als de "redacteur" in de oude methode. Dus, in plaats van elke keer een trage redacteurscontrole uit te voeren, gebruikt het systeem de antwoorden van de leraar om de kleine "zekerheidsmeter" tijdens de leerfase te trainen.
  • Eenmaal getraind, weet de zekerheidsmeter precies wanneer hij de gok moet vertrouwen en wanneer hij voorzichtig moet zijn, allemaal zonder dat de trage redacteur nodig is tijdens het daadwerkelijke schrijfproces.

5. De Resultaten: Sneller en Slimmer

Het artikel testte dit op moeilijke wiskunde- en coderingstaken (zoals de AIME-wiskundewedstrijd en coderingsbenchmarks).

  • Snelheid: Omdat het twee woorden tegelijk verwerkt en de trage redacteurscontrole overslaat, is PIPO 2 tot 2,6 keer sneller dan de standaardmethode. Het krijgt het eerste woord veel sneller uit en houdt de stroom gaande.
  • Nauwkeurigheid: Verrassend genoeg werd het niet alleen sneller; het werd beter. Door meer "gedachten" in dezelfde hoeveelheid ruimte te passen (omdat het de invoer comprimeert), kon het model langere, completere redeneerketens genereren. Bij sommige tests steeg het succespercentage met meer dan 7 punten ten opzichte van normale methoden.

Samenvatting

PIPO is als het upgraden van een vrachtwagen van een single-lane weg naar een dubbel-lane snelweg.

  1. Comprimeer de lading (invoer) om twee pakketten in één vak te laten passen.
  2. Lever twee pakketten tegelijk af (uitvoer).
  3. Gebruik een slimme sensor (zekerheidskop) om te beslissen of het tweede pakket veilig is om te behouden, getraind door een leraar die het antwoord al weet.

Dit stelt de AI in staat langer na te denken en sneller te antwoorden, complexe problemen op te lossen zonder de gebruikelijke vertraging.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →