← Nieuwste papers
🤖 AI

KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling

KV-PRM is een efficiënt procesbeloningsmodel dat de computationele bottleneck van tekstgebaseerde hercodering elimineert door direct gebruik te maken van vooraf berekende KV-caches om de scorecomplexiteit te verminderen van O(L²) naar O(L), waarmee het enorme winst boekt in snelheid en geheugen terwijl het bestaande methoden over meerdere redeneerbenchmarks evenaart of overtreft.

Oorspronkelijke auteurs: Peng Kuang, Haibo Jin, Xiaoyu Han, Yanli Wang, Xiaopeng Yuan, Ye Yu, Kaidi Xu, Haohan Wang

Gepubliceerd 2026-07-13
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Peng Kuang, Haibo Jin, Xiaoyu Han, Yanli Wang, Xiaopeng Yuan, Ye Yu, Kaidi Xu, Haohan Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, riskante spelshow runt waarbij een team van AI-detectives (laten we ze de "Multi-Agent Squad" noemen) probeert een supermoeilijk wiskundig mysterie op te lossen. Ze raden niet zomaar een antwoord; ze breken het probleem af in piepkleine stappen en wisselen aanwijzingen met elkaar uit. Om ervoor te zorgen dat ze niet op een verkeerd pad terechtkomen, heeft een "Rechter" (een Process Reward Model, of PRM) die elke enkele aanwijzing die ze opschrijven controleert.

De Oude Manier: De Uitputtende Herlezer
In het verleden moest de Rechter, elke keer dat hij een aanwijzing wilde controleren, iets ongelooflijk uitputtends doen. Stel je voor dat de detectives een verhaal van 5.000 woorden schrijven. Om dit te beoordelen, moet de Rechter het volledige verhaal van 5.000 woorden van het allereerste woord tot het allerlaatste woord weer opnieuw lezen, alleen maar om een score te geven. Als het verhaal langer wordt, neemt de tijd die nodig is om te lezen niet zomaar een beetje toe; het explodeert. Als je de lengte van het verhaal verdubbelt, verviervoudigt de leestijd. Dit is wat het papier een O(L2)O(L^2) kosten beschrijft. Het is alsof je een specifieke naald in een hooiberg probeert te vinden door elke keer de hele hooiberg opnieuw op te bouwen. Het papier betoogt dat dit een enorme verspilling van energie en tijd is, vooral wanneer de detectives lange, complexe verhalen schrijven.

De Nieuwe Manier: KV-PRM (De "Magische Geheugen" Lezer)
De auteurs van dit paper, Peng Kuang en hun team, realiseerden zich dat de detectives het zware werk al gratis aan het doen waren! Wanneer de detectives hun verhaal schrijven, slaan hun hersenen (de interne "KV cache" van de AI) van nature een hoogwaardige, supergedetailleerde herinnering op van elk woord dat ze ooit hebben bedacht. Het is als een perfecte, continue opname van de ziel van het verhaal, niet alleen de gedrukte woorden.

  • Hoe het werkt: De Rechter neemt één enkel, minuscuul "verify token" (denk aan een magisch vraagteken, "?") en vraagt aan het Geheugen: "Is dit pad goed, gebaseerd op alles wat er tot nu toe is opgeslagen?"
  • Het Resultaat: Omdat de Rechter niet de hele tekst opnieuw hoeft te lezen, daalt de kosten van een enorme explosie naar een eenvoudige, lineaire wandeling. Het papier bewijst wiskundig dat dit Geheugen strikt meer informatie bevat dan de tekst zelf. Het is alsof je een 3D-hologram van het verhaal hebt versus een plat stuk papier; het hologram bevat meer detail in minder ruimte.

De Cijfers: Hoe Snel Is Het Eigenlijk?
Het team heeft dit getest op enkele van de moeilijkste wiskundige puzzels (zoals MATH, GSM8K en AIME) met verschillende AI-groottes (0.6B, 4B en 8B parameters). Dit is wat ze hebben gemeten:

  • Snelheid: KV-PRM is tot wel 37 keer sneller in de echte wereld. Voor een lang verhaal duurde een enkele controle bij de oude Rechter 172,0 milliseconden, terwijl dit bij de nieuwe Rechter slechts 4,6 milliseconden duurde.
  • Energie: Het verbruikt tot wel 5.000 keer minder computationele stappen (FLOPs) per controle.
  • Geheugen: Het heeft 34,2 keer minder computergeheugen nodig om de taak te volbrengen.
  • Nauwkeurigheid: Ondanks dat het zo veel sneller is, bleef het niet alleen "bijbenen"; het behaalde vaak zelfs betere scores dan de oude, trage Rechters.

Wat Ze Expliciet Uitsluiten
Het paper is zeer duidelijk over wat niet werkt of niet het antwoord is:

  • Gewoon de Rechter kleiner maken: Het team heeft geprobeerd een kleinere AI (0.6B of 4B) te gebruiken als de oude, tekstlezende Rechter om geld te besparen. Ze ontdekten dat dit weliswaar sneller was, maar ook minder slim. Zelfs een kleine 8B KV-PRM versloeg de enorme 8B tekstlezende Rechter met een enorme marge. Het paper betoogt dat het simpelweg verkleinen van het model niet de oplossing is; het is het veranderen van hoe het model leest.
  • Meer tokens lezen: Het team vroeg zich af: "Wat als we meer dan één vraagteken gebruiken om het verhaal te controleren?" Hun wiskunde (Theorema 2) en experimenten laten zien dat het eerste vraagteken bijna alle nuttige informatie vastlegt. Het toevoegen van een tweede of derde vraagteken levert bijna geen extra voordeel op, maar kost wel meer. Dus, het vasthouden aan slechts één verify token is het ideale punt.

Een Bonus Truc: "KV Steering"
Omdat de nieuwe Rechter naar het "Magische Geheugen" kijkt (een vloeiend, continu signaal) in plaats van naar tekst (dat schokkerig en discreet is), ontdekte het team een gaaf bijeffect. Ze konden de gedachten van de detectives daadwerkelijk bijsturen terwijl ze aan het denken waren, door wiskundige gradiënten te gebruiken om het gesprek naar een beter antwoord te leiden. Ze noemen dit KV Steering. Het paper laat zien dat dit in een proof-of-concept werkte en de nauwkeurigheid op AIME-puzzels met wel 3,33 procentpunt verbeterde zonder zelfs een zoektocht uit te voeren. Het paper merkt op dat dit structureel onmogelijk is met de oude tekstgebaseerde Rechters, omdat je een stuk papier niet op dezelfde manier kunt "sturen" als een geheugensignaal.

De Kern van het Verhaal
Dit paper suggereert niet alleen dat dit zou kunnen werken; ze hebben het gemeten over meerdere datasets en modelgroottes en hebben het wiskundig bewezen. Ze ontdekten dat door de eigen "Magische Geleende Geheugen" van de AI te hergebruiken in plaats van de tekst opnieuw te lezen, we complexe problemen veel sneller, goedkoper en vaak ook nauwkeuriger kunnen oplossen. Het is een verschuiving van "het hele boek opnieuw lezen" naar "het controleren van de perfecte aantekeningen van de auteur."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →