← Nieuwste papers
🤖 machine learning

Accelerating PayPal's Commerce Agent with Speculative Decoding: An Empirical Study on EAGLE3 with Fine-Tuned Nemotron Models

Dit empirisch onderzoek toont aan dat het toepassen van EAGLE3-speculatieve decoding op PayPal's Commerce Agent de doorvoer met tot 49% verhoogt en de latency verlaagt, terwijl de outputkwaliteit behouden blijft en de GPU-kosten met 50% kunnen worden gereduceerd.

Oorspronkelijke auteurs: Ally Qin, Jian Wan, Sarat Mudunuri, Srinivasan Manoharan

Gepubliceerd 2026-04-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ally Qin, Jian Wan, Sarat Mudunuri, Srinivasan Manoharan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De "Snelle Bode" voor PayPal: Hoe we AI-versnelling ontdekten

Stel je voor dat PayPal een enorme, superintelligente winkelassistent heeft genaamd "Commerce Agent". Deze assistent helpt klanten producten te vinden, vragen te beantwoorden en deals te vinden. Maar deze assistent is een beetje traag; hij denkt lang na voordat hij antwoordt. In de wereld van online winkelen wil je echter dat het antwoord er direct is (binnen 2 seconden), anders haken klanten af.

In dit onderzoek kijken we naar hoe we deze assistent sneller kunnen maken zonder dat hij dommer wordt of dat we duurdere computers nodig hebben.

1. Het Probleem: De Trage Denker

Voorheen hebben we de assistent al getraind met specifieke winkelinformatie (zodat hij beter begrijpt wat "goedkope sneakers" betekent). Dat hielp al veel, maar we wilden nog sneller zijn.

Normaal gesproken werkt een AI zo: hij denkt aan één woord, schrijft het op, denkt aan het volgende woord, schrijft dat op, enzovoort. Dit is als een schrijver die één letter per seconde op een typemachine zet. Het is betrouwbaar, maar traag.

2. De Oplossing: Speculatieve Decoding (De "Gokker" en de "Chef")

De techniek die we hebben getest, noemen we Speculatieve Decoding. Stel je dit voor als een team van twee:

  • De Chef (De grote AI): Dit is de slimme, maar trage assistent. Hij is duur en neemt tijd om na te denken.
  • De Gokker (De kleine AI, genaamd EAGLE3): Dit is een snelle, goedkope assistent die niet zo slim is, maar wel heel snel kan gokken.

Hoe het werkt:
In plaats van dat de Chef één woord per keer bedenkt, laat je de Gokker snel 3 tot 5 woorden achter elkaar raden.

  • De Gokker roept: "Ik denk dat het antwoord is: sneakers, rood, maat 42!"
  • De Chef kijkt snel naar deze gok.
    • Als de Chef denkt: "Ja, klopt!", dan accepteert hij alle drie de woorden in één keer. Snelheidswinst!
    • Als de Chef denkt: "Nee, dat is fout", dan gooit hij de gok weg en bedenkt hij zelf het juiste woord.

Het mooie is: zelfs als de Gokker maar half zo vaak goed heeft, bespaart het toch veel tijd, omdat de Chef minder vaak zelf hoeft te "typen".

3. Wat hebben we ontdekt? (De Resultaten)

We hebben dit getest op PayPal's systemen met verschillende instellingen. Hier zijn de belangrijkste ontdekkingen, vertaald naar alledaagse termen:

  • De "Gok" van 3 woorden is perfect: We hebben getest of de Gokker 3 woorden (γ=3) of 5 woorden (γ=5) moest raden.

    • Resultaat: 3 woorden was de winnaar. De Gokker raakte hier ongeveer 35% van de tijd goed.
    • Waarom niet 5? Als je te veel woorden laat raden, wordt de kans groter dat je ergens in de rij een fout maakt. Dan moet de Chef alsnog alles opnieuw doen. Het is alsof je een lange trein laat rijden: als de eerste wagon vastloopt, moet de hele trein stoppen. Bij een kortere trein (3 woorden) is het risico kleiner.
  • Snelheid zonder extra kosten:

    • Met deze techniek werd de assistent 22% tot 49% sneller.
    • De wachttijd voor klanten werd 18% tot 33% korter.
    • En het beste nieuws: we deden dit op exact dezelfde computers als voorheen. Geen nieuwe dure hardware nodig!
  • Kwaliteit blijft perfect:

    • Soms maken mensen zich zorgen dat snellere antwoorden minder goed zijn. We hebben dit gecontroleerd met een "AI-jury". Het resultaat? De antwoorden waren even goed als de trage versie. De Gokker verandert niets aan de kwaliteit, hij versnelt alleen het proces.
  • Eén computer doet het werk van twee:

    • Omdat het systeem zo efficiënter werd, bleek dat we met één krachtige computer (GPU) net zo goed konden presteren als met twee computers die we eerder gebruikten.
    • Dit betekent dat PayPal 50% minder energie en hardwarekosten kan besparen.

4. Waarom werkt dit zo goed bij PayPal?

Je zou denken dat een AI die winkelspullen verkoopt lastig te voorspellen is. Maar door de specifieke manier waarop we de AI hebben getraind (hij moet antwoorden in een strakke lijstjes-vorm, zoals een formulier invullen), is het voor de "Gokker" makkelijker om te raden wat er komt. Het is alsof je een quiz doet waarbij de antwoorden altijd in een vast patroon staan; dan is gokken veel makkelijker dan bij een vrij gesprek.

Conclusie: Wat betekent dit voor jou?

Dit onderzoek laat zien dat we slimme trucs kunnen gebruiken om AI sneller en goedkoper te maken.

  • Voor jij als klant: Je krijgt snellere antwoorden van de PayPal-assistent, zonder dat het systeem "dommer" wordt.
  • Voor PayPal: Ze kunnen duizenden vragen per seconde afhandelen met minder stroom en minder dure computers.

Het is alsof we een oude, trage auto hebben omgebouwd met een nieuwe, efficiënte versnellingsbak. De auto rijdt niet sneller omdat hij een grotere motor heeft, maar omdat hij de weg veel slimmer aflegt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →