← Neueste Arbeiten
🤖 machine learning

Accelerating PayPal's Commerce Agent with Speculative Decoding: An Empirical Study on EAGLE3 with Fine-Tuned Nemotron Models

Die Studie zeigt, dass die Anwendung von EAGLE3-basiertem spekulativem Decoding auf PayPals mit einem feinabgestimmten Nemotron-Modell betriebenen Commerce Agent die Durchsatzleistung um bis zu 49 % steigert und die Latenz um bis zu 33 % senkt, wodurch die Leistung eines einzelnen H100-GPUs die eines NIM-Systems auf zwei H100-GPUs erreicht oder übertrifft, bei gleichzeitiger vollständiger Wahrung der Ausgabequalität.

Ursprüngliche Autoren: Ally Qin, Jian Wan, Sarat Mudunuri, Srinivasan Manoharan

Veröffentlicht 2026-04-23
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Ally Qin, Jian Wan, Sarat Mudunuri, Srinivasan Manoharan

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

🚀 Die große Idee: Wie man eine KI zum Rennwagen macht

Stell dir vor, PayPal hat einen sehr klugen, aber etwas langsamen KI-Assistenten (den „Commerce Agent"), der Kunden beim Einkaufen hilft. Dieser Assistent muss komplexe Fragen verstehen und genaue Produktempfehlungen geben.

Das Problem: Der Assistent ist wie ein Schneckenrennen. Er denkt jeden einzelnen Satzwort nach, bevor er das nächste schreibt. Das kostet Zeit und teure Computer-Chips (GPUs).

PayPal hat bereits einen Trick angewendet: Sie haben den Assistenten speziell für den E-Commerce „trainiert" (wie einen Schüler, der extra für Mathe-Nachhilfe geht). Das machte ihn schon schneller. Aber in dieser neuen Studie haben sie einen zweiten, genialen Trick ausprobiert: Spekulatives Decodieren.


🧠 Der Trick: Der „Vorschuss-Manager" (EAGLE3)

Stell dir den normalen KI-Assistenten wie einen Schreiberling vor, der jeden Buchstaben einzeln aufschreibt, den Stift hebt, nachdenkt und dann den nächsten Buchstaben schreibt. Das ist langsam.

PayPal hat nun einen kleinen, superschnellen Assistenten (den „Draft Model" oder „Vorschuss-Manager") hinzugefügt. Dieser kleine Assistent ist nicht so schlau wie der große, aber er ist extrem schnell.

Wie funktioniert das im Alltag?
Stell dir vor, du diktierst einem Freund einen langen Brief:

  1. Der alte Weg: Du sagst ein Wort, er schreibt es auf. Du sagst das nächste, er schreibt es auf.
  2. Der neue Weg (Spekulatives Decodieren):
    • Der kleine, schnelle Assistent schaut dir über die Schulter und vermutet sofort die nächsten 3 Wörter, die du sagen wirst (z. B. „Ich möchte eine rote Jacke").
    • Er schreibt diese 3 Wörter schon mal vor.
    • Der große, kluge Assistent kommt dann und prüft in einem einzigen schnellen Blick: „Stimmen meine Vorhersagen?"
    • Wenn ja: Super! Wir haben 3 Wörter in der Zeit geschrieben, die sonst für 1 Wort gebraucht hätte.
    • Wenn nein: Kein Problem, der große Assistent korrigiert es sofort und wir schreiben weiter.

Der kleine Assistent (EAGLE3) ist so schnell und leicht, dass er fast keine extra Arbeit macht. Selbst wenn er nur bei 35 % der Wörter richtig liegt, spart das enorm viel Zeit.


📊 Was haben sie herausgefunden? (Die Ergebnisse)

PayPal hat diesen Trick in 40 verschiedenen Szenarien getestet (wenige oder viele Kunden gleichzeitig, verschiedene Einstellungen). Hier sind die wichtigsten Erkenntnisse:

  1. Geschwindigkeitsschub: Mit dem Trick (bei einer Vorhersage von 3 Wörtern, genannt γ=3\gamma=3) wurde der Assistent 22 % bis 49 % schneller. Das ist wie ein Sprint, der plötzlich viel flotter läuft.
  2. Die perfekte Zahl: Wenn der kleine Assistent zu viele Wörter auf einmal rät (z. B. 5), wird er oft falsch liegen. Dann muss der große Assistent viel korrigieren, und es wird wieder langsam. 3 Wörter auf einmal waren der perfekte Sweet Spot.
  3. Stabilität: Es spielte keine Rolle, ob 1 Kunde oder 32 Kunden gleichzeitig schrieben. Die Vorhersage-Genauigkeit des kleinen Assistenten blieb immer stabil bei ca. 35 %. Das ist toll für die Planung, denn man weiß genau, wie viel schneller es wird.
  4. Qualität bleibt gleich: Die Kunden merkten keinen Unterschied. Die Antworten waren genauso gut und hilfreich wie vorher. Der Trick hat die Intelligenz nicht beeinträchtigt.
  5. Geld sparen: Das ist der größte Clou! Mit diesem Trick reichte ein einziger Computer-Chip (GPU), um die gleiche Arbeit zu erledigen wie vorher zwei Chips. Das spart PayPal 50 % der Hardware-Kosten!

🍕 Eine Analogie zum Schluss: Die Pizza-Lieferung

Stell dir vor, PayPal ist eine Pizza-Lieferkette.

  • Der alte Chef-Koch (NIM): Er backt jede Pizza einzeln. Er nimmt den Teig, legt die Zutaten auf, schiebt sie in den Ofen, wartet, nimmt sie raus. Das dauert lange.
  • Der neue Trick (EAGLE3): Der Chef-Koch hat einen schnellen Lehrling.
    • Der Lehrling schaut, was der Chef macht, und schätzt schon mal, welche Zutaten auf die nächste Pizza kommen. Er legt sie schon mal bereit.
    • Der Chef kommt, sieht: „Ah, der Lehrling hat richtig geraten!" -> Er schiebt die Pizza sofort in den Ofen.
    • Der Lehrling hat sich nicht geirrt? Der Chef korrigiert es schnell.
    • Ergebnis: Der Chef muss nicht mehr warten, bis er die Zutaten sucht. Er kann die Pizzas (die Antworten) viel schneller an die Kunden liefern. Und weil der Lehrling so schnell ist, braucht die Küche nicht doppelt so große Öfen (Hardware).

Fazit

PayPal hat bewiesen, dass man KI nicht nur durch „schwerere" Modelle oder mehr Hardware verbessern muss. Manchmal reicht es, einen kleinen, schnellen Assistenten hinzuziehen, der mutmaßt, was als Nächstes kommt. Das macht den Service schneller für den Kunden und spart der Firma eine Menge Geld. Ein Gewinn für alle! 🍕💸🚀

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →