← Neueste Arbeiten
🤖 AI

Kunlun: Establishing Scaling Laws for Massive-Scale Recommendation Systems through Unified Architecture Design

Das Papier stellt Kunlun vor, eine vereinheitlichte Architektur für Empfehlungssysteme in massivem Maßstab, die durch die Adressierung mangelnder Skalierungseffizienz mittels Low-Level-Optimierungen wie Generalized Dot-Product Attention und Hierarchical Seed Pooling sowie High-Level-Innovationen wie Computation Skip vorhersehbare Skalierungsgesetze etabliert und dadurch die Skalierungseffizienz verdoppelt sowie signifikante Auswirkungen auf die Produktion bei Meta Ads erzielt.

Ursprüngliche Autoren: Bojian Hou, Xiaolong Liu, Xiaoyi Liu, Jiaqi Xu, Yasmine Badr, Mengyue Hang, Sudhanshu Chanpuriya, Junqing Zhou, Yuhang Yang, Han Xu, Qiuling Suo, Laming Chen, Yuxi Hu, Jiasheng Zhang, Huaqing Xiong, Y
Veröffentlicht 2026-06-09
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Bojian Hou, Xiaolong Liu, Xiaoyi Liu, Jiaqi Xu, Yasmine Badr, Mengyue Hang, Sudhanshu Chanpuriya, Junqing Zhou, Yuhang Yang, Han Xu, Qiuling Suo, Laming Chen, Yuxi Hu, Jiasheng Zhang, Huaqing Xiong, Yuzhen Huang, Chao Chen, Yue Dong, Yi Yang, Shuo Chang, Xiaorui Gan, Wenlin Chen, Santanu Kolay, Darren Liu, Jade Nie, Chunzhi Yang, Ellie Wen, Jiyan Yang, Huayu Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie betreiben einen riesigen, Hochgeschwindigkeits-Digitalmarktplatz (wie den, den Meta für seine Anzeigen nutzt). Jede Sekunde scrollen Millionen von Menschen, und das System muss erraten, auf welche Anzeige jeder einzelne klicken wird. Um diese Vermutungen anzustellen, nutzt das System ein „Gehirn“ (ein Machine-Learning-Modell), das zwei Arten von Hinweisen nutzt:

  1. Die Geschichte (Sequenz): Was der Nutzer vor kurzem gemacht hat (z. B. „Ich habe auf einen Schuh geklickt, dann auf einen Hut, dann auf einen Rucksack“).
  2. Der Schnappschuss (Kontext): Wer der Nutzer in diesem Moment ist (z. B. „Es regnet“, „Sie sind in New York“, „Sie sind 25 Jahre alt“).

Lange Zeit war der Bau eines „Gehirns“, das sowohl die Geschichte als auch den Schnappschuss effizient verarbeiten konnte, so, als würde man versuchen, ein Rennauto mit quadratischen Rädern zu fahren. Es funktionierte zwar, aber es war unglaublich langsam und verschwendete eine Menge Treibstoff (Rechenleistung). Die Forscher nennen dieses Problem „schlechte Skalierungseffizienz“. Im Grunde genommen war es so, dass wenn sie versuchten, das Gehirn größer zu machen, um es intelligenter zu machen, es nicht schnell genug klüger wurde, um die zusätzlichen Kosten zu rechtfertigen.

Hier kommt Kunlun. Benannt nach einer Gebirgskette, die verschiedene Gipfel vereint, ist Kunlun eine neue Architektur, die darauf ausgelegt ist, diese quadratischen Räder zu reparieren. Das Paper behauptet, dass es das Problem löst, indem es das System auf zwei Ebenen optimiert: der „Mechanik“ (Low-Level) und dem „Verkehrsmanagement“ (High-Level).

So funktioniert Kunlun, erklärt anhand von Alltagsanalogien:

1. Die Low-Level-Fixes: Den Motor reparieren

Die alten Systeme hatten Teile, die ineffizient waren, was dazu führte, dass die Recheneinheit (die GPU) im Leerlauf verharrte, während sie auf Daten wartete. Kunlun ersetzt diese durch Hochleistungsteile:

  • GDPA (Der personalisierte Übersetzer):
    • Das Problem: Das alte System versuchte, die „Geschichte“ basierend auf dem „Schnappschuss“ mit einem umständlichen, schrittweisen Prozess zu übersetzen, was Zeit verschwendete.
    • Die Lösung: Kunlun verwendet GDPA (Generalized Dot-Product Attention). Stellen Sie sich dies als einen Übersetzer vor, der nicht nur Wort für Wort übersetzt, sondern sofort den Kontext des gesamten Satzes versteht. Es führt Schritte zusammen, sodass der Computer nicht ständig stoppen und anfangen muss, was den Motor viel reibungsloser laufen lässt.
  • HSP (Der Zusammenfassende):
    • Das Problem: Nutzer haben lange Verläufe (tausende Klicks). Das alte System versuchte, jeden einzelnen Klick einzeln zu lesen, was überwältigend war.
    • Die Lösung: HSP (Hierarchical Seed Pooling) ist wie ein kluger Editor. Anstatt eine 500-seitige Biografie zu lesen, liest er das Buch, schreibt eine 10-seitige Zusammenfassung und dann ein 1-seitiges Abstract. Es verdichtet die lange Historie in eine kompakte, leistungsstarke Zusammenfassung, die das System tatsächlich nutzen kann, ohne unter der Last zusammenzubrechen.
  • Sliding Window Attention (Der lokale Fokus):
    • Das Problem: Das alte System versuchte, das allererste Ereignis, das ein Nutzer jemals hatte, mit dem zu vergleichen, was er gerade jetzt tut. Aber meistens ist das, was man letzte Woche gemacht hat, viel wichtiger als das, was man letztes Jahr gemacht hat.
    • Die Lösung: Sliding Window Attention sagt dem System: „Schau nicht in die gesamte Geschichte; schau nur auf die letzten paar Seiten.“ Es konzentriert sich auf die jüngsten Interaktionen, was eine massive Menge an Rechenleistung spart, während die Vorhersagen präzise bleiben.

2. Die High-Level-Fixes: Intelligente Verkehrssteuerung

Selbst mit einem großartigen Motor verschwendet man Treibstoff, wenn man in die falsche Richtung fährt oder an jeder roten Ampel hält. Kunlun ändert die Art und Weise, wie Ressourcen verteilt werden:

  • CompSkip (Die Abkürzung/Expressspur):
    • Das Problem: Das alte System zwang das Gehirn dazu, bei jedem einzelnen Schritt exakt dieselbe schwere Arbeit zu leisten, selbst wenn es das gar nicht nötig hatte.
    • Die Lösung: CompSkip ist wie ein intelligentes Ampelsystem. Es erkennt, dass einige Schritte keine vollständige „Selbstprüfung“ (Self-Attention) und einige keine vollständige „Zusammenfassung“ (HSP) benötigen. Es überspringt die unnötigen Schritte in abwechselnden Layern. Wenn das Auto geradeaus fährt, muss es nicht jede Sekunde in den Rückspiegel schauen. Dies spart enorme Mengen an Energie.
  • Event-Level Personalization (Die VIP-Behandlung):
    • Das Problem: Das alte System behandelte einen „Klick“ (ein starkes Signal) genauso wie eine „Impression“ (nur das bloße Sehen einer Anzeige). Es verschwendete Ressourcen auf Ereignisse mit geringem Wert.
    • Die Lösung: Kunlun gibt wichtigen Ereignissen eine VIP-Behandlung. Wenn ein Nutzer kurz davor steht, etwas zu kaufen (ein hochwertiges Ereignis), weist das System mehr Rechenleistung und eine tiefere Analyse zu. Wenn es nur ein entspanntes Stöbern ist, wird ein leichterer, schnellerer Ansatz verwendet. Es ist wie in einem Restaurant, das einem VIP-Gast ein volles Tasting-Menü serviert und jemandem, der nur kurz vorbeikommt, einen schnellen Kaffee.

Das Ergebnis: Das „Scaling Law“

Das Paper behauptet, dass Kunfun durch die Kombination dieser Fixes etwas erreicht, an dem die Branche bisher gescheitert ist: Vorhersehbare Skalierungsgesetze (Predictable Scaling Laws).

In der Vergangenheit führte die Verdoppelung der Rechenleistung nicht immer zu einer Verdoppelung der Intelligenz. Mit Kunfun ist die Beziehung vorhersehbar und effizient.

  • Effizienzsteigerung: Auf den neuesten Supercomputern (NVIDIA B200 GPUs) nutzt Kunfun die Hardware doppelt so effizient wie bisherige Methoden (Sprung von 17 % Auslastung auf 37 %).
  • Reale Auswirkungen: Dies ist kein reines Laborexperiment. Meta hat Kunlun bereits in seinen großen Werbemodellen implementiert. Das Ergebnis? Eine Verbesserung von 1,2 % bei den wichtigsten Geschäftskennzahlen. In der Welt der Werbung, in der täglich Milliarden von Entscheidungen getroffen werden, ist dieser kleine Prozentsatz ein gewaltiger Sieg.

Zusammenfassend lässt sich sagen: Kunlun ist eine intelligentere, schlankere und besser organisierte Art, Empfehlungssysteme aufzubauen. Es hört auf, Treibstoff mit quadratischen Rädern zu verschwenden, überspringt unnötige Stopps und gönnt den wichtigsten Hinweisen die VIP-Behandlung, wodurch das System signifikant klüger wird, wenn es größer wird.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →