xGR: Efficient Generative Recommendation Serving at Scale
यह शोध पत्र xGR प्रस्तुत करता है, जो एक विशेष सर्विंग सिस्टम है जो सख्त कम-विलंबता (low-latency) बाधाओं के तहत काफी उच्च थ्रूपुट प्राप्त करने के लिए एकीकृत चरणबद्ध गणना (unified staged computation), प्रारंभिक सॉर्टिंग समाप्ति (early sorting termination) और बहु-स्तरीय पाइपलाइन समानांतरता (multi-level pipeline parallelism) के माध्यम से जनरेटिव अनुशंसा वर्कलोड को अनुकूलित करता है।