🤖 AI
Prism: Cost-Efficient Multi-LLM Serving via GPU Memory Ballooning
प्रिज्म (Prism) एक मेमोरी-केंद्रित LLM को-सर्विंग फ्रेमवर्क है जो 'kvcached' नामक एक नवीन मेमोरी बैलूनिंग तकनीक का उपयोग करता है, जो कई मॉडलों के बीच GPU मेमोरी को गतिशील रूप से पुनः प्राप्त करने और पुनर्वितरित करने के लिए स्थानिक और लौकिक साझाकरण (spatial and temporal sharing) को एकीकृत करता है, जिससे उत्पादन वातावरण में लागत-दक्षता और SLO अनुपालन में सुधार होता है।
Shan Yu, Yifan Qiao, Mingyuan Ma, Yangmin Li, Shuo Yang, Xinyuan Tong, Yang Wang, Zhiqiang Xie, Yuwei An, Shiyi Cao, Ke (…)2026-06-12