Efficient LLM Serving for Agentic Workflows: A Data Systems Perspective
यह शोध पत्र Helium को प्रस्तुत करता है, जो एक वर्कफ़्लो-जागरूक सर्विंग फ्रेमवर्क है जो एजेंटिक LLM वर्कलोड को क्वेरी प्लान के रूप में मॉडल करने के लिए प्रोएक्टिव कैशिंग और कैश-अवेयर शेड्यूलिंग जैसे डेटा सिस्टम सिद्धांतों को लागू करता है, जिससे रेडंडेंसी (अनावश्यकता) समाप्त होती है और मौजूदा सिस्टमों की तुलना में 1.56x तक की गति वृद्धि प्राप्त होती है।