SOMA: Efficient Multi-turn LLM Serving via Small Language Model
SOMA एक कुशल मल्टी-टर्न LLM सर्विंग फ्रेमवर्क है जो शुरू में सिमेंटिक डाइवर्जेंस (semantic divergences) की पहचान करने के लिए एक बड़े मॉडल का उपयोग करता है, और फिर शेष बातचीत को संभालने के लिए सॉफ्ट प्रॉम्प्ट्स और लोकलाइज्ड LoRA फाइन-ट्यूनिंग के माध्यम से एक छोटे सरोगेट मॉडल को अनुकूलित करता है, जिसमें गुणवत्ता आश्वासन के लिए एक सेफ्टी गेट भी शामिल है, जिससे लेटेंसी और लागत कम होती है।