SEAR: Schema-Based Evaluation and Routing for LLM Gateways
SEAR एक स्कीमा-आधारित सिस्टम है जो LLM गेटवे के लिए सूक्ष्म-स्तरीय गुणवत्ता संकेतों और परिचालन मेट्रिक्स के लिए एक विस्तार योग्य रिलेशनल स्कीमा को परिभाषित करके मूल्यांकन और रूटिंग को एकीकृत करता है, जो सटीक, व्याख्यात्मक और लागत प्रभावी मल्टी-प्रॉवाइडर रिक्वेस्ट रूटिंग को सक्षम करने के लिए संरचित डेटा उत्पन्न करने हेतु LLM-संचालित तर्क का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, हाई-टेक रेस्टोरेंट किचन चला रहे हैं। आपके पास विभिन्न देशों (प्रदाताओं) के दर्जनों शेफ (LLM मॉडल्स) हैं, जिनमें से प्रत्येक की अपनी ताकत, कमजोरी और कीमत है। कुछ सस्ते लेकिन धीमे हैं; कुछ महंगे लेकिन बेहद प्रतिभाशाली हैं।
हर दिन, हजारों ग्राहक (उपयोगकर्ता) जटिल व्यंजन ऑर्डर करते हैं। आपका लक्ष्य सही व्यंजन को सही शेफ के पास भेजना है ताकि सबसे कम कीमत में सबसे अच्छा भोजन मिल सके।
समस्या:
अभी, अधिकांश किचन अंधेरे में तीर चला रहे हैं। वे अनुमान लगाते हैं कि किस शेफ का उपयोग करना है, या वे बस सबसे सस्ते वाले को चुन लेते हैं और उम्मीद करते हैं कि सब ठीक होगा। जब कोई व्यंजन जल जाता है या कच्चा रह जाता है, तो उन्हें पता नहीं चलता कि क्यों हुआ। क्या यह शेफ की गलती थी? क्या ग्राहक का ऑर्डर भ्रमित करने वाला था? क्या रेसिपी (प्रॉम्ट) खराब थी? वे बस उस व्यंजन को फेंक देते हैं और आगे बढ़ जाते हैं, जिससे पैसा भी बर्बाद होता है और वे कुछ सीख भी नहीं पाते।
समाधान: SEAR
यह पेपर पेश करता है SEAR (स्कीमा-आधारित मूल्यांकन और रूटिंग), जो आपके किचन में एक सुपर-स्मार्ट, हाइपर-ऑर्गनाइज्ड क्वालिटी कंट्रोल मैनेजर और लॉजिस्टिक्स कोऑर्डिनेटर लगाने जैसा है।
SEAR कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:
1. "मास्टर रेसिपी बुक" (स्कीमा)
यह न कि क्वालिटी कंट्रोल मैनेजर अस्पष्ट नोट्स लिखे जैसे कि "यह व्यंजन ठीक था," SEAR उन्हें एक सख्त, डिजिटल चेकलिस्ट (एक डेटाबेस स्कीमा) भरने के लिए मजबूर करता है।
- कोई अनुमान नहीं: चेकलिस्ट में हर चीज़ के लिए विशिष्ट बॉक्स हैं: "क्या ग्राहक ने तीखा खाना माँगा था?" "क्या शेफ ने सही सामग्री का उपयोग किया?" "क्या खाना समय पर परोसा गया था?" "इसकी लागत कितनी थी?"
- "100-कॉलम" वाला स्प्रेडशीट: SEAR हर एक ऑर्डर के लिए लगभग 100 कॉलमों वाला एक विशाल स्प्रेडशीट बनाता है। यह केवल "अच्छा/बुरा" नहीं कहता। यह इसे विस्तार से बताता है: प्रासंगिकता (Relevance), पूर्णता (Completeness), सुरक्षा (Safety), लागत (Cost), गति (Speed)।
- यह क्यों मायने रखता है: क्योंकि डेटा का हर हिस्सा एक विशिष्ट बॉक्स में है, आप तुरंत खोज (search) कर सकते हैं: "मुझे वे सभी ऑर्डर दिखाएं जहाँ शेफ तेज़ था लेकिन खाना ठंडा था।" आप अव्यवस्थित, हाथ से लिखे नोट्स के साथ ऐसा नहीं कर सकते।
2. "स्मार्ट इंस्पेक्टर" (LLM जज)
इस चेकलिस्ट को भरने के लिए, SEAR एक विशेष AI (जज) का उपयोग करता है जो ग्राहक के ऑर्डर और शेफ के अंतिम व्यंजन को पढ़ता है।
- लिखने से पहले सोचना: आमतौर पर, AI बस एक उत्तर दे देता है। SEAR जज को चेकलिस्ट के भीतर ही ज़ोर से सोचने (think out loud) के लिए मजबूर करता है। यह एक निरीक्षक से यह पूछने जैसा है कि खाना ठंडा होने से पहले वह नोट लिखे कि उसे क्यों लगता है कि खाना ठंडा है। इससे गलतियाँ रोकने में मदद मिलती है।
- चरण-दर-चरण भरना: पूरी 100-कॉलम वाली शीट को एक साथ भरने के बजाय (जिससे AI भ्रमित हो जाता है), SEAR इसे चार छोटे चरणों में तोड़ देता है:
- ऑर्डर का विश्लेषण करें: ग्राहक वास्तव में क्या चाहता था?
- व्यंजन का विश्लेषण करें: शेफ ने वास्तव में क्या बनाया?
- दोष ढूँढें: यदि व्यंजन खराब है, तो क्या यह ग्राहक का भ्रमित करने वाला ऑर्डर था या शेफ की गलती थी?
- स्कोर दें: यह कितना बुरा था? (मामूली परेशानी बनाम बड़ी आपदा)।
3. "ट्रैफिक पुलिस" (रूटिंग)
एक बार जब डेटा स्प्रेडशीट में आ जाता है, तो SEAR एक स्मार्ट ट्रैफिक पुलिस बन जाता है।
- "डेटा फ्लाईव्हील": हर बार जब एक व्यंजन परोसा जाता है, तो डेटा लॉग किया जाता है। समय के साथ, सिस्टम पैटर्न सीख जाता है।
- उदाहरण: "ओह, मैं देख रहा हूँ कि 'सिंपल सलाद' के ऑर्डर्स के लिए, शेफ A, शेफ B की तुलना में 90% सस्ता है और बिल्कुल वैसा ही सलाद बनाता है। चलिए भविष्य के सभी सलाद ऑर्डर्स शेफ A को भेजते हैं।"
- उदाहरण: "लेकिन 'कॉम्प्लेक्स स्टेक' के ऑर्डर्स के लिए, शेफ A उन्हें जला देता है। चलिए उन्हें शेफ B के पास भेजते हैं, भले ही उनकी लागत अधिक हो।"
- रियल-टाइम निर्णय: जब एक नया ऑर्डर आता है, तो SEAR पिछले चेकलिस्ट डेटा को देखता है। वह तुरंत निर्णय लेता है: "यह एक सरल कार्य लग रहा है। इसे सस्ते शेफ को भेजें!" या "यह एक जटिल कार्य है। इसे महंगे विशेषज्ञ के पास भेजें!"
4. "जादुई ट्रिक" (यह पहले से बेहतर क्यों है)
SEAR से पहले, कंपनियाँ "शैलो क्लासिफायर" (shallow classifiers) का उपयोग करती थीं—जैसे एक साधारण मेटल डिटेक्टर जो केवल तभी बीप करता है जब कुछ गलत होता है। यह आपको यह नहीं बता पाता था कि क्या गलत था।
SEAR एक जासूस की तरह है। यह केवल बीप नहीं करता; यह आपको बताता है:
- "ग्राहक ने स्टेक माँगा था, लेकिन शेफ ने सलाद दिया।"
- "शेफ धीमा था क्योंकि किचन में बहुत भीड़ थी।"
- "यह विशिष्ट शेफ गणित के सवालों में बेहतरीन है लेकिन रचनात्मक लेखन में बहुत खराब है।"
परिणाम
पेपर में वर्णित वास्तविक दुनिया के परीक्षणों में, SEAR ने एक कंपनी को उनके "सरल" ऑर्डर्स को बहुत सस्ते शेफ को स्विच करने में मदद की।
- परिणाम: उन्होंने गुणवत्ता में कोई गिरावट महसूस किए बिना इनपुट लागत में 90% और आउटपुट लागत में 92% की बचत की।
संक्षेप में:
SEAR AI चैटबॉट्स की अराजक, ब्लैक-बॉक्स दुनिया को एक पारदर्शी, डेटा-संचालित फैक्ट्री में बदल देता है। यह आपको यह अनुमान लगाने के बजाय कि किस AI मॉडल का उपयोग करना है, आपको डेटा का उपयोग करके यह बताने में सक्षम बनाता है कि काम के लिए कौन सा मॉडल सबसे अच्छी वैल्यू प्रदान करता है, जिससे गुणवत्ता बनाए रखते हुए आपके पैसे की भारी बचत होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।