SAGE: Scalable AI Governance & Evaluation
SAGE एक स्केलेबल AI गवर्नेंस फ्रेमवर्क है जो नीति (policy), मिसाल (precedent) और LLM सरोगेट जजों के द्विआयामी अंशांकन लूप (bidirectional calibration loop) के माध्यम से उच्च-गुणवत्ता वाले मानवीय निर्णय को कार्यान्वित करता है, जिसमें लिंक्डइन सर्च में नीति-अनुरूप मॉडल मूल्यांकन को सक्षम करने के लिए लागत प्रभावी डिस्टिलेशन का उपयोग किया गया है, जिसने अंततः दैनिक सक्रिय उपयोगकर्ताओं को 0.25% तक बढ़ा दिया।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल समाचार पत्र (LinkedIn) के संपादक-इन-चीफ हैं जो हर दिन लाखों लेख (नौकरियां और प्रोफाइल) प्रकाशित करता है। आपका लक्ष्य यह सुनिश्चित करना है कि जब कोई पाठक किसी विशिष्ट चीज़ की खोज करे, जैसे कि "एंट्री-लेवल डेटा एनालिस्ट," तो उन्हें केवल वे शब्द वाले कोई भी रैंडम लेख न मिलें, बल्कि उन्हें बिल्कुल सही लेख मिले।
समस्या क्या है? आपके पास बहुत अधिक लेख और बहुत अधिक पाठक हैं। आप हर एक सर्च रिजल्ट को चेक करने के लिए मानव संपादक का उपयोग नहीं कर सकते कि वह अच्छा है या नहीं। यदि आप सरल गणित (जैसे कि कितने लोगों ने लिंक पर क्लिक किया, इसे गिनना) का उपयोग करने की कोशिश करते हैं, तो आपको अप्रासंगिक लेकिन लोकप्रिय लेखों द्वारा धोखा दिया जा सकता है।
यह SAGE की कहानी है, एक नया सिस्टम जिसे LinkedIn ने इस समस्या को हल करने के लिए बनाया है। SAGE को एक "सुपर-एडिटर" के रूप में समझें जो एक मानव विशेषज्ञ की तरह सोचना सीखता है, लेकिन एक रोबोट की गति से काम करता है।
यह कैसे काम करता है, इसके सरल चरण यहाँ दिए गए हैं:
1. समस्या: "मानव बनाम रोबोट" का अंतर
आमतौर पर, जब कंपनियाँ सर्च इंजन बनाती हैं, तो वे दो चीजों पर निर्भर करती हैं:
- मानव संपादक: वे गुणवत्ता का निर्णय लेने में माहिर होते हैं, लेकिन वे धीमे और महंगे होते हैं। वे लाखों परिणामों को नहीं पढ़ सकते।
- एंगेजमेंट मेट्रिक्स (Engagement Metrics): वे क्लिक और व्यूज को गिनते हैं। लेकिन यह एक फिल्म को उसके बॉक्स ऑफिस कलेक्शन से आंकने जैसा है; एक बुरी फिल्म भी लोकप्रिय हो सकती है यदि लोग गलती से उस पर क्लिक कर देते हैं। यह आपको यह नहीं बताता कि फिल्म वास्तव में अच्छी है या नहीं।
LinkedIn को मानव की गुणवत्ता निर्णय क्षमता और मशीन की गति दोनों की आवश्यकता थी।
2. समाधान: "SAGE" फ्रेमवर्क
SAGE का अर्थ है स्केलेबल AI गवर्नेंस एंड इवैल्यूएशन (Scalable AI Governance & Evaluation)। यह तीन भागों वाली एक टीम है जो मिलकर सर्च परिणामों को परखने के लिए एक आदर्श "नियम पुस्तिका" बनाती है।
भाग A: पॉलिसी (नियम पुस्तिका)
यह साधारण अंग्रेजी में लिखे गए नियमों का एक सेट है। यह केवल "कीवर्ड मैच" करने के बजाय यह कहता है जैसे, "यदि कोई उपयोगकर्ता एंट्री-लेवल नौकरी मांगता है, तो परिणाम के लिए 10 साल का अनुभव आवश्यक नहीं होना चाहिए।" यह परिभाषित करता है कि "अच्छा" वास्तव में क्या है।
भाग B: प्रीसीडेंट (नमूना उत्तर)
कल्पना करें कि एक शिक्षक छात्र को कुछ नमूना निबंध दे रहा है जिनमें पूर्ण अंक और स्पष्टीकरण दिए गए हैं। SAGE मानव विशेषज्ञों द्वारा सावधानीपूर्वक चुने गए "गोल्ड स्टैंडर्ड" उदाहरणों के एक छोटे से सेट का उपयोग करता है। ये उदाहरण AI को दिखाते हैं कि कठिन स्थितियों में नियम पुस्तिका को ठीक से कैसे लागू किया जाए।
भाग C: सरोगेट जज (छात्र)
यह एक AI (एक लार्ज लैंग्वेज मॉडल) है जो जज के रूप में कार्य करता है। यह सर्च परिणामों को पढ़ता है और उनकी तुलना नियम पुस्तिका (Rulebook) और नमूना उत्तरों (Sample Answers) से करता है।
3. सीक्रेट सॉस: "टू-वे ट्रेनिंग"
अतीत में, आप बस AI को नियम बताते थे और उम्मीद करते थे कि वह समझ जाएगा। SAGE एक टू-वे कैलिब्रेशन लूप (Two-Way Calibration Loop) का उपयोग करता है।
- मानव से AI तक: मनुष्य AI को नियम सिखाते हैं और उसे उदाहरण दिखाते हैं।
- AI से मानव तक: AI वास्तव में मनुष्यों की आलोचना करता है!
- यदि AI देखता है कि एक मानव विशेषज्ञ ने गलती की है (जैसे कि एक लंबे जॉब डिस्क्रिप्शन में छिपी हुई बारीकी को मिस कर दिया), तो वह उसे फ्लैग करता है।
- यदि AI भ्रमित होता है क्योंकि नियम अस्पष्ट हैं, तो वह मनुष्यों को बताता है, "हे, आपकी नियम पुस्तिका इस विशिष्ट मामले को कवर नहीं करती है।"
यह एक चक्र बनाता है जहाँ नियम पुस्तिका, उदाहरण और AI जज तीनों मिलकर स्मार्ट होते हैं। वे एक-दूसरे की गलतियों को सुधारते हैं जब तक कि वे लगभग पूरी तरह से सहमत न हो जाएं (मानव विशेषज्ञों के साथ लगभग 77% सहमति, जिसे इस क्षेत्र में "पर्याप्त" माना जाता है)।
4. स्पीड ट्रिक: "डिस्टिलेशन" (शिक्षक से छात्र तक)
"टीचर" AI (वह जिसने मनुष्यों से सीखा है) बहुत स्मार्ट है लेकिन धीमा और महंगा है। यह एक जीनियस प्रोफेसर की तरह है जो एक पेपर को ग्रेड करने में घंटों लगा देता है। LinkedIn को प्रति सेकंड लाखों पेपर्स को ग्रेड करने की आवश्यकता है।
इसलिए, उन्होंने डिस्टिलेशन (Distillation) नामक तकनीक का उपयोग किया।
- कल्पना करें कि टीचर (जीनियस प्रोफेसर) अपनी सोचने की प्रक्रिया को एक स्टूडेंट (एक तेज़, कुशल इंटर्न) को समझाता है।
- स्टूडेंट टीचर के तर्क की नकल करना सीखता है लेकिन बहुत छोटा और तेज़ बन जाता है।
- परिणाम: स्टूडेंट जज, टीचर की तुलना में 92 गुना सस्ता और तेज़ है, लेकिन फिर भी वह लगभग उतनी ही बार सही उत्तर देता है जितनी बार मानव विशेषज्ञ देते हैं।
5. इसने LinkedIn को कैसे बदला
एक बार जब उन्होंने इस तेज़, स्मार्ट स्टूडेंट जज को बना लिया, तो उन्होंने इसका तीन शक्तिशाली तरीकों से उपयोग किया:
- सेफ्टी नेट (ऑफलाइन टेस्टिंग): कोई भी नया सर्च फीचर लॉन्च करने से पहले, वे इसे स्टूडेंट जज के माध्यम से चलाते हैं। यदि AI कहता है, "यह नया फीचर खराब परिणाम दिखा रहा है," तो वे इसे तुरंत रोक सकते हैं। उन्हें वास्तविक उपयोगकर्ताओं की शिकायत का इंतजार करने की आवश्यकता नहीं होती। इससे उनका टेस्टिंग समय 2 सप्ताह से घटकर 3 दिन रह गया।
- रियल-टाइम गेटकीपर (ऑनलाइन सर्विंग): उन्होंने AI को और भी छोटा बना दिया ताकि यह रियल-टाइम में चल सके। अब, जब भी आप सर्च करते हैं, तो इस AI का एक छोटा संस्करण तुरंत परिणामों की जांच करता है कि क्या वे नियमों का पालन करते हैं।
- अर्ली वार्निंग सिस्टम (पूर्व चेतावनी प्रणाली): उन्होंने सिस्टम को 24/7 निगरानी करने के लिए AI का उपयोग किया। कभी-कभी, एक सर्च अपडेट क्लिक्स के आधार पर ठीक लग सकता है, लेकिन AI नोटिस करता है कि क्वालिटी गिर रही है। इसने एक ऐसी समस्या को पकड़ा जिसे मानव मेट्रिक्स मिस कर गए थे, जिससे उपयोगकर्ताओं का बुरा अनुभव होने से बच गया।
निचोड़
इस सिस्टम का उपयोग करके, LinkedIn ने केवल अपने सर्च को "तेज़" ही नहीं बनाया; बल्कि इसे स्मार्ट और अधिक भरोसेमंद बनाया।
पेपर का दावा है कि उच्च-गुणवत्ता वाले नियमों को लागू करने के लिए SAGE का उपयोग करने से, उन्होंने LinkedIn पर डेली एक्टिव यूजर्स (Daily Active Users) में 0.25% की वृद्धि देखी। सैकड़ों मिलियन उपयोगकर्ताओं वाले प्लेटफॉर्म की दुनिया में, यह छोटा सा प्रतिशत उन लोगों की एक बड़ी संख्या का प्रतिनिधित्व करता है जिन्हें जो चाहिए था वह मिला, वे साइट पर रुके, और वापस आते रहे।
संक्षेप में: SAGE ने "यह तय करने" के बिखरे हुए और व्यक्तिपरक काम को—कि एक अच्छा सर्च रिजल्ट क्या है—एक स्पष्ट, स्वचालित और स्केलेबल प्रक्रिया में बदल दिया जो अपनी गलतियों से सीखती है और लगातार बेहतर होती रहती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।