← नवीनतम पेपर
🤖 AI

SAGE: Scalable AI Governance & Evaluation

SAGE एक स्केलेबल AI गवर्नेंस फ्रेमवर्क है जो नीति (policy), मिसाल (precedent) और LLM सरोगेट जजों के द्विआयामी अंशांकन लूप (bidirectional calibration loop) के माध्यम से उच्च-गुणवत्ता वाले मानवीय निर्णय को कार्यान्वित करता है, जिसमें लिंक्डइन सर्च में नीति-अनुरूप मॉडल मूल्यांकन को सक्षम करने के लिए लागत प्रभावी डिस्टिलेशन का उपयोग किया गया है, जिसने अंततः दैनिक सक्रिय उपयोगकर्ताओं को 0.25% तक बढ़ा दिया।

मूल लेखक: Benjamin Le, Xueying Lu, Nick Stern, Wenqiong Liu, Igor Lapchuk, Xiang Li, Baofen Zheng, Kevin Rosenberg, Jiewen Huang, Zhe Zhang, Abraham Cabangbang, Satej Milind Wagle, Jianqiang Shen, Raghavan Muth
प्रकाशित 2026-06-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Benjamin Le, Xueying Lu, Nick Stern, Wenqiong Liu, Igor Lapchuk, Xiang Li, Baofen Zheng, Kevin Rosenberg, Jiewen Huang, Zhe Zhang, Abraham Cabangbang, Satej Milind Wagle, Jianqiang Shen, Raghavan Muthuregunathan, Abhinav Gupta, Mathew Teoh, Andrew Kirk, Thomas Kwan, Jingwei Wu, Wenjing Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल समाचार पत्र (LinkedIn) के संपादक-इन-चीफ हैं जो हर दिन लाखों लेख (नौकरियां और प्रोफाइल) प्रकाशित करता है। आपका लक्ष्य यह सुनिश्चित करना है कि जब कोई पाठक किसी विशिष्ट चीज़ की खोज करे, जैसे कि "एंट्री-लेवल डेटा एनालिस्ट," तो उन्हें केवल वे शब्द वाले कोई भी रैंडम लेख न मिलें, बल्कि उन्हें बिल्कुल सही लेख मिले।

समस्या क्या है? आपके पास बहुत अधिक लेख और बहुत अधिक पाठक हैं। आप हर एक सर्च रिजल्ट को चेक करने के लिए मानव संपादक का उपयोग नहीं कर सकते कि वह अच्छा है या नहीं। यदि आप सरल गणित (जैसे कि कितने लोगों ने लिंक पर क्लिक किया, इसे गिनना) का उपयोग करने की कोशिश करते हैं, तो आपको अप्रासंगिक लेकिन लोकप्रिय लेखों द्वारा धोखा दिया जा सकता है।

यह SAGE की कहानी है, एक नया सिस्टम जिसे LinkedIn ने इस समस्या को हल करने के लिए बनाया है। SAGE को एक "सुपर-एडिटर" के रूप में समझें जो एक मानव विशेषज्ञ की तरह सोचना सीखता है, लेकिन एक रोबोट की गति से काम करता है।

यह कैसे काम करता है, इसके सरल चरण यहाँ दिए गए हैं:

1. समस्या: "मानव बनाम रोबोट" का अंतर

आमतौर पर, जब कंपनियाँ सर्च इंजन बनाती हैं, तो वे दो चीजों पर निर्भर करती हैं:

  • मानव संपादक: वे गुणवत्ता का निर्णय लेने में माहिर होते हैं, लेकिन वे धीमे और महंगे होते हैं। वे लाखों परिणामों को नहीं पढ़ सकते।
  • एंगेजमेंट मेट्रिक्स (Engagement Metrics): वे क्लिक और व्यूज को गिनते हैं। लेकिन यह एक फिल्म को उसके बॉक्स ऑफिस कलेक्शन से आंकने जैसा है; एक बुरी फिल्म भी लोकप्रिय हो सकती है यदि लोग गलती से उस पर क्लिक कर देते हैं। यह आपको यह नहीं बताता कि फिल्म वास्तव में अच्छी है या नहीं।

LinkedIn को मानव की गुणवत्ता निर्णय क्षमता और मशीन की गति दोनों की आवश्यकता थी।

2. समाधान: "SAGE" फ्रेमवर्क

SAGE का अर्थ है स्केलेबल AI गवर्नेंस एंड इवैल्यूएशन (Scalable AI Governance & Evaluation)। यह तीन भागों वाली एक टीम है जो मिलकर सर्च परिणामों को परखने के लिए एक आदर्श "नियम पुस्तिका" बनाती है।

भाग A: पॉलिसी (नियम पुस्तिका)

यह साधारण अंग्रेजी में लिखे गए नियमों का एक सेट है। यह केवल "कीवर्ड मैच" करने के बजाय यह कहता है जैसे, "यदि कोई उपयोगकर्ता एंट्री-लेवल नौकरी मांगता है, तो परिणाम के लिए 10 साल का अनुभव आवश्यक नहीं होना चाहिए।" यह परिभाषित करता है कि "अच्छा" वास्तव में क्या है।

भाग B: प्रीसीडेंट (नमूना उत्तर)

कल्पना करें कि एक शिक्षक छात्र को कुछ नमूना निबंध दे रहा है जिनमें पूर्ण अंक और स्पष्टीकरण दिए गए हैं। SAGE मानव विशेषज्ञों द्वारा सावधानीपूर्वक चुने गए "गोल्ड स्टैंडर्ड" उदाहरणों के एक छोटे से सेट का उपयोग करता है। ये उदाहरण AI को दिखाते हैं कि कठिन स्थितियों में नियम पुस्तिका को ठीक से कैसे लागू किया जाए।

भाग C: सरोगेट जज (छात्र)

यह एक AI (एक लार्ज लैंग्वेज मॉडल) है जो जज के रूप में कार्य करता है। यह सर्च परिणामों को पढ़ता है और उनकी तुलना नियम पुस्तिका (Rulebook) और नमूना उत्तरों (Sample Answers) से करता है।

3. सीक्रेट सॉस: "टू-वे ट्रेनिंग"

अतीत में, आप बस AI को नियम बताते थे और उम्मीद करते थे कि वह समझ जाएगा। SAGE एक टू-वे कैलिब्रेशन लूप (Two-Way Calibration Loop) का उपयोग करता है।

  • मानव से AI तक: मनुष्य AI को नियम सिखाते हैं और उसे उदाहरण दिखाते हैं।
  • AI से मानव तक: AI वास्तव में मनुष्यों की आलोचना करता है!
    • यदि AI देखता है कि एक मानव विशेषज्ञ ने गलती की है (जैसे कि एक लंबे जॉब डिस्क्रिप्शन में छिपी हुई बारीकी को मिस कर दिया), तो वह उसे फ्लैग करता है।
    • यदि AI भ्रमित होता है क्योंकि नियम अस्पष्ट हैं, तो वह मनुष्यों को बताता है, "हे, आपकी नियम पुस्तिका इस विशिष्ट मामले को कवर नहीं करती है।"

यह एक चक्र बनाता है जहाँ नियम पुस्तिका, उदाहरण और AI जज तीनों मिलकर स्मार्ट होते हैं। वे एक-दूसरे की गलतियों को सुधारते हैं जब तक कि वे लगभग पूरी तरह से सहमत न हो जाएं (मानव विशेषज्ञों के साथ लगभग 77% सहमति, जिसे इस क्षेत्र में "पर्याप्त" माना जाता है)।

4. स्पीड ट्रिक: "डिस्टिलेशन" (शिक्षक से छात्र तक)

"टीचर" AI (वह जिसने मनुष्यों से सीखा है) बहुत स्मार्ट है लेकिन धीमा और महंगा है। यह एक जीनियस प्रोफेसर की तरह है जो एक पेपर को ग्रेड करने में घंटों लगा देता है। LinkedIn को प्रति सेकंड लाखों पेपर्स को ग्रेड करने की आवश्यकता है।

इसलिए, उन्होंने डिस्टिलेशन (Distillation) नामक तकनीक का उपयोग किया।

  • कल्पना करें कि टीचर (जीनियस प्रोफेसर) अपनी सोचने की प्रक्रिया को एक स्टूडेंट (एक तेज़, कुशल इंटर्न) को समझाता है।
  • स्टूडेंट टीचर के तर्क की नकल करना सीखता है लेकिन बहुत छोटा और तेज़ बन जाता है।
  • परिणाम: स्टूडेंट जज, टीचर की तुलना में 92 गुना सस्ता और तेज़ है, लेकिन फिर भी वह लगभग उतनी ही बार सही उत्तर देता है जितनी बार मानव विशेषज्ञ देते हैं।

5. इसने LinkedIn को कैसे बदला

एक बार जब उन्होंने इस तेज़, स्मार्ट स्टूडेंट जज को बना लिया, तो उन्होंने इसका तीन शक्तिशाली तरीकों से उपयोग किया:

  1. सेफ्टी नेट (ऑफलाइन टेस्टिंग): कोई भी नया सर्च फीचर लॉन्च करने से पहले, वे इसे स्टूडेंट जज के माध्यम से चलाते हैं। यदि AI कहता है, "यह नया फीचर खराब परिणाम दिखा रहा है," तो वे इसे तुरंत रोक सकते हैं। उन्हें वास्तविक उपयोगकर्ताओं की शिकायत का इंतजार करने की आवश्यकता नहीं होती। इससे उनका टेस्टिंग समय 2 सप्ताह से घटकर 3 दिन रह गया।
  2. रियल-टाइम गेटकीपर (ऑनलाइन सर्विंग): उन्होंने AI को और भी छोटा बना दिया ताकि यह रियल-टाइम में चल सके। अब, जब भी आप सर्च करते हैं, तो इस AI का एक छोटा संस्करण तुरंत परिणामों की जांच करता है कि क्या वे नियमों का पालन करते हैं।
  3. अर्ली वार्निंग सिस्टम (पूर्व चेतावनी प्रणाली): उन्होंने सिस्टम को 24/7 निगरानी करने के लिए AI का उपयोग किया। कभी-कभी, एक सर्च अपडेट क्लिक्स के आधार पर ठीक लग सकता है, लेकिन AI नोटिस करता है कि क्वालिटी गिर रही है। इसने एक ऐसी समस्या को पकड़ा जिसे मानव मेट्रिक्स मिस कर गए थे, जिससे उपयोगकर्ताओं का बुरा अनुभव होने से बच गया।

निचोड़

इस सिस्टम का उपयोग करके, LinkedIn ने केवल अपने सर्च को "तेज़" ही नहीं बनाया; बल्कि इसे स्मार्ट और अधिक भरोसेमंद बनाया।

पेपर का दावा है कि उच्च-गुणवत्ता वाले नियमों को लागू करने के लिए SAGE का उपयोग करने से, उन्होंने LinkedIn पर डेली एक्टिव यूजर्स (Daily Active Users) में 0.25% की वृद्धि देखी। सैकड़ों मिलियन उपयोगकर्ताओं वाले प्लेटफॉर्म की दुनिया में, यह छोटा सा प्रतिशत उन लोगों की एक बड़ी संख्या का प्रतिनिधित्व करता है जिन्हें जो चाहिए था वह मिला, वे साइट पर रुके, और वापस आते रहे।

संक्षेप में: SAGE ने "यह तय करने" के बिखरे हुए और व्यक्तिपरक काम को—कि एक अच्छा सर्च रिजल्ट क्या है—एक स्पष्ट, स्वचालित और स्केलेबल प्रक्रिया में बदल दिया जो अपनी गलतियों से सीखती है और लगातार बेहतर होती रहती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →