Training-Inference Kernel Contracts: Bounding Divergence in Post-Training and Deployment
यह शोध पत्र पोस्ट-ट्रेनिंग पाइपलाइनों में प्रशिक्षण और अनुमान कर्नेल्स (kernels) के बीच वितरण विचलन (distributional divergence) को औपचारिक रूप से निर्दिष्ट और सीमित करने के लिए एक "कर्नेल कॉन्ट्रैक्ट्स" ढांचे का प्रस्ताव करता है, जो पॉलिसी-ग्रेडिएंट बायस पर सैद्धांतिक सीमाएं व्युत्पन्न करता है और एक संरचित परिनियोजन पाइपलाइन की रूपरेखा तैयार करता है, जबकि यह नोट करता है कि यह उत्पादन-स्तर के अनुभवजन्य सत्यापन के बिना एक वैचारिक ढांचे को प्रस्तुत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली शेफ (AI मॉडल) है जिसने एक उच्च-स्तरीय, पूरी तरह से कैलिब्रेटेड टेस्ट किचन में वर्षों तक खाना बनाना सीखने में बिताया है। इस किचन में, वे सटीक डिजिटल तराजू, ताजी सामग्री और एक धीमी, सावधानीपूर्वक खाना पकाने की प्रक्रिया का उपयोग करते हैं ताकि हर व्यंजन एकदम सही हो। यह ट्रेनिंग किचन (Training Kitchen) है।
अब, कल्पना कीजिए कि आप इस शेफ के व्यंजनों को हजारों भूखे ग्राहकों को परोसना चाहते हैं जो एक व्यस्त फूड ट्रक पर हैं। मांग को पूरा करने के लिए, आप एक अलग सेटअप पर स्विच करते हैं: आप पहले से मापे गए मसाला पैकेट, एक तेज़ (लेकिन थोड़ी कम सटीक) ग्रिल, और समय बचाने के लिए ऑर्डर्स को बैच में करने वाली प्रणाली का उपयोग करते हैं। यह इन्फरेंस किचन (Inference Kitchen) है।
समस्या यह है, जैसा कि इस पेपर में बताया गया है, कि भले ही शेफ वही व्यक्ति है और वही गुप्त रेसिपी (मॉडल वेट्स) का उपयोग कर रहा है, लेकिन फूड ट्रक से आने वाला खाना टेस्ट किचन वाले खाने के बिल्कुल समान नहीं होता है। अंतर बहुत सूक्ष्म है—शायद यहाँ नमक की एक चुटकी कम या वहाँ भुनने का तरीका थोड़ा अलग है—लेकिन हजारों ऑर्डर्स के दौरान, ये सूक्ष्म अंतर जुड़ सकते हैं। कभी-कभी, जो व्यंजन "तीखा" होना चाहिए था, वह "कम तीखा" बनकर आता है, या सुरक्षा जांच जो टेस्ट किचन में काम करती थी, वह फूड ट्रक पर विफल हो जाती है।
यह पेपर इस अंतर को "ट्रेनिंग-इन्फरेंस कर्नल कॉन्ट्रैक्ट" (Training-Inference Kernel Contract) कहता है। यहाँ उनके समाधान का एक सरल विवरण दिया गया है:
1. समस्या: "दो अलग-अलग शेफ"
वर्तमान में, जब हम AI बनाते हैं, तो हम यह मान लेते हैं कि "ट्रेनिंग शेफ" और "इन्फरेंस शेफ" बिल्कुल एक ही काम कर रहे हैं। लेकिन वास्तव में, वे अलग-अलग उपकरणों और तरीकों का उपयोग कर रहे हैं।
- ट्रेनिंग (Training) उच्च-सटीक गणित (जैसे एक डिजिटल तराजू) का उपयोग करती है।
- इन्फरेंस (Inference) तेज़, कम-सटीक गणित (जैसे एक दृश्य अनुमान) का उपयोग करती है ताकि वह तेज़ हो सके और पैसा बचा सके।
क्योंकि वे अलग-अलग उपकरणों का उपयोग करते हैं, वे कभी-कभी अलग निर्णय लेते हैं। एक सामान्य रेस्तरां में, इसका मतलब केवल यह हो सकता है कि सूप का स्वाद थोड़ा अलग है। लेकिन AI के लिए, इसका मतलब यह हो सकता है:
- "रिवॉर्ड हैक" (The Reward Hack): सुदृढीकरण लर्निंग (Reinforcement Learning - जहाँ AI अनुभव और त्रुटियों से सीखता है) में, AI को लग सकता है कि वह बहुत अच्छा काम कर रहा है क्योंकि "फास्ट" किचन ने उसे एक अच्छा स्कोर दिया है, जबकि "प्रिसाइज" किचन ने उसे बुरा स्कोर दिया होता। यह वैसा ही है जैसे किसी छात्र को अभ्यास टेस्ट में 'A' ग्रेड मिले लेकिन वास्तविक परीक्षा में फेल हो जाए क्योंकि ग्रेडिंग का आधार बदल गया है।
- "सेफ्टी स्लिप" (The Safety Slip): एक प्रॉम्प्ट जिसे टेस्ट किचन में मना कर दिया जाता, वह फूड ट्रक में गलती से उत्तर दे सकता है क्योंकि तेज़ ग्रिल ने स्वाद को थोड़ा बदल दिया जिससे सुरक्षा फ़िल्टर को बायपास किया जा सका।
2. समाधान: "कर्नल कॉन्ट्रैक्ट" (The Kernel Contract)
लेखक एक नया नियम पुस्तिका प्रस्तावित करते हैं जिसे "कर्नल कॉन्ट्रैक्ट" कहा जाता है। इसे कानूनी दस्तावेज़ के रूप में नहीं, बल्कि एक "क्वालिटी कंट्रोल चेकलिस्ट" के रूप में समझें जो AI के साथ चलती है।
यह अनुबंध कहता है: "हमें पता है कि फास्ट किचन (Inference), टेस्ट किचन (Training) के बिल्कुल समान नहीं होगा। यह ठीक है। लेकिन यहाँ वे विशिष्ट नियम हैं जिन्हें हम तोड़ेंगे नहीं।"
इस अनुबंध के चार मुख्य भाग हैं:
- संख्यात्मक नियम (N - Numerical Rules): "गणित X मात्रा से अधिक नहीं भटक सकता।" (उदाहरण के लिए, मसाले का स्तर 10% से अधिक नहीं बदल सकता)।
- सांख्यिकीय नियम (S - Statistical Rules): "अंतिम स्वाद सुसंगत होना चाहिए।" (उदाहरण के लिए, 99% समय, व्यंजन को अभी भी 'तीखा' के रूप में पहचाना जाना चाहिए)।
- रनटाइम नियम (R - Runtime Rules): "इसे अभी भी पर्याप्त तेज़ होना चाहिए।" (उदाहरण के लिए, सुरक्षा जांच जोड़ने के कारण फूड ट्रक धीमा नहीं होना चाहिए)।
- ऑब्जर्वेबिलिटी नियम (O - Observability Rules): "हम बाद में किसी भी विशिष्ट ऑर्डर का स्वाद परीक्षण कर सकें।" (यदि कोई ग्राहक शिकायत करता है, तो हमें यह देखने के लिए कि क्या गलत हुआ, दोनों किचनों में उस सटीक ऑर्डर को फिर से चलाने में सक्षम होना चाहिए)।
3. "एस्केलेशन पॉलिसी" (यदि आप नियमों को तोड़ते हैं तो क्या होता है?)
यह अनुबंध केवल एक सूची नहीं है; इसमें एक ट्रैफिक लाइट सिस्टम है:
- हरा (L1): "ध्यान दें।" हमने एक छोटा सा अंतर दर्ज किया। खाना बनाना जारी रखें।
- पीला (L2): "चेतावनी।" अंतर बहुत बड़ा होता जा रहा है। हम इस किचन को नए ऑर्डर्स भेजना बंद कर देते हैं और उन्हें तब तक बैकअप किचन की ओर भेजते हैं जब तक हम इसे ठीक नहीं कर लेते।
- लाल (L3): "आपातकाल।" कुछ बहुत गंभीर रूप से गलत है। हम तुरंत इस किचन को बंद कर देते हैं और एक ज्ञात-सही (known-good) संस्करण पर स्विच कर जाते हैं।
4. "फोर-स्टेज प्रमोशन" (सर्व करने से पहले परीक्षण कैसे करें)
आप सीधे नया किचन जनता के लिए नहीं खोलते हैं। पेपर एक चार-चरणीय सुरक्षा सुरंग का सुझाव देता है:
- ऑफलाइन CI: लैब में परीक्षण ऑर्डर्स के एक निश्चित सेट पर चेकलिस्ट चलाएं। यदि यह विफल होता है, तो लैब से बाहर भी न निकलें।
- शैडो (Shadow): नया किचन खाना पकाए, लेकिन ग्राहकों को पुराने किचन का खाना परोसें। हम बस यह देखने के लिए देखते हैं कि क्या नया किचन गलतियाँ करता।
- कैनरी (Canary): नए किचन को वास्तविक ग्राहकों के एक छोटे समूह (जैसे 1%) को सेवा देने दें। यदि वे शिकायत करते हैं, तो हम तुरंत रुक जाते हैं।
- फुल (Full): यदि सभी खुश हैं, तो हम नए किचन को सभी को सेवा देने देते हैं।
5. "लर्निंग" AI (RL) के लिए यह क्यों महत्वपूर्ण है?
पेपर विशेष रूप से उन AI के बारे में बात करता है जो खुद सीखते हैं (Reinforcement Learning):
- समस्या: जब AI सीखता है, तो वह फास्ट किचन का उपयोग करके दुनिया का एक "स्नैपशॉट" लेता है, लेकिन फिर वह प्रिसाइज किचन से सीखने की कोशिश करता है। यह रेस कार का वीडियो देखकर कार चलाना सीखने जैसा है, लेकिन फिर आप एक अलग मॉडल की कार चला रहे हैं। AI भ्रमित हो जाता है और गलत सबक सीख लेता है।
- सुधार: अनुबंध AI को यह स्वीकार करने के लिए मजबूर करता है कि, "हे, मेरा फास्ट किचन और प्रिसाइज किचन अलग हैं।" यह सीखने की प्रक्रिया में एक "करेक्शन फैक्टर" जोड़ता है ताकि AI फूड ट्रक की गति से धोखा न खा सके।
सारांश
पेपर का तर्क है कि हमें यह मानना बंद कर देना चाहिए कि "ट्रेनिंग AI" और "सर्विंग AI" एक ही चीज़ हैं। इसके बजाय, हमें उन्हें दो अलग-अलग भागीदारों के रूप में देखना चाहिए जिन्होंने एक "कॉन्ट्रैक्ट" पर हस्ताक्षर किए हैं। यह अनुबंध स्पष्ट रूप से बताता है कि वे कितना असहमत हो सकते हैं, यदि वे बहुत अधिक असहमत होते हैं तो क्या होगा, और उन असहमतियों को पकड़ने के लिए क्या करना है इससे पहले कि वे ग्राहक के अनुभव को खराब कर दें।
यह "सब कुछ काम करेगा" की उम्मीद करने से "बिल्कुल मापने" की ओर बढ़ने के बारे में है कि अंतर कहाँ हैं और उन्हें प्रबंधित करने के बारे में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।