Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
यह शोध पत्र "काउंटरफैक्टुअल इम्पोर्टेंस वेटिंग" (counterfactual importance weighting) का प्रस्ताव करता है, जो एक ऐसी विधि है जो मॉडल के अपने संभाव्यता परिवर्तनों (probability shifts) का उपयोग करके महत्वपूर्ण तर्क चरणों को उच्च श्रेय देने के लिए पॉलिसी ग्रेडिएंट अनुकूलन (policy gradient optimization) में सुधार करती है, बजाय इसके कि सभी टोकन को समान श्रेय दिया जाए।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
समस्या: AI ट्रेनिंग में "पार्टिसिपेशन ट्रॉफी" की समस्या
कल्पना कीजिए कि आप एक बास्केटबॉल टीम को प्रशिक्षित कर रहे एक कोच हैं। एक खेल के दौरान, आपका स्टार खिलाड़ी एक शानदार, गेम जिताने वाला थ्री-पॉइंटर मारता है। लेकिन उससे ठीक पहले, वे तीन मिनट तक कोर्ट पर इधर-उधर घूम रहे थे, अपने जूतों के फीते ठीक कर रहे थे और प्रशंसकों से बातें कर रहे थे।
यदि आप, एक कोच के रूप में, कोर्ट पर मौजूद हर व्यक्ति को—बातें करने वाले खिलाड़ी सहित—अंत में बिल्कुल एक जैसा "बहुत बढ़िया!" वाला ट्रॉफी दे देते, तो आप एक गलती कर रहे होते। आप "फिलर" व्यवहार (बेकार के व्यवहार) को भी उतना ही इनाम दे रहे होते जितना कि "जीतने वाले" व्यवहार को।
वर्तमान AI मॉडल (जैसे कि गणित और कोडिंग के लिए उपयोग किए जाने वाले) ठीक इसी समस्या से जूझ रहे हैं। जब एक AI गणित की समस्या हल करता है, तो वह एक लंबी व्याख्या लिखता है: "मुझे सोचने दें... पहले, मैं 5 और 10 को जोड़ूँगा... उत्तर 15 है।"
अभी, जब हम इन मॉडल्स को प्रशिक्षित करते हैं, तो हम AI को हर एक शब्द के लिए "पार्टिसिपेशन ट्रॉफी" देते हैं। वाक्यांश "मुझे सोचने दें..." को उसी तरह इनाम मिलता है जैसे कि वास्तविक गणितीय गणना "5 + 10 = 15" को। यह AI को "आलसी" बना देता है—यह सीख जाता है कि वह सही उत्तर तक पहुँचने के लिए बहुत सारा बेकार टेक्स्ट बोलकर भी इनाम पा सकता है।
समाधान: "क्या होगा अगर?" टेस्ट (काउंटरफैक्चुअल इम्पोर्टेंस)
Lexsi Labs के शोधकर्ताओं ने AI को प्रशिक्षित करने का एक स्मार्ट तरीका प्रस्तावित किया है। सबको ट्रॉफी देने के बजाय, वे काउंटरफैक्चुअल इम्पोर्टेंस वेटिंग (Counterfactual Importance Weighting) का उपयोग करते हैं।
इसे AI के उत्तर का एक "क्या होगा अगर?" प्रयोग समझें।
यह पता लगाने के लिए कि AI के उत्तर का कौन सा हिस्सा वास्तव में मायने रखता था, शोधकर्ता टेक्स्ट के साथ "लुका-छिपी" का खेल खेलते हैं:
- वे AI का पूरा उत्तर लेते हैं।
- वे एक विशिष्ट हिस्से को "मास्क" (छिपा) देते हैं—उदाहरण के लिए, वे गणित की गणना को मिटा देते हैं लेकिन "मुझे सोचने दें" वाले हिस्से को वैसे ही रहने देते हैं।
- वे AI से पूछते हैं: "यदि वह गणित वाला हिस्सा गायब होता, तो आपके सही उत्तर मिलने की कितनी संभावना होती?"
तर्क:
- यदि गणित छिपाने पर AI के सही होने की संभावना एकदम गिर जाती है, तो शोधकर्ता कहते हैं: "आहा! वह गणित वाला हिस्सा ही असली MVP था!" वे उन विशिष्ट शब्दों को एक बड़ा इनाम देते हैं।
- यदि गणित वाला हिस्सा छिपाने के बाद भी AI के सही होने की संभावना वैसी ही रहती है, तो वे कहते हैं: "वह तो बस फालतू की बातें थीं।" वे उन शब्दों को बहुत कम इनाम देते हैं।
ऐसा करके, वे केवल परिणाम को इनाम नहीं दे रहे हैं; वे तर्क (reasoning) को इनाम दे रहे हैं।
परिणाम: सटीक प्रशिक्षण (Precision Training)
शोधकर्ताओं ने गणित की समस्याओं का उपयोग करके कई AI मॉडल्स पर इसका परीक्षण किया, और परिणाम स्पष्ट थे:
- बेहतर गणित कौशल: AI गणित में बेहतर हो गया क्योंकि इसने "बकवास" करने के बजाय अपनी "मानसिक शक्ति" को वास्तविक गणनाओं पर केंद्रित करना सीख लिया।
- तेजी से सीखना: क्योंकि AI "बातूनी" बनने में समय बर्बाद नहीं कर रहा था, इसलिए वह पुराने तरीके की तुलना में बहुत तेज़ी से उच्च सटीकता तक पहुँच गया।
- "डिस्ट्रैक्टर्स" की पहचान: उन्होंने पाया कि AI के तर्क के कुछ हिस्से वास्तव में डिस्ट्रैक्टर्स (भटकाने वाले तत्व) हैं—ऐसे वाक्य जो इतने भ्रमित करने वाले हैं कि वे वास्तव में AI के सही उत्तर तक पहुँचने की संभावना को कम कर देते हैं। उनका तरीका AI को ऐसा करने से बचने में मदद करता है।
कमी: यह अभी "जादुई छड़ी" नहीं है (अभी तक)
शोधकर्ता अपनी सीमाओं के बारे में ईमानदार थे। यह तरीका गणित के लिए जादू की तरह काम करता है, जहाँ एक स्पष्ट, निर्विवाद उत्तर (जैसे कि स्कोरबोर्ड) होता है।
हालाँकि, यह कोडिंग के लिए उतना प्रभावी नहीं रहा। कोडिंग में, एक छोटे से कोने में एक अकेली गलती भी सब कुछ बिगाड़ सकती है, और "महत्व" हर जगह फैला हुआ होता है, जिससे किसी एक विशिष्ट "MVP" वाक्य की ओर इशारा करना बहुत कठिन हो जाता है।
संक्षेप में
AI को यह बताने के बजाय कि, "उस पूरे पैराग्राफ के लिए अच्छा काम किया," यह तरीका AI को बताता है, "तुमने बहुत सारी बातें कीं, लेकिन ये तीन नंबर ही तुम्हारे जीतने का कारण हैं। उन पर ध्यान केंद्रित करो!"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।