Generator-Mediated Bandits: Thompson Sampling for GenAI-Powered Adaptive Interventions
यह शोध पत्र जनरेटिव एआई-संचालित अनुकूली हस्तक्षेपों (adaptive interventions) के लिए थॉम्पसन सैंपलिंग के साथ जेनरेटर-मीडिएटेड बैंडिट्स (GAMBITTS) का परिचय देता है, जो एक नवीन एल्गोरिदम है जो नीति शिक्षण (policy learning) को त्वरित करने और बेहतर रिग्रेट बाउंड्स प्राप्त करने के लिए एक्शन चयन और स्टोकेस्टिक ट्रीटमेंट जनरेशन के बीच के विभाजन को स्पष्ट रूप से मॉडल करके मानक बैंडिट विधियों में सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक मैनेजर हैं जो अपनी टीम के कर्मचारियों को खुश और उत्पादक रखने की कोशिश कर रहे हैं। आपके पास एक बड़ा, शक्तिशाली AI असिस्टेंट है (एक बहुत ही रचनात्मक लेकिन अप्रत्याशित रोबोट की तरह) जो प्रत्येक कर्मचारी के लिए कस्टम प्रेरणादायक संदेश लिख सकता है।
पुराने तरीके में, आप पहले से लिखे गए विकल्पों की एक निश्चित सूची में से एक संदेश चुनते (जैसे "अच्छा काम किया!" या "जारी रखें!")। आप एक संदेश भेजते, देखते कि कर्मचारी की प्रतिक्रिया क्या है, और फिर अगला संदेश चुनते। यह कंप्यूटर विज्ञान में एक मानक "बैंडिट" (Bandit) समस्या की तरह है: आप विभिन्न विकल्पों को आज़माते हैं यह देखने के लिए कि कौन सा सबसे अच्छा परिणाम देता है।
लेकिन Generative AI की इस नई दुनिया में, चीजें अलग तरह से काम करती हैं। आप एक विशिष्ट संदेश नहीं चुनते; इसके बजाय, आप AI को एक प्रॉम्ट (एक प्रश्न या कमांड) देते हैं (जैसे "दौड़ने के बारे में एक उत्साहजनक नोट लिखें")। AI उस प्रॉम्ट को लेता है और मौके पर एक अनूठा संदेश जेनरेट करता है। यह ट्रीटमेंट (उपचार/प्रक्रिया) है। क्योंकि AI स्टोकेस्टिक (यादृच्छिक/रैंडम) है, इसलिए एक ही प्रॉम्ट से कई अलग-अलग संदेश बन सकते हैं।
मुख्य समस्या: "अनुवादक" का अंतर (The "Translator" Gap)
इस प्रक्रिया को इस प्रकार समझें:
- आप (एजेंट): आप एक प्रॉम्ट चुनते हैं (जैसे, "दौड़ने के बारे में उत्साहजनक नोट लिखें")।
- AI (जेनरेटर): यह आपके प्रॉम्ट को लेता है और एक विशिष्ट टेक्स्ट संदेश निकालता है। यह ट्रीटमेंट है। क्योंकि AI स्टोकेस्टिक (रैंडम) है, इसलिए एक ही प्रॉम्ट से कई अलग-अलग संदेश उत्पन्न हो सकते हैं।
- कर्मचारी (पर्यावरण): वे संदेश पढ़ते हैं और प्रतिक्रिया देते हैं (जैसे, वे दौड़ने जाते हैं या नहीं जाते)। यह प्रतिक्रिया रिवॉर्ड (पुरस्कार/परिणाम) है।
पेंच: आप उस सटीक संदेश को नियंत्रित नहीं करते जो कर्मचारी पढ़ता है; आप केवल प्रॉम्ट को नियंत्रित करते हैं। मानक कंप्यूटर एल्गोरिदम इस मामले में खराब होते हैं क्योंकि वे मानते हैं कि यदि आप "विकल्प A" चुनते हैं, तो आपको हमेशा "विकल्प A" ही मिलेगा। लेकिन यहाँ, "विकल्प A" चुनने से आपको 50% बार एक बेहतरीन संदेश मिल सकता है और 50% बार एक उबाऊ संदेश। यदि आप उस वास्तविक संदेश को अनदेखा कर देते हैं जो AI ने लिखा है, तो आप मूल्यवान सुरागों को खो रहे हैं।
समाधान: GAMBITTS
लेखकों ने GAMBITTS नामक एक नया तरीका बनाया है। इसे एक दो-चरणीय जासूसी खेल के रूप में समझें:
- चरण 1: "संदेश अनुवादक" मॉडल। सिस्टम यह अनुमान लगाने के लिए सीखता है कि AI किसी दिए गए प्रॉम्ट के लिए किस तरह के संदेश उत्पन्न करेगा। यह समझ जाता है, "ओह, जब मैं 'उत्साहवर्धन' के लिए कहता हूँ, तो AI आमतौर पर छोटे, प्रभावशाली वाक्य लिखता है, लेकिन कभी-कभी यह लंबे, अलंकारिक वाक्य भी लिखता है।"
- चरण 2: "रिवॉर्ड" मॉडल। सिस्टम यह सीखता है कि संदेशों के किस प्रकार से वास्तव में कर्मचारी दौड़ने लगते हैं।
जादुई ट्रिक: केवल यह अनुमान लगाने के बजाय कि कौन सा प्रॉम्ट सबसे अच्छा है, GAMBITTS पूरी प्रक्रिया का अनुकरण (सिमुलेशन) करता है। यह पूछता है: "यदि मैं यह प्रॉम्ट भेजता हूँ, तो AI द्वारा कौन से संदेश लिखे जाने की संभावना है? और हमने जो सीखा है उसके आधार पर, उन संदेशों में से कौन से संदेश आमतौर पर एक खुश कर्मचारी की ओर ले जाते हैं?"
AI द्वारा जेनरेट किए गए वास्तविक टेक्स्ट (अर्थात "ट्रीटमेंट") को देखकर, सिस्टम बहुत तेज़ी से सीखता है। यह एक ऐसे शेफ की तरह है जो खाना पकाने के दौरान सॉस को चखकर उसमें मसाला एडजस्ट करता है, बजाय इसके कि वह ग्राहक के खाना खाने का इंतज़ार करे कि उसे कैसा लगा।
गेम खेलने के दो तरीके
पेपर में इस पद्धति के दो संस्करणों का वर्णन किया गया है:
"पूरी तरह से ऑनलाइन" शेफ (foGAMBITTS): यह संस्करण वास्तविक कर्मचारियों से बात करते समय सब कुछ सीखता है। यह देखता है कि AI संदेश कैसे बनाता है और कर्मचारियों की प्रतिक्रिया क्या होती है, और तुरंत अपने दिमाग को अपडेट करता है। यह लचीला है लेकिन इसे सीखने में अधिक समय लगता है क्योंकि इसे AI के लिखने के तरीके और लोगों की प्रतिक्रिया, दोनों को एक साथ समझना पड़ता है।
"आंशिक रूप से ऑनलाइन" शेफ (poGAMBITTS): यह संस्करण अधिक स्मार्ट है यदि आपके पास एक अतिरिक्त किचन हो। वास्तविक कर्मचारियों से बात करने से पहले, शेफ सिमुलेशन में अभ्यास कर सकता है। वे यह देखने के लिए कि AI आमतौर पर क्या लिखता है, एक विशिष्ट प्रॉम्ट के लिए 1,000 संदेश जेनरेट करने के लिए AI से कह सकते हैं। एक बार जब उन्हें पता चल जाता है कि AI का व्यवहार कैसा है, तो उन्हें केवल यह सीखना होता है कि कर्मचारी कैसे प्रतिक्रिया देते हैं। यह बहुत तेज़ और अधिक कुशल है।
यह क्यों मायने रखता है (पेपर के अनुसार)
लेखकों ने अपने विचार का परीक्षण करने के लिए कंप्यूटर सिमुलेशन (मेडिकल इंटर्न और मानसिक स्वास्थ्य के एक काल्पनिक परिदृश्य का उपयोग करके) चलाए। उन्होंने पाया कि:
- गति: GAMBITTS ने मानक तरीकों की तुलना में बहुत तेज़ी से सर्वोत्तम रणनीति सीखी।
- दक्षता: इसने खराब प्रॉम्ट आज़माने में समय बर्बाद नहीं किया क्योंकि यह "मध्यवर्ती चरण" (AI का संदेश जेनरेशन) को समझता था।
- मजबूती (Robustness): भले ही सिस्टम यह पूरी तरह से न समझ पाता कि AI के टेक्स्ट को कैसे सारांशित किया जाए, फिर भी इसने अच्छा प्रदर्शन किया, विशेष रूप से तब जब "रिवॉर्ड" (कर्मचारी की प्रतिक्रिया) शोरपूर्ण (noisy) या कठिन थी।
निचोड़
यह पेपर तर्क देता है कि जब आप निर्णय लेने के लिए Generative AI का उपयोग करते हैं, तो आप AI को एक साधारण बटन की तरह नहीं मान सकते। आपको इस तथ्य को ध्यान में रखना होगा कि AI इस प्रक्रिया के बीच में एक रचनात्मक, रैंडम जेनरेटर है। एक ऐसा मॉडल बनाकर जो यह समझता हो कि AI कैसे लिखता है और लोग कैसे प्रतिक्रिया देते हैं, आप बेहतर और तेज़ निर्णय ले सकते हैं।
यह पेपर क्या दावा नहीं करता है:
- यह दावा नहीं करता कि इसका वर्तमान में अस्पतालों या स्कूलों में उपयोग किया जा रहा है।
- यह दावा नहीं करता कि यह अभी तक वास्तविक दुनिया में अवसाद को ठीक करेगा या स्वास्थ्य परिणामों में सुधार करेगा।
- यह पूरी तरह से एक सैद्धांतिक और सिमुलेशन-आधारित अध्ययन है जो दिखाता है कि यह विशिष्ट गणितीय दृष्टिकोण एक नियंत्रित, कंप्यूटर-जनित वातावरण में मौजूदा तरीकों की तुलना में बेहतर काम करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।