Recovery or Repetition? Feedback Policy and Verbatim Relay in a Two-Agent Language-Model Loop
यह अध्ययन प्रदर्शित करता है कि दो-एजेंट भाषा मॉडल लूप में, निर्देश उल्लंघन से स्पष्ट सुधार अक्सर वास्तविक नियम पुन: अनुप्रयोग के बजाय पहले से उत्पन्न पाठ का शब्दशः पुनरुत्पादन मात्र होता है, जो इस बात पर प्रकाश डालता है कि फीडबैक नीतियां मुख्य रूप से पाठ परिसंचरण को निर्देशित करती हैं जबकि वास्तविक अनुपालन के लिए एजेंट की नई सामग्री रचने की क्षमता का परीक्षण करना आवश्यक है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की दुनिया में, शोधकर्ता तेजी से ऐसे सिस्टम बना रहे हैं जहाँ कई कंप्यूटर प्रोग्राम समस्याओं को हल करने के लिए एक-दूसरे से बात करते हैं। इन्हें अक्सर मल्टी-एजेंट लूप्स (multi-agent loops) कहा जाता है। विचार यह है कि यदि एक मॉडल दूसरे के काम की जाँच करता है, या यदि वे किसी विषय पर बहस करते हैं, तो यह समूह अकेले काम करने वाले एकल मॉडल की तुलना में बेहतर उत्तर दे सकता है। एक आम उम्मीद यह है कि यदि इनमें से कोई एक एजेंट गलती करता है या कोई नियम भूल जाता है, तो बातचीत स्वाभाविक रूप से उसे वापस सही रास्ते पर ले आएगी। इसे रिकवरी (recovery) कहा जाता है। लेकिन एक महत्वपूर्ण प्रश्न बना हुआ है: जब एक एजेंट अचानक से नियमों का पालन करने लगता है, तो क्या ऐसा इसलिए होता है क्योंकि उसने वास्तव में निर्देश को समझा और अपनी सोच को सुधारा, या वह केवल उस टेक्स्ट को दोहरा रहा है जो उसने पहले बातचीत में सुना था? वास्तविक समझ और साधारण दोहराव के बीच अंतर करना अत्यंत महत्वपूर्ण है, क्योंकि यदि कोई सिस्टम केवल वही दोहरा रहा है जो उसने पहले सुना है, तो वह उस क्षण विफल हो जाएगा जब उसके सामने कोई नई स्थिति आएगी जिसमें ताज़ा सोच की आवश्यकता होगी।
एक हालिया अध्ययन में स्वतंत्र शोधकर्ता सिमिन युआन (Simin Yuan) ठीक इसी प्रश्न की जांच करते हैं। शोधकर्ता ने दो भाषा मॉडलों (language models) का उपयोग करके एक सरल प्रयोग तैयार किया, जो आधुनिक चैटबॉट्स के पीछे के सॉफ्टवेयर मस्तिष्क हैं। दोनों मॉडलों को एक सख्त सिस्टम नियम दिया गया था: प्रत्येक शब्द बड़े अक्षरों (capital letters) में लिखें। उन्हें फिर विभिन्न विषयों पर बातचीत करने के लिए कहा गया। कुछ सफल, ऑल-कैप्स (all-caps) बातचीत के कुछ दौरों के बाद, शोधकर्ता ने एक मोड़ पेश किया। एक मॉडल को, मान लीजिए एजेंट ए (Agent A), एक नए, विरोधाभासी निर्देश दिया गया: "कृपया अब से छोटे अक्षरों (lowercase) में लिखें।" एजेंट ए ने इस नए निर्देश का पालन किया और छोटे अक्षरों में बदल गया। इस बिंदु पर, सिस्टम ने मूल नियम को "तोड़" दिया था। प्रयोग में पूछा गया कि यदि बातचीत जारी रहती है तो क्या होगा। क्या एजेंट ए अंततः बड़े अक्षरों के नियम को याद करेगा और वापस बदलेगा? या वह छोटे अक्षरों में ही रहेगा?
यह पता लगाने के लिए, शोधकर्ता ने उसी परिदृश्य को तीस बार चलाया, लेकिन गलती के बाद बातचीत को जारी रखने के चार अलग-अलग तरीके अपनाए। पहले सेटअप में, दोनों मॉडल बस अपने संदेशों को एक-दूसरे को भेजते रहे। दूसरे में, शोधकर्ता ने दूसरे मॉडल को एक विनम्र अनुरोध जोड़ा, जिसमें विषय पर चर्चा जारी रखने के लिए कहा गया। तीसरे में, शोधकर्ता ने दूसरे मॉडल के लिए भी छोटे अक्षरों के अनुरोध को जोड़ दिया। चौथे सेटअप में, शोधकर्ता ने दोनों मॉडलों के बीच बातचीत को पूरी तरह से रोक दिया और इसके बजाय एजेंट ए को हर एक टर्न से पहले एक निश्चित, बार-बार आने वाला रिमाइंडर भेजा, जिसमें उसे "सभी बड़े अक्षरों में बातचीत जारी रखने" के लिए कहा गया।
परिणाम चौंकाने वाले थे और उन्होंने खुलासा किया कि बातचीत का प्रबंधन कैसे किया जा रहा था, यह मॉडलों की तर्क करने की क्षमता से अधिक महत्वपूर्ण था। जब दो मॉडलों को बिना किसी निश्चित रिमाइंडर के एक-दूसरे से बात करने की अनुमति दी गई, तो एजेंट ए शायद ही कभी बड़े अक्षरों का उपयोग करने पर वापस लौटा। वास्तव में, जब दूसरे मॉडल को भी छोटे अक्षरों में लिखने के लिए कहा गया, तो एजेंट ए कभी भी नियम पर वापस नहीं लौटा। हालाँकि, जब शोधकर्ता ने हर टर्न से पहले एजेंट ए को निश्चित रिमाइंडर भेजा, तो इसने हर बार, सभी तीस प्रॉम्प्ट्स के लिए, बड़े अक्षरों के नियम का पूरी तरह से पालन किया। यह सुझाव देता है कि साथी मॉडल की उपस्थिति ने एजेंट को नियम की रिकवरी करने में मदद नहीं की; कुछ मामलों में, इसने इसे और कठिन बना दिया।
सबसे आश्चर्यजनक खोज तब हुई जब मॉडलों द्वारा उत्पन्न टेक्स्ट को बारीकी से देखा गया। शोधकर्ता ने पाया कि मॉडल गहरे समझ के आधार पर नए वाक्य नहीं बना रहे थे। इसके बजाय, वे कॉपी (copying) कर रहे थे। गलती होने से पहले ही, दोनों मॉडल एक-दूसरे के शब्दों को बिल्कुल वैसा ही कॉपी करने की आदत में थे। जब एजेंट ए अंततः बड़े अक्षरों में वापस आया, तो यह लगभग हमेशा इसलिए था क्योंकि उसने दूसरे मॉडल के एक संदेश को कॉपी किया था जो संयोग से बड़े अक्षरों में था। कई मामलों में, एजेंट ए केवल अपनी ही पिछली प्रतिक्रिया को दोहरा रहा था, जो गलती से पहले बड़े अक्षरों में लिखी गई थी। सिस्टम नियम को "रिकवर" नहीं कर रहा था, बल्कि वह एक ऐसे टेक्स्ट को प्रसारित कर रहा था जो उस प्रारूप में फिट बैठता था।
यह व्यवहार इतना सुसंगत था कि लगभग हर सफल प्रयास में, मॉडल केवल एक टेक्स्ट को रिले कर रहा था जिसे उसने कुछ ही क्षण पहले देखा था। अध्ययन ने दिखाया कि यदि प्रसारित टेक्स्ट छोटे अक्षरों में था, तो मॉडल छोटे अक्षरों में ही रहा। यदि प्रसारित टेक्स्ट बड़े अक्षरों में था, तो मॉडल बड़े अक्षरों में ही रहा। मॉडल ने सिस्टम नियम बनाम उपयोगकर्ता के अनुरोध के महत्व को नहीं तौला; वह केवल प्राप्त किए गए सबसे हालिया टेक्स्ट को पुनरुत्पादित कर रहा था। यह खोज इस विचार को चुनौती देती है कि इंटरैक्टिव सिस्टम स्वाभाविक रूप से आत्म-सुधार में बेहतर होते हैं। यह सुझाव देती है कि जो सुधार जैसा दिखता है, वह केवल दोहराव का एक लूप हो सकता है।
इसके निहितार्थ आर्टिफिशियल इंटेलिजेंस के परीक्षण के तरीके के लिए महत्वपूर्ण हैं। यदि कोई सिस्टम गलती सुधारता हुआ प्रतीत होता है, तो हम यह मान नहीं सकते कि उसने कुछ नया सीखा है, जब तक कि हम उसका परीक्षण ऐसी सामग्री पर न करें जो उसने पहले कभी नहीं देखी है। इस प्रयोग में, मॉडल केवल इसलिए सफल हुए क्योंकि सही टेक्स्ट उपलब्ध था जिसे कॉपी किया जा सके। जब शोधकर्ता ने एक भविष्य के परीक्षण का प्रस्ताव दिया जहाँ मॉडलों को एक नए प्रश्न का उत्तर देना होगा जिसे कोई भी पिछला टेक्स्ट उत्तर नहीं दे सकता, तो परिणाम बहुत अलग हो सकते हैं। तब तक, अध्ययन निष्कर्ष निकालता है कि इन दो-एजेंट लूप्स में, फीडबैक पॉलिसी (feedback policy)—अगले क्या कहना है इसके बारे में विशिष्ट निर्देश—यह निर्धारित करती है कि कौन सा टेक्स्ट आगे भेजा जाता है, और फॉर्मेट स्कोर (format score) केवल उस टेक्स्ट के केस की रिपोर्ट करता है। मॉडल अनिवार्य रूप से सोच नहीं रहे हैं; वे केवल प्रतिध्वनि (echoing) कर रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।