← नवीनतम पेपर
🤖 machine learning

MetaOthello: A Controlled Study of Multiple World Models in Transformers

यह शोध पत्र MetaOthello प्रस्तुत करता है, जो ओथेलो के वेरिएंट्स का एक नियंत्रित समूह है, जो यह प्रदर्शित करता है कि कई खेल नियमों पर प्रशिक्षित ट्रांसफॉर्मर अपने शिक्षण को अलग-अलग उप-मॉडलों में अलग नहीं करते हैं, बल्कि इसके बजाय एक साझा, कारणतः हस्तांतरणीय (causally transferable) बोर्ड-स्टेट प्रतिनिधित्व पर अभिसरित होते हैं जो स्तरित विशिष्टता और ज्यामितीय संरेखण के माध्यम से कई विश्व मॉडलों को व्यवस्थित करता है।

मूल लेखक: Aviral Chawla, Galen Hall, Juniper Lovato

प्रकाशित 2026-07-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aviral Chawla, Galen Hall, Juniper Lovato

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, अत्यंत बुद्धिमान रोबोट शेफ है। आमतौर पर, हम इन रोबोटों के बारे में सोचते हैं कि वे एक बार में एक रेसिपी सीखते हैं। लेकिन वास्तविक दुनिया में, एक रोबोट को एक ही समय में केक बनाना, स्टेक पकाना और सुशी बनाना जानना पड़ सकता है, और ग्राहक के ऑर्डर के आधार पर तुरंत उनके बीच स्विच करना पड़ सकता है।

बड़ा सवाल जो शोधकर्ताओं ने पूछा: यह रोबोट अपने दिमाग में इन अलग-अलग "दुनियाओं" को बिना भ्रमित हुए कैसे रखता है? क्या यह अपने दिमाग के अंदर तीन अलग-अलग रसोई घर बनाता है? या यह एक बड़ी रसोई का उपयोग करता है और बस चलते-फिरते नियमों को बदल देता है?

यह जानने के लिए, लेखकों ने एक खेल मैदान बनाया जिसे MetaOthello कहा गया।

खेल का मैदान: कई नियमों का एक खेल

Othello (जिसे Reversi भी कहा जाता है) को एक बोर्ड गेम के रूप में सोचें जहाँ आप काले और सफेद डिस्क रखते हैं। लक्ष्य अपने प्रतिद्वंद्वी की डिस्क को अपने रंग में बदलना है।

शोधकर्ताओं ने केवल एक संस्करण का खेल नहीं खेला। उन्होंने ओथेलो का एक "मल्टीवर्स" बनाया:

  1. क्लासिक ओथेलो (Classic Othello): मानक नियम।
  2. नोमिडफ्लिप (NoMidFlip): क्लासिक जैसा ही, लेकिन आप केवल बाहरी डिस्क को ही पलट सकते हैं, बीच वाली डिस्क को नहीं।
  3. डेल्फ्लैंक (DelFlank): एक अजीब संस्करण जहाँ डिस्क को पलटने के बजाय डिलीट किया जा सकता है, और खेल अलग-अलग टुकड़ों के फैले हुए होने के साथ शुरू होता है।
  4. इआगो (Iago): बिल्कुल क्लासिक जैसा ही, लेकिन चालों के नाम बदल दिए गए हैं (जैसे "1,1" के बजाय "A1" कहना)।

उन्होंने इन खेलों को खेलने के लिए छोटे AI मॉडल (ट्रांसफॉर्मर्स) को प्रशिक्षित किया। कभी-कभी उन्होंने उन्हें केवल एक खेल के लिए प्रशिक्षित किया; अन्य समय में, उन्होंने उन्हें इन सभी अलग-अलग संस्करणों के एक रैंडम मिश्रण में डाल दिया।

बड़ी खोज: एक मस्तिष्क, कई भूमिकाएँ

शोधकर्ता उम्मीद कर रहे थे कि यदि AI कई खेल सीखता है, तो वह अपने मस्तिष्क को अलग-अलग "उप-मॉडल" में विभाजित कर सकता है—जैसे कि एक ही सिर के भीतर एक "क्लासिक शेफ" और एक "डेल्फ्लैंक शेफ" का होना।

वे गलत थे।

इसके बजाय, AI ने एक साझा, सार्वभौमिक "मानसिक मानचित्र" (mental map) को साझा करना सीखा।

  • साझा मानचित्र (The Shared Map): चाहे AI क्लासिक खेल रहा हो या नोमिडफ्लिप, वह बोर्ड को समझने के लिए बिल्कुल उसी आंतरिक प्रतिनिधित्व (internal representation) का उपयोग करता था। यह ऐसा है जैसे रोबोट शेफ एक केक बना रहा हो या स्टेक, वह किचन काउंटर की एक ही मानसिक छवि का उपयोग करता है।
  • प्रमाण: शोधकर्ताओं ने एक "प्रोब" (एक सरल उपकरण जो AI के मन को पढ़ता है) का उपयोग किया जो क्लासिक ओथेलो पर प्रशिक्षित था। जब उन्होंने नोमिडफ्लिप खेलते समय इस टूल का उपयोग करके AI के मन को पढ़ा, तो यह लगभग पूरी तरह से काम कर गया। AI दो अलग-अलग मानचित्रों का उपयोग नहीं कर रहा था; वह दोनों के लिए एक साझा मानचित्र का उपयोग कर रहा था।

यह भ्रम को कैसे संभालता है?

यहाँ पेचीदा हिस्सा है। खेल की शुरुआत में, एक चाल क्लासिक और नोमिडफ्लिप दोनों में वैध (legal) हो सकती है। लेकिन बाद में, एक चाल एक में वैध हो सकती है लेकिन दूसरी में अवैध। AI को कैसे पता चलता है कि उसे किस नियम पुस्तिका का पालन करना है?

शोध में पाया गया कि AI के मस्तिष्क के बीच में एक विशेष "ट्रैफिक पुलिस" सर्किट (विशेष रूप से लेयर 5 के आसपास) होता है।

  • साझा आधार (The Shared Substrate): AI सभी के लिए बोर्ड का साझा मानचित्र रखता है।
  • संघर्ष डिटेक्टर (The Conflict Detector): जब AI एक ऐसी चाल देखता है जो दोनों खेलों से संबंधित हो सकती है, तो मस्तिष्क का एक विशिष्ट हिस्सा सक्रिय हो जाता है और गणना करता है: "क्या यह एक क्लासिक चाल है या नोमिडफ्लिप चाल?"
  • स्विच (The Switch): यह ट्रैफिक पुलिस फिर जानकारी को रूट करती है। यदि वह निर्णय लेता है "क्लासिक," तो AI क्लासिक नियमों का पालन करता है। यदि "नोमिडफ्लिफ," तो वह उन नियमों का पालन करता है।

यह एक रेलवे स्टेशन की तरह है जहाँ एक मुख्य ट्रैक (साझा बोर्ड) है जो गंतव्य तक पहुँचने से ठीक पहले दो अलग-अलग लाइनों (विशिष्ट नियमों) में विभाजित होता है। AI दो अलग स्टेशन नहीं बनाता; उसके पास बस एक स्मार्ट स्विच वाला एक स्टेशन है।

"आउट ऑफ डिस्ट्रीब्यूशन" ट्विस्ट

शोधकर्ताओं ने यह भी परीक्षण किया कि क्या होता है जब खेल बहुत अलग होते हैं (जैसे क्लासिक बनाम डेल्फ्लैंक)। इस मामले में, खेल इतनी जल्दी अलग हो जाते हैं कि कुछ ही चालों के बाद, एक अनुक्रम (sequence) का दोनों में वैध होना लगभग असंभव होता है।

यहाँ, AI अपनी रणनीति बदल देता है। दोनों संभावनाओं को जीवित रखने और स्विच का इंतजार करने के बजाय, वह जल्दी निर्णय लेता है (commits early)। वह एक दुनिया (आमतौर पर वही जिसे वह अधिक बार देखता है) को चुनता है और दूसरी को छोड़ देता है। यदि आप उसे "भूल गए" खेल को बाद में याद करने के लिए मजबूर करते हैं, तो आपको वापस स्विच करने के लिए उसकी सोच प्रक्रिया में बहुत जल्दी हस्तक्षेप करना होगा।

"इआगो" प्रयोग: वही खेल, अलग भाषा

अंत में, उन्होंने "इआगो" संस्करण का परीक्षण किया, जहाँ नियम क्लासिक के समान हैं, लेकिन चालों के शब्द बदल दिए गए हैं।

  • परिणाम: AI ने बिल्कुल वही आंतरिक संरचना सीखी। एकमात्र अंतर एक सरल गणितीय "रोटेशन" (जैसे किसी मानचित्र को 90 डिग्री घुमाना) था।
  • अर्थ: AI को सतह के शब्दों (शब्दावली) की परवाह नहीं थी; उसने खेल की अमूर्त संरचना (abstract structure) को सीखा। यह महसूस करने जैसा है कि लंदन का नक्शा वैसा ही दिखता है चाहे आप सड़क के नाम अंग्रेजी में पढ़ें या फ्रेंच में।

सारांश

पेपर निष्कर्ष निकालता है कि जब ट्रांसफॉर्मर्स कई "दुनियाओं" (अलग-अलग नियम या संदर्भ) को सीखते हैं, तो वे प्रत्येक के लिए अलग कमरे नहीं बनाते हैं। इसके बजाय, वे:

  1. स्थिति (बोर्ड) के लिए एक कोर प्रतिनिधित्व साझा करते हैं।
  2. संघर्ष को स्थानीयकृत करते हैं ताकि एक स्विच के रूप में कार्य करने वाला एक विशिष्ट, छोटा सर्किट बन सके।
  3. संसाधनों का किफायती उपयोग करते हैं और केवल वहीं अतिरिक्त मशीनरी बनाते हैं जहाँ नियम वास्तव में टकराते हैं।

यह सुझाव देता है कि जटिल AI मॉडल भी आश्चर्यजनक रूप से कुशल हैं: उन्हें हर कार्य के लिए एक अलग मस्तिष्क की आवश्यकता नहीं है; उन्हें बस गियर बदलने के एक स्मार्ट तरीके के साथ एक साझा मस्तिष्क की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →