From Associations to Activations: Comparing Behavioral and Hidden-State Semantic Geometry in LLMs
यह शोध पत्र प्रदर्शित करता है कि व्यवहार संबंधी समानता डेटा, विशेष रूप से मजबूर-विकल्प (forced-choice) कार्यों से प्राप्त डेटा, बड़े भाषा मॉडलों की छिपी हुई अवस्था की अर्थ संबंधी ज्यामिति (hidden-state semantic geometry) को प्रभावी ढंग से पुनः प्राप्त और पूर्वानुमानित कर सकता है, जो यह सुझाव देता है कि बाहरी व्यवहार संबंधी माप आंतरिक संज्ञानात्मक निरूपणों के बारे में महत्वपूर्ण जानकारी बनाए रखते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक बड़ा सवाल: क्या हम यह देखकर रोबोट का दिमाग पढ़ सकते हैं कि वह क्या कह रहा है?
कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल, या LLM) है जिसे आप खोलकर देख नहीं सकते। आप उसके दिमाग, उसके सर्किट या उसके आंतरिक "विचारों" को नहीं देख सकते। आप केवल उससे बात कर सकते हैं और देख सकते हैं कि वह बदले में क्या कहता है।
शोधकर्ताओं ने पूछा: यदि हम देखते हैं कि यह रोबट सवालों के जवाब कैसे देता है, तो क्या हम यह पता लगा सकते हैं कि इसका आंतरिक "दिमाग" कैसे व्यवस्थित है?
मनोविज्ञान की दुनिया में, वैज्ञानिकों ने मानव मस्तिष्क की बनावट का अनुमान लगाने के लिए लंबे समय से शब्दों के खेल का उपयोग किया है। यदि आप किसी व्यक्ति से पूछें, "जब आप 'कुत्ता' सुनते हैं तो आपके मन में क्या आता है?", तो वे "बिल्ली," "पट्टा," या "भोंकना" कह सकते हैं। इन हजारों जवाबों को इकट्ठा करके, वैज्ञानिक इस बात का नक्शा बना सकते हैं कि मानव मन विचारों को कैसे जोड़ता है।
यह पेपर पूछता है: क्या यही ट्रिक AI के लिए भी काम करती है? क्या हम AI के व्यवहार को देखकर ही उसके छिपे हुए आंतरिक "ज्यामिति" (कि वह वास्तव में अवधारणाओं को कैसे संग्रहीत करता है) का नक्शा बना सकते हैं?
प्रयोग: खेल खेलने के दो तरीके
शोधकर्ताओं ने इसे 8 अलग-अलग AI मॉडलों पर 5,000 शब्दों की एक साझा सूची का उपयोग करके परखा। उन्होंने यह देखने के लिए दो अलग-अलग "खेलों" का उपयोग किया कि कौन सा खेल AI के दिमाग के अंदर की बेहतर झलक देता है।
गेम 1: "बहुविकल्पीय" क्विज़ (फोर्स्ड चॉइस - मजबूर विकल्प)
- सेटअप: AI को एक शब्द (जैसे, "कुत्ता") और 16 अन्य शब्दों की एक सूची दी जाती है। उसे सबसे सटीक लगने वाले दो शब्द चुनने होते हैं।
- उपमा: कल्पना कीजिए कि आप एक पार्टी में हैं, और कोई कुत्ते की तस्वीर की ओर इशारा करते हुए पूछता है, "इनमें से कौन से दो लोग कुत्ते की तरह हैं?" आपको एक विशिष्ट लाइनअप में से चुनना होगा।
- परिणाम: यह खेल अद्भुत रूप से अच्छा रहा। AI जिस तरह से अपने जवाब चुनता था, वह उसके आंतरिक मस्तिष्क संरचना से लगभग पूरी तरह मेल खाता था। यह ऐसा था जैसे AI एक ऐसी परीक्षा दे रहा हो जो उसके आंतरिक तर्क को पूरी तरह से प्रकट करती है।
गेम 2: "मुक्त-प्रवाह" चैट (फ्री एसोसिएशन - मुक्त जुड़ाव)
- सेटअप: AI को एक शब्द (जैसे, "कुत्ता") दिया जाता है और उसे बस ऐसे पाँच शब्द बोलने के लिए कहा जाता है जो उसके मन में आते हैं। कोई सूची नहीं, कोई नियम नहीं।
- उपमा: अब उसी पार्टी की कल्पना करें, लेकिन अब कोई बस चिल्लाता है, "कुत्तों के बारे में कुछ भी बताओ!" AI कह सकता है "भोंकना," "फर," "पिज्जा," "चाँद," "नीला।" यह अराजक और खुला हुआ है।
- परिणाम: यह खेल शोर भरा और भ्रमित करने वाला था। जवाब हर जगह बिखरे हुए थे। हालांकि इसने AI के मस्तिष्क के साथ कुछ संबंध दिखाया, लेकिन सिग्नल कमजोर था और इसे पढ़ना कठिन था। यह एक भीड़भाड़ वाले, चिल्लाते हुए कमरे में एक विशिष्ट बातचीत को सुनने की कोशिश करने जैसा था।
"ब्रेन स्कैन" तुलना
अपनी बात को साबित करने के लिए, शोधकर्ताओं ने केवल अनुमान नहीं लगाया। उन्होंने वास्तव में इन शब्दों को प्रोसेस करते समय AI के "मस्तिष्क" (इसके कोड की छिपी हुई परतों) के अंदर झाँका।
- आंतरिक मानचित्र (Internal Map): उन्होंने AI के आंतरिक गणित (इसके "हिडन स्टेट्स") का एक स्नैपशॉट लिया ताकि यह देख सकें कि वह वास्तव में "कुत्ता" शब्द को आंतरिक रूप से कैसे व्यवस्थित करता है।
- व्यवहार संबंधी मानचित्र (Behavioral Map): उन्होंने ऊपर दिए गए खेलों में AI द्वारा दिए गए जवाबों के आधार पर एक नक्शा बनाया।
- मिलान (The Match): उन्होंने दोनों नक्शों की तुलना की।
खोज:
- जब AI ने बहुविकल्पीय खेल खेला, तो "व्यवहार संबंधी मानचित्र" आंतरिक मानचित्र के लगभग समान था। बाहरी व्यवहार आंतरिक वास्तविकता का एक आदर्श प्रतिबिंब था।
- जब AI ने मुक्त चैट खेल खेला, तो नक्शे धुंधले थे और वे अच्छी तरह से मेल नहीं खाते थे।
यह क्यों मायने रखता है?
AI के आंतरिक मस्तिष्क को एक पुस्तकालय (Library) के रूप में सोचें।
- मुक्त जुड़ाव (Free Association) एक लाइब्रेरियन से "कुत्तों के बारे में कुछ किताबें चिल्लाने" के समान है। वे "पिल्ला," "आग," "पिज्जा," और "नीला" चिल्ला सकते हैं। यह समझना कठिन है कि उस अराजकता के आधार पर पुस्तकालय वास्तव में कैसे व्यवस्थित है।
- मजबूर विकल्प (Forced Choice) एक लाइब्रेरियन से यह पूछने जैसा है, "यहाँ 16 किताबें हैं। 'कुत्ता' के सबसे समान कौन सी दो हैं?" क्योंकि लाइब्रेरियन को विशिष्ट विकल्पों की तुलना करनी पड़ती है, उनके चुनाव पुस्तकालय की अलमारियों की वास्तविक, व्यवस्थित संरचना को प्रकट करते हैं।
मुख्य निष्कर्ष (The Takeaway)
- व्यवहार एक खिड़की है: आप बिना इसके कोड को हैक किए, केवल यह देखकर कि AI कैसे व्यवहार करता है, उसके आंतरिक "विचारों" के बारे में बहुत कुछ जान सकते हैं।
- संरचना मायने रखती है: आप सवाल कैसे पूछते हैं, यह आपकी सोच से कहीं अधिक महत्वपूर्ण है। प्रतिबंधित प्रश्न (जैसे बहुविकल्पीय) खुले प्रश्नों (जैसे मुक्त चैट) की तुलना में सच्चाई को प्रकट करने में बहुत बेहतर होते हैं।
- "सार्वभौमिक" मस्तिष्क: शोधकर्ताओं ने यह भी पाया कि विभिन्न AI मॉडल एक समान "मानसिक मानचित्र" साझा करते हैं। यदि आप एक AI से बहुविकल्पीय प्रश्न पूछते हैं, तो आप अक्सर यह अनुमान लगा सकते हैं कि एक दूसरे AI का उत्तर क्या होगा, क्योंकि वे सभी अपने ज्ञान को एक समान तरीके से व्यवस्थित करते हैं।
संक्षेप में
यदि आप समझना चाहते हैं कि एक AI कैसे सोचता है, तो उसे केवल "चैट" करने के लिए न कहें। उसे सीमित विकल्पों के साथ एक संरचित परीक्षण दें। यही उसके मन के गुप्त मानचित्र को खोलने की कुंजी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।