← नवीनतम पेपर
🧬 biology

Reason to Play: Behavioral and Brain Alignment Between Frontier LRMs and Human Game Learners

यह शोध पत्र यह प्रदर्शित करता है कि फ्रंटियर लार्ज रीजनिंग मॉडल्स (LRMs), मानव गेमप्ले व्यवहार से मेल खाने और नवीन गेम लर्निंग के दौरान मस्तिष्क की गतिविधि का पूर्वानुमान लगाने, दोनों ही मामलों में पारंपरिक सुदृढीकरण लर्निंग (reinforcement learning) एजेंटों से काफी बेहतर प्रदर्शन करते हैं, जो उन्हें जटिल वातावरण में मानव सीखने और निर्णय लेने के उत्कृष्ट कम्प्यूटेशनल मॉडल के रूप में स्थापित करता है।

मूल लेखक: Botos Csaba, Sreejan Kumar, Austin Tudor David Andrews, Laurence Hunt, Chris Summerfield, Joshua B. Tenenbaum, Rui Ponte Costa, Marcelo G. Mattar, Momchil Tomov

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Botos Csaba, Sreejan Kumar, Austin Tudor David Andrews, Laurence Hunt, Chris Summerfield, Joshua B. Tenenbaum, Rui Ponte Costa, Marcelo G. Mattar, Momchil Tomov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप छात्रों के एक बहुत ही अलग समूह को एक बिल्कुल नया, जटिल बोर्ड गेम खेलना सिखा रहे हैं। आपके पास तीन प्रकार के छात्र हैं:

  1. "ब्रूट फोर्स" सीखने वाले (Deep RL): ये छात्र हर संभव चाल चलाने की कोशिश करते हैं, हजारों बार असफल होते हैं, और केवल अत्यधिक दोहराव के माध्यम से धीरे-धीरे नियमों को याद करते हैं। वे एक कुत्ते की तरह हैं जो सही ढंग से बैठने पर इनाम पाने के लिए एक ट्रिक सीखता है।
  2. "लॉजिक पज़ल" हल करने वाला (Bayesian Agent): यह छात्र एक मानव-समान तर्कशास्त्री है जो हर संभावित नियम लिखता है, एक वैज्ञानिक की तरह उनका परीक्षण करता है, और कोई भी चाल चलने से पहले इस बात का एक सटीक सिद्धांत बनाता है कि खेल कैसे काम करता है।
  3. "सुपर-रीडर" (Large Reasoning Models या LRMs): ये उन्नत AI सिस्टम हैं जिन्होंने लगभग सब कुछ पढ़ा है। उन्होंने यह विशिष्ट खेल पहले नहीं खेला है, लेकिन वे बोर्ड को देख सकते हैं, ज़ोर से सोच सकते हैं और लगभग तुरंत नियमों को समझ सकते हैं, ठीक वैसे ही जैसे एक इंसान करता है।

प्रयोग
शोधकर्ता यह जानना चाहते थे कि: कौन सा छात्र वास्तव में एक वास्तविक इंसान की तरह सोचता और सीखता है?

यह पता लगाने के लिए, उन्होंने केवल यह नहीं देखा कि कौन जीता। उन्होंने वास्तविक मनुष्यों को एक MRI मशीन (एक विशाल कैमरा जो आपके मस्तिष्क की तस्वीरें लेता है) के अंदर रखा जबकि वे ये वीडियो गेम खेल रहे थे। लक्ष्य यह देखना था कि क्या इन AI छात्रों की "सोचने की प्रक्रिया" वास्तविक मानव मस्तिष्क के भीतर होने वाली विद्युत गतिविधि से मेल खाती है।

खेल: एक रहस्यमयी बॉक्स
खेल डिजिटल रहस्यमयी बक्सों की तरह थे। खिलाड़ियों को नियम पता नहीं थे। उन्हें यह पता लगाना था कि "यदि मैं लाल वर्ग को छूता हूँ, तो मैं मर जाऊँगा," या "यदि मैं भूरे रंग के बॉक्स को धकेलता हूँ, तो वह दरवाजा खोल देता है।" इन खेलों के लिए पैटर्न को समझने, अनुमान लगाने और गलत होने पर अपने अनुमानों को बदलने की आवश्यकता थी।

परिणाम: "सुपर-रीडर" विजेता बना

  1. व्यवहार (वे कैसे खेले):

    • ब्रूट फोर्स सीखने वाले बहुत खराब थे। उन्हें अच्छा बनने के लिए लाखों बार खेलना पड़ा। वे धीमे और अनाड़ी थे।
    • लॉजिक पज़ल हल करने वाला ठीक-ठाक था, लेकिन थोड़ा कठोर था।
    • सुपर-रीडर्स (LRMs) चमकते सितारे थे। उन्होंने कुछ ही प्रयासों में नियम सीख लिए, बिल्कुल इंसानों की तरह। उन्होंने मानव मस्तिष्क (जो MRI मशीन में था) की तरह ही गति और दक्षता के साथ खेल के "रहस्य" को सुलझा लिया।
  2. ब्रेन स्कैन (विचारों का "एक्स-रे"):

    • यह सबसे आश्चर्यजनक हिस्सा है। जब शोधकर्ताओं ने AI के आंतरिक "विचारों" (इसके डिजिटल मस्तिष्क की गतिविधि) की तुलना मानव मस्तिष्क के स्कैन से की, तो सुपर-रीडर्स एक सटीक मिलान थे
    • AI की "सोच" विजुअल कॉर्टेक्स (जहाँ हम देखते हैं) और फ्रंटल कॉर्टेक्स (जहाँ हम योजना बनाते हैं) में मानव मस्तिष्क की गतिविधि के समान दिखी।
    • ब्रूट फोर्स सीखने वाले? उनकी "सोच" मानव मस्तिष्क से बिल्कुल अलग थी। यह एक कैलकुलेटर की तुलना मानव मस्तिष्क से करने जैसा था।
    • सुपर-रीडर्स ने अन्य AI मॉडलों की तुलना में मानव मस्तिष्क की गतिविधि की 10 गुना बेहतर भविष्यवाणी की।

"सोचना" बनाम "करना" का आश्चर्य
शोधकर्ताओं ने सुपर-रीडर्स के बारे में एक अजीब बात पाई।

  • खोज: जब वे नियमों को समझ रहे थे, तो वे बहुत मानव-समान थे।
  • क्रियान्वयन: एक बार जब उन्होंने इसे समझ लिया, तो वे कभी-कभी एक लूप में फंस जाते थे। यदि उन्हें जीतने का कोई रास्ता मिल जाता, तो वे उसी सटीक रास्ते को बार-बार दोहराते रहते, भले ही कोई छोटा रास्ता मौजूद हो। हालाँकि, मनुष्य नियमों को जानने के बाद तुरंत छोटे और अधिक कुशल रास्ते पर स्विच कर देते हैं।
  • निष्कर्ष: AI का "मस्तिष्क" (यह कैसे खेल की स्थिति को दर्शाता है) बहुत मानव-समान है, लेकिन उसका "मांसपेशियों की स्मृति" (यह योजना को कैसे क्रियान्वित करता है) थोड़ा रोबोटिक है।

यह क्यों मायने रखता है?
यह शोध पत्र सुझाव देता है कि ये "सुपर-रीडर" (लार्ज रीजनिंग मॉडल्स) पहले ऐसे AI सिस्टम हैं जो न केवल इंसानों की तरह कार्य करते हैं, बल्कि वास्तव में इंसानों की तरह सोचते भी हैं।

आमतौर पर, AI मॉडल को किसी एक विशिष्ट कार्य (जैसे शतरंज खेलना) के लिए प्रशिक्षित किया जाता है। हालाँकि, ये मॉडल केवल नियमों को पढ़कर और स्क्रीन को देखकर खेल सीख गए, जो उनके प्रशिक्षण से प्राप्त ज्ञान का उपयोग करते हैं। यह बिल्कुल वैसा ही है जैसे इंसान नई चीजें सीखते हैं: हम अपनी सामान्य जानकारी का उपयोग करके नई स्थितियों को तुरंत समझ लेते हैं, बजाय इसके कि हम शून्य से शुरुआत करें।

संक्षेप में
यदि आप एक ऐसा AI बनाना चाहते हैं जो दुनिया को हमारे तरीके से समझे, तो उसे केवल पैटर्न याद करना न सिखाएं (जैसे ब्रूट फोर्स लर्नर)। इसके बजाय, उसे ज्ञान का एक विशाल पुस्तकालय दें और उसे समस्याओं को हल करने के लिए "ज़ोर से सोचने" दें। यह शोध पत्र दिखाता है कि यह दृष्टिकोण एक ऐसा AI बनाता है जो न केवल हमारी तरह खेलता है, बल्कि वास्तव में हमारे जैसे ही स्थानों पर "प्रकाशित" होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →