← नवीनतम पेपर
🤖 AI

MindZero: Learning Online Mental Reasoning With Zero Annotations

यह शोध पत्र माइंडज़ीरो (MindZero) को प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित सुदृढीकरण शिक्षण (self-supervised reinforcement learning) ढांचा है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को बिना किसी ग्राउंड-ट्रुथ मेंटल स्टेट एनोटेशन की आवश्यकता के, कुशल और सुदृढ़ ऑनलाइन मेंटल रीजनिंग करने के लिए प्रशिक्षित करता है, जो सटीकता और गति में स्टैंडअलोन एलएलएम (LLMs) और पारंपरिक मॉडल-आधारित विधियों दोनों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Shunchi Zhang, Jin Lu, Chuanyang Jin, Yichao Zhou, Zhining Zhang, Tianmin Shu

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shunchi Zhang, Jin Lu, Chuanyang Jin, Yichao Zhou, Zhining Zhang, Tianmin Shu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ MindZero पेपर का स्पष्टीकरण दिया गया है, जिसे रोज़मर्रा के उदाहरणों के साथ सरल अवधारणाओं में विभाजित किया गया है।

मुख्य विचार: AI को बिना किसी पाठ्यपुस्तक के "मन पढ़ने" की शिक्षा देना

कल्पना कीजिए कि आप अपने दोस्त को खाना बनाने में मदद कर रहे हैं। आपको उनसे यह सुनने की ज़रूरत नहीं है कि, "मैं नमक ढूँढ रहा हूँ।" आप उन्हें फ्रिज खोलते हुए, मसालों को देखते हुए और एक विशिष्ट जार उठाते हुए देखते हैं। आप तुरंत समझ जाते हैं, "आह, वे पास्ता बना रहे हैं और उन्हें नमक चाहिए," इसलिए वे कुछ भी माँगने से पहले ही आप उन्हें नमक थमा देते हैं।

किसी के कार्यों के आधार पर यह अनुमान लगाने की क्षमता कि वे क्या सोच रहे हैं, थ्योरी ऑफ माइंड (ToM) कहलाती है। लंबे समय से, AI इसमें बहुत खराब रहा है। यह एक ऐसे रोबोट की तरह है जिसे मानवीय व्यवहार को समझने के लिए एक ऐसी भाषा में लिखी गई मैनुअल की आवश्यकता होती है जिसे वह बोल ही नहीं सकता।

MindZero एक नई विधि है जो AI को बिना किसी मानव द्वारा लिखे गए हज़ारों मैनुअल्स (एनोटेशन) के, अपने आप यह "मन पढ़ने" का कौशल विकसित करने की शिक्षा देती है।


तीन बड़ी समस्याएँ जिनका सामना AI को पहले करना पड़ता था

पेपर उन तीन बाधाओं की पहचान करता है जिन्होंने AI को एक अच्छा सहायक बनने से रोका था:

  1. "अनुमान लगाने का खेल" वाली समस्या: वास्तविक जीवन में, लोग अपने विचार बदलते रहते हैं। यदि आप किसी को कांटा (fork) उठाते हुए देखते हैं, तो हो सकता है कि वे मेज सजा रहे हों, या वे बस अपनी नाक खुजला रहे हों। AI को एक साथ कई अनुमान अपने दिमाग में रखने और नए कार्यों के साथ उन्हें अपडेट करने की आवश्यकता होती है।
  2. "स्लो मोशन" वाली समस्या: सबसे स्मार्ट AI विधियाँ जो यह कर सकती थीं, वे एक शतरंज के ग्रैंडमास्टर की तरह थीं जो हर संभावित चाल की गणना करने के लिए 10 मिनट लगा देता है। वे वास्तविक समय में मदद करने के लिए (जैसे गिरती हुई प्लेट को पकड़ने के लिए) बहुत धीमी थीं।
  3. "कोई पाठ्यपुस्तक नहीं" वाली समस्या: इस कार्य को करने के लिए AI को प्रशिक्षित करने हेतु शोधकर्ताओं को आमतौर पर विशाल डेटासेट की आवश्यकता होती थी जहाँ मनुष्यों ने हर एक क्रिया को व्यक्ति के वास्तविक विचार के साथ लेबल किया हो (जैसे, "क्रिया: कांटा उठाना। विचार: मेज सजाना")। वास्तविक दुनिया में, हम यह नहीं जान सकते कि लोग वास्तव में क्या सोच रहे हैं, इसलिए ये पाठ्यपुस्तकें मौजूद नहीं होतीं।

समाधान: MindZero (एक "स्व-शिक्षित जासूस")

MindZero सेल्फ-सुपरवाइज्ड रीइन्फोर्समेंट लर्निंग नामक एक चतुर तकनीक का उपयोग करके इन समस्याओं को हल करता है।

उदाहरण: जासूस और अपराध स्थल

कल्पना कीजिए कि एक जासूस अपराध सुलझाने की कोशिश कर रहा है।

  • पुराना तरीका: जासूस को अपराधी कौन है और वह क्या सोच रहा था, यह बताने के लिए एक गवाह की आवश्यकता होती है। यदि कोई गवाह नहीं है, तो जासूस हार मान लेता है।
  • MindZero का तरीका: जासूस सुरागों (कार्यों) को देखता है और संदिग्धों की एक सूची (परिकल्पनाएं) बनाता है।
    • परिकल्पना A: "बटलर ने अंगूठी चुराने के लिए यह किया।"
    • परिकल्पना B: "माली ने लाश को छिपाने के लिए यह किया।"

इसके बाद जासूस एक "प्लानर" (एक स्मार्ट कंप्यूटर प्रोग्राम) से पूछता है: "यदि परिकल्पना A सच होती, तो क्या बटलर अंगूठी उठाता?"

यदि उत्तर हाँ है, तो जासूस को एक "रिवॉर्ड" (एक अंक) मिलता है। यदि उत्तर नहीं है, तो उसे कोई अंक नहीं मिलता।

समय के साथ, जासूस ऐसे अनुमान लगाने में महारत हासिल कर लेता है जो सुरागों की पूरी तरह से व्याख्या करते हैं, भले ही किसी ने उसे कभी "असली" उत्तर न बताया हो। वह उत्तरों की सूची रटने के बजाय व्यवहार की व्याख्या करने के माध्यम से सीखता है।

यह व्यवहार में कैसे काम करता है

  1. लेबल की आवश्यकता नहीं: AI एक इंसान (या एक सिम्युलेटेड इंसान) को कार्य करते हुए देखता है। उसे इंसान का लक्ष्य पता नहीं होता।
  2. एक अनुमान लगाना: AI कुछ संभावित लक्ष्यों को उत्पन्न करता है (जैसे, "वे खाना चाहते हैं," "वे सफाई करना चाहते हैं")।
  3. "प्लानर" की जाँच: AI एक अलग, स्मार्ट सिस्टम से पूछता है: "यदि इंसान का लक्ष्य 'खाना' होता, तो क्या वे यह क्रिया करते?"
  4. रिवॉर्ड: यदि क्रिया उस लक्ष्य के लिए तर्कसंगत है, तो AI को रिवॉर्ड मिलता है। यदि क्रिया तर्कहीन है, तो उसे पेनल्टी मिलती है।
  5. सीखना: AI अपने मस्तिष्क को अगली बार बेहतर अनुमान लगाने के लिए समायोजित करता है। वह यह सीख जाता है कि, "ओह, प्लेट उठाना आमतौर पर 'मेज सजाने' का संकेत है, न कि 'फर्श साफ करने' का।"

परिणाम: तेज़, सटीक और सस्ता

पेपर ने दो दुनियाओं में MindZero का परीक्षण किया:

  • GridWorld: एक साधारण 2D गेम जहाँ रोबोट ब्लॉक हिलाते हैं।
  • Household: रसोई और लिविंग रूम का एक वास्तविक सिमुलेशन।

निष्कर्ष:

  • गति: MindZero अविश्वसनीय रूप से तेज़ है। यह एक एकल "पास" (जैसे किसी स्थिति पर एक नज़र डालना) में निर्णय ले सकता है, जबकि पुरानी "स्मार्ट" विधियों को गणना करने में मिनटों लग जाते थे।
  • सटीकता: यह लक्ष्यों का अनुमान लगाने में मानक AI मॉडल की तुलना में बहुत बेहतर था। कुछ परीक्षणों में, यह बेस मॉडल की तुलना में 2.5 गुना अधिक सटीक था।
  • दक्षता: इसने बिना महंगे, विशाल सुपरकंप्यूटर की आवश्यकता के यह उच्च सटीकता प्राप्त की। यह छोटे, सस्ते मॉडलों पर भी अच्छी तरह से काम करता है।
  • वास्तविक मनुष्य: जब वास्तविक लोगों के साथ एक सिमुलेशन में परीक्षण किया गया, तो MindZero ने उन्हें अकेले रहने की तुलना में कार्यों को पूरा करने में लगभग 20% तेज़ी से मदद की।

"सीक्रेट सॉस" (यह इतना अच्छा क्यों काम करता है)

पेपर तीन मुख्य सामग्रियों पर प्रकाश डालता है जो MindZero को विशेष बनाती हैं:

  1. कई परिकल्पनाओं को बनाए रखना: केवल एक अनुमान लगाने के बजाय, MindZero संभावनाओं की एक "बीम" (जैसे, "शायद वे सूप चाहते हैं, शायद वे सलाद चाहते हैं") रखता है और जैसे-जैसे नए कार्य होते हैं, प्रत्येक की संभावना को अपडेट करता है। यह इसे बहुत जल्दी गलत विचार पर अटकने से रोकता है।
  2. कॉमन सेंस चेक: यह सुनिश्चित करने के लिए कि इसके अनुमान तर्कसंगत हों, यह एक "प्रायर" (prior) चेक का उपयोग करता है। उदाहरण के लिए, यह जानता है कि डिशवॉशर में जूता रखना एक बेतुका लक्ष्य है, इसलिए यह तुरंत उस अनुमान की संभावना को कम कर देता है।
  3. एक्सप्लोरेशन बोनस: इसे अपने अनुमानों को विविध रखने के लिए पुरस्कृत किया जाता है। यह AI को यह सोचने से रोकता है कि केवल एक ही संभव उत्तर है जब वास्तव में कई हो सकते हैं।

सारांश

MindZero एक बड़ी उपलब्धि है क्योंकि यह AI को यह सिखाता है कि लोग क्या कहते हैं उसे पढ़ने के बजाय, वे क्या करते हैं उसे देखकर उनके इरादों को कैसे समझा जाए। यह AI को एक सक्रिय सहायक में बदल देता है जो जरूरतों का पूर्वानुमान लगा सकता है, जिससे यह हमारे घरों और दैनिक जीवन में हमारे साथ काम करने वाले AI सहायकों की दिशा में एक व्यावहारिक कदम बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →