← नवीनतम पेपर
🤖 AI

Learning Physical Principles from Interaction: Self-Evolving Planning via Test-Time Memory

यह शोध पत्र PhysMem को पेश करता है, जो एक टेस्ट-टाइम मेमोरी फ्रेमवर्क है जो विजन-लैंग्वेज मॉडल प्लानर्स को मॉडल पैरामीटर्स को अपडेट किए बिना इंटरेक्शन के माध्यम से भौतिक सिद्धांतों को सीखने और सत्यापित करने में सक्षम बनाता है, जिससे नए परिदृश्यों में लागू करने से पहले परिकल्पनाओं को मान्य करके मैनिपुलेशन सफलता दरों में महत्वपूर्ण सुधार होता है।

मूल लेखक: Haoyang Li, Yang You, Hao Su, Leonidas Guibas

प्रकाशित 2026-03-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoyang Li, Yang You, Hao Su, Leonidas Guibas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को भौतिक शतरंज (physical chess) का एक जटिल खेल खेलना सिखा रहे हैं, लेकिन हर बार जब आप मेज पर बैठते हैं, तो खेल के नियम (घर्षण, वजन, संतुलन) बदल जाते हैं।

यह पेपर PhysMem पेश करता है, जो रोबोट के लिए इन बदलते नियमों को खेलते समय ही सीखने का एक नया तरीका है, बिना किसी मानव इंजीनियर द्वारा पुन: प्रोग्राम किए गए।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "पाठ्यपुस्तक" वाले दिमाग वाला रोबोट

वर्तमान रोबोट दिमाग (जिन्हें विजन-लैंग्वेज मॉडल कहा जाता है) उन प्रतिभावान छात्रों की तरह हैं जिन्होंने लाइब्रेरी में भौतिकी की हर किताब पढ़ ली है। वे घर्षण और गुरुत्वाकर्षण के सिद्धांत जानते हैं।

  • समस्या: यदि आप उनसे पूछें, "यह विशिष्ट उछलने वाली गेंद इस विशिष्ट धूल भरी मेज पर कैसे लुढ़केगी?" तो वे अक्सर गलत अनुमान लगाते हैं। वे सामान्य नियम तो जानते हैं, लेकिन उनमें इस बात की "सड़क की समझ" (street smarts) की कमी है कि इस विशेष क्षण में इस विशिष्ट वस्तु का व्यवहार कैसा होगा।
  • परिणाम: वे एक योजना बनाने की कोशिश करते हैं, असफल होते हैं, और फिर वही गलत योजना दोबारा दोहराते हैं क्योंकि उन्हें पता ही नहीं चलता कि वे असफल हो गए। वे "पाठ्यपुस्तक के सिद्धांत" बनाम "अव्यवस्थित वास्तविकता" के चक्रव्यूह में फंस जाते हैं।

2. समाधान: "वैज्ञानिक प्रयोगशाला" वाला रोबोट

लेखकों ने PhysMem नामक एक प्रणाली बनाई है। इस रोबोट को केवल एक कार्यकर्ता के रूप में नहीं, बल्कि एक वैज्ञानिक के रूप में सोचें जो अपने ही सिर के भीतर एक छोटी सी प्रयोगशाला चला रहा है।

केवल हर उस चाल को याद करने के बजाय जो उसने कभी की थी (जो कि आपके जीवन में उठाए गए हर कदम को याद रखने जैसा है), PhysMem एक तीन-चरणीय वैज्ञानिक प्रक्रिया का उपयोग करता है:

चरण A: "आश्चर्य" डिटेक्टर (अनुभव संग्रह - Experience Collection)

रोबोट एक कार्य करने की कोशिश करता है।

  • यदि यह ठीक वैसा ही सफल होता जैसा अनुमान लगाया गया था, तो वह कहता है, "ठीक है, मेरा सिद्धांत सही है।"
  • यदि यह विफल हो जाता है या कुछ अजीब होता है (एक "आश्चर्य"), तो वह इसे चिह्नित करता है: "रुको, मुझे लगा था कि गेंद यहाँ रुक जाएगी, लेकिन यह बाधा के आगे निकल गई! मेरा सिद्धांत गलत है।"

चरण B: "परिकल्पना" चरण (वर्किंग मेमोरी - Working Memory)

विफलता को केवल संग्रहीत करने के बजाय, रोबोट समान आश्चर्यों को एक साथ समूहबद्ध करता है और अपने आंतरिक "मस्तिष्क" (एक लार्ज लैंग्वेज मॉडल) से पूछता है: "कौन सा नियम इसे स्पष्ट करता है?"

  • यह एक परिकल्पना (hypothesis) तैयार करता है (एक अनुमान)।
  • उदाहरण परिकल्पना: "शायद मुझे बैंगनी ब्लॉक के पास गेंद को तेज़ी से नहीं धकेलना चाहिए।"
  • इस परिकल्पना को एक "परीक्षण क्षेत्र" (वर्किंग मेमोरी) में रखा जाता है। यह अभी तक कोई तथ्य नहीं है; यह केवल परीक्षण किया जा रहा एक सिद्धांत है।

चरण C: "सत्यापन" चरण (सबसे महत्वपूर्ण कदम)

इस नियम को सत्य के रूप में स्वीकार करने से पहले, रोबोट इसका परीक्षण करता है।

  • यह अगले कुछ प्रयासों में नई रणनीति को आजमाता है।
  • यदि यह काम करता है: तो परिकल्पना को सत्यापित सिद्धांत (Verified Principle) (लॉन्ग-टर्म मेमोरी) के रूप में पदोन्नत कर दिया जाता है। यह एक स्थायी नियम बन जाता है जिसका रोबोट पालन करता है।
  • यदि यह विफल हो जाता है: तो परिकल्पना को खारिज कर दिया जाता है। रोबोट सीखता है, "ठीक है, वह सिद्धांत गलत था," और एक नया सिद्धांत आजमाता है।

3. जादू का तरीका: "मेमोरी फोल्डिंग" (यादों को मोड़ना)

कल्पना कीजिए कि आप साइकिल चलाना सीख रहे हैं। आप 50 बार गिरते हैं। क्या आपको अपनी हर 50 गिरावटों के लिए अपने पैर के कोण और हवा की गति को याद रखने की आवश्यकता है? नहीं।

  • PhysMem "मेमोरी फोल्डिंग" करता है: यह उन 50 अव्यवस्थित अनुभवों को लेता है और उन्हें एक सरल नियम में संकुचित कर देता है: "दाएं मुड़ते समय बाएं झुकें।"
  • यह रोबोट के दिमाग को बेकार के विवरणों से भरने से रोकता है, जिससे वह 'अव्यवस्था' को याद रखने के बजाय 'सबक' को याद रख पाता है।

4. वास्तविक दुनिया के परिणाम: रोबोट स्मार्ट हो जाता है

टीम ने तीन वास्तविक कार्यों पर इसका परीक्षण किया:

  1. पैकिंग पहेली (Packing Puzzle): बक्से में अजीब आकार के ब्लॉकों को फिट करना।
  2. बॉल नेविगेशन (Ball Navigation): बाधाओं से भरे रास्ते में एक फुटबॉल को धकेलना।
  3. पत्थर जमाना (Stone Stacking): अनियमित, फिसलन भरे पत्थरों के साथ एक मीनार बनाना।

परिणाम:

  • PhysMem के बिना: रोबोट बार-बार वही गलतियाँ करता रहा, जैसे कोई छात्र एक ही गणित के सवाल को बार-बार हल करने में विफल रहता है।
  • PhysMem के साथ: रोबंड ने कुछ विफलताओं के साथ शुरुआत की, लेकिन लगभग 10 प्रयासों के भीतर, उसने विशिष्ट वस्तुओं के भौतिक विज्ञान को "सीख" लिया था। उसने गलतियाँ कम करना शुरू कर दिया और पहेलियों को बहुत तेज़ी से हल करने लगा।
  • "अहा!" क्षण: एक प्रयोग में, रोबोट ने सीखा कि एक विशिष्ट बाधा के पास गेंद को बहुत तेज़ी से धकेलने से वह फंस जाएगी। इसने इसे एक स्थायी नियम में बदल दिया: "बैंगनी ब्लॉक के पास हमेशा धीरे से धकेलें।"

बड़ी तस्वीर

यह पेपर रोबोटों को वास्तविक समय में अपनी गलतियों से सीखने की क्षमता देने के बारे में है।

एक कठोर मशीन होने के बजाय जो पहले से लिखे गए स्क्रिप्ट का पालन करती है, PhysMem रोबोट को एक जिज्ञासु शिक्षार्थी में बदल देता है। यह हर विफलता को एक वैज्ञानिक प्रयोग के रूप में देखता है, एक नए सिद्धांत का परीक्षण करता है, और यदि वह सिद्धांत काम करता है, तो वह उसे अपनी स्थायी नियम पुस्तिका में जोड़ देता है।

संक्षेप में: यह उस रोबोट के बीच का अंतर है जो कहता है, "मैंने किताब में पढ़ा है कि गेंदें लुढ़कती हैं," और उस रोबोट के बीच जो कहता है, "मैंने इसे आज़माया, मैं गिरा, मैंने ट्रिक समझ ली, और अब मुझे पता है कि इस गेंद को ठीक से कैसे लुढ़काना है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →