← नवीनतम पेपर
💻 computer science

Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation

यह शोध पत्र सिमुलेशन डिस्टिलेशन (SimDist) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो सिम्युलेटर से स्ट्रक्चरल प्रायर्स (structural priors) को लेटेंट वर्ल्ड मॉडल्स में डिस्टिल करता है ताकि रिवॉर्ड और वैल्यू मॉडल्स को सीधे सिमुलेशन से ट्रांसफर करके रोबोटिक्स में तीव्र, स्थिर और डेटा-कुशल वास्तविक दुनिया के अनुकूलन को सक्षम बनाया जा सके, जिससे कम-डेटा वाले परिदृश्यों में लॉन्ग-होरिजनन क्रेडिट असाइनमेंट और एक्सप्लोरेशन की चुनौतियों से बचा जा सके।

मूल लेखक: Jacob Levy, Tyler Westenbroek, Kevin Huang, Fernando Palafox, Patrick Yin, Shayegan Omidshafiei, Dong-Ki Kim, Abhishek Gupta, David Fridovich-Keil

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jacob Levy, Tyler Westenbroek, Kevin Huang, Fernando Palafox, Patrick Yin, Shayegan Omidshafiei, Dong-Ki Kim, Abhishek Gupta, David Fridovich-Keil

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कमरे में चलना या किसी नाजुक वस्तु को उठाना सिखाने की कोशिश कर रहे हैं। आपके पास दो विकल्प हैं:

  1. "वास्तविक दुनिया" विधि (The "Real World" Method): रोबोट को कोशिश करने दें, असफल होने दें, गिरने दें, चीजें तोड़ने दें और धीरे-धीरे सीखने दें। यह खतरनाक, महंगा और बहुत समय लेने वाला है।
  2. "सिमुलेशन" विधि (The "Simulation" Method): रोबोट को एक वीडियो गेम (एक सिम्युलेटर) में अभ्यास करने दें जहाँ वह बिना कुछ तोड़े एक मिनट में दस लाख बार प्रयास कर सकता है।

समस्या:
वीडियो गेम एकदम सटीक नहीं होता है। भौतिक विज्ञान (physics) वास्तविकता से थोड़ा अलग होता है। एक रोबोट जो गेम में पूरी तरह से चलना सीख जाता है, वह अक्सर वास्तविक फर्श पर कदम रखते ही लड़खड़ाकर गिर जाता है। इसे "सिम-टू-रियल गैप" (Sim-to-Real Gap) कहा जाता है।

वर्तमान के अधिकांश तरीके इस बात की कोशिश करते हैं कि रोबोट वास्तविक फर्श पर सब कुछ फिर से शून्य से सीख ले, जो कि धीमा और अस्थिर है।

समाधान: सिमडिस्ट (SimDist - Simulation Distillation)
यह एक मास्टर शेफ और सु-शेफ (Sous-Chef) के संबंध की तरह है।

उपमा: मास्टर शेफ और सु-शेफ

कल्पना कीजिए कि आप एक नए, अपरिचित किचन में एक आदर्श भोजन (रोबोट का कार्य) बनाना चाहते हैं।

1. मास्टर शेफ (द सिम्युलेटर):
वीडियो गेम में, आपके पास एक मास्टर शेफ है जो रेसिपी को पूरी तरह से जानता है। वह जानता है कि पास्ता को कितनी देर तक उबालना है, कितना नमक डालना है, और अंतिम व्यंजन का स्वाद कैसा होना चाहिए।

  • SimDist क्या करता है: यह केवल मास्टर शेफ को खाना बनाने की अनुमति नहीं देता। यह मास्टर शेफ को जानबूझकर कभी-कभी बुरा खाना बनाने के लिए मजबूर करता है (जैसे बहुत अधिक नमक डालना, टोस्ट जला देना) और फिर गलतियों को सुधारने के लिए कहता है। यह सिस्टम को सिखाता है कि "असफलता" कैसी दिखती है और उससे कैसे उबरना है।
  • परिणाम: मास्टर शेफ ज्ञान का एक विशाल पुस्तकालय बनाता है: "यहाँ सफलता कैसी दिखती है, यहाँ विफलता कैसी दिखती है, और यहाँ से इसे कैसे ठीक किया जाए।"

2. सु-शेफ (द वर्ल्ड मॉडल):
रोबोट को पूरी रेसिपी सिखाने के बजाय (जिसमें मास्टर शेफ के किचन का विशिष्ट स्वाद भी शामिल है), SimDist रोबोट को एक वर्ल्ड मॉडल (World Model) सिखाता है।

  • वर्ल्ड मॉडल को रोबोट का आंतरिक मानचित्र और दिशा-सूचक यंत्र (map and compass) समझें।
  • यह कार्य की संरचना सीखता है: "यदि मैं अपना हाथ इस तरह हिलाता हूँ, तो वस्तु उस तरह हिलती है।"
  • महत्वपूर्ण रूप से, यह सीखता है कि सफलता कैसी महसूस होती है (Reward) और जीत के कितने करीब है (Value)।

3. स्थानांतरण (द डिस्टिलेशन/Distillation):
जब रोबलेट वास्तविक किचन में जाता है, तो SimDist एक चतुर काम करता है:

  • यह "मानचित्र" (Map), "दिशा-सूचक यंत्र" (Compass), और "स्वाद परीक्षण" (Reward और Value मॉडल) को फ्रीज (स्थिर) कर देता है। ये सार्वभौमिक सत्य हैं जो वीडियो गेम और वास्तविकता के बीच नहीं बदलते।
  • यह केवल "मांसपेशियों की स्मृति" (Dynamics) को अपडेट करता है। यह वह हिस्सा है जो कहता है, "इस विशिष्ट वास्तविक किचन में, फर्श फिसलन भरा है, इसलिए मुझे छोटे कदम लेने चाहिए।"

यह व्यवहार में कैसे काम करता है

  1. प्री-ट्रेनिंग (सिमुलेशन): रोबोट वीडियो गेम में घंटों बिताता है। वह वस्तुओं को पहचानना सीखता है, उसे पता होता है कि "जीत" कैसी दिखती है, और वह भौतिकी के सामान्य नियम सीखता है। वह गलतियों से उबरने का भी अभ्यास करता है।
  2. डिप्लॉयमेंट (वास्तविक दुनिया): रोबोट को वास्तविक दुनिया में छोड़ दिया जाता है।
    • वह योजना बनाने के लिए अपने जमे हुए ज्ञान (frozen knowledge) का उपयोग करता है: "मुझे पता है कि मुझे उस पेग (peg) को पकड़ना है। मुझे पता है कि यदि मैं चूक गया, तो मेरे अंक कम हो जाएंगे।"
    • वह अपनी मांसपेशियों की स्मृति (muscle memory) को अपडेट करने के लिए बहुत कम वास्तविक डेटा (केवल 15-30 मिनट!) का उपयोग करता है। वह सीखता है, "ओह, वास्तविक फर्श फिसलन भरा है। मुझे अपने पैर रखने के तरीके को समायोजित करने की आवश्यकता है।"
  3. जादू: क्योंकि रोबोट पहले से ही जानता है कि क्या करना है और क्यों करना है (सिमुलेशन से), उसे सब कुछ फिर से सीखने की आवश्यकता नहीं है। उसे बस अपने आंदोलनों को नए वातावरण के अनुकूल ढालना है।

यह एक बड़ी बात क्यों है?

  • गति: अन्य तरीकों को वास्तविक दुनिया में काम करने के लिए घंटों या दिनों के परीक्षण-और-त्रुटि (trial-and-error) की आवश्यकता हो सकती है। SimDist इसे 15 से 30 मिनट में काम करने लायक बना देता है।
  • स्थिरता: अन्य तरीके अक्सर वास्तविक दुनिया में सीखना शुरू करने पर सिम्युलेटर में सीखी गई चीजों को "भूल" जाते हैं (जैसे एक छात्र इतिहास सीखते समय गणित भूल जाता है)। SimDist महत्वपूर्ण गणित (कार्य के नियम) को सुरक्षित रखता है और केवल इतिहास (विशिष्ट वातावरण) को बदलता है।
  • सुरक्षा: चूंकि रोबोट पहले से ही "खेल के नियम" (सिम्युलेटर से) जानता है, इसलिए उसे सीखने के लिए चीजों से टकराने की आवश्यकता नहीं है।

सारांश

SimDist एक रोबोट को एक परफेक्ट टेक्स्टबुक (सिम्युलेटर से) और एक दिशा-सूचक यंत्र (रिवॉर्ड मॉडल) देने जैसा है, और फिर उसे वास्तविक दुनिया के स्थानीय इलाके (डायनेमिक्स) को सीखने के लिए केवल कुछ मिनटों का समय देने जैसा है। यह रोबोट को "वीडियो गेम प्रो" से "वास्तविक दुनिया के विशेषज्ञ" में लगभग तुरंत बदलने की अनुमति देता है, बिना कुछ तोड़े या भारी मात्रा में डेटा की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →