← नवीनतम पेपर
💻 computer science

Towards Bridging the Gap between Large-Scale Pretraining and Efficient Finetuning for Humanoid Control

यह शोध पत्र एक हाइब्रिड फ्रेमवर्क का प्रस्ताव करता है जो मजबूत ज़ीरो-शॉट ह्यूमनॉइड लोकोमोशन के लिए बड़े पैमाने पर, उच्च-UTD सॉफ्ट एक्टर-क्रिटिक प्रीट्रेनिंग का लाभ उठाता है और इसे एक सुरक्षित, मॉडल-आधारित फाइनट्यूनिंग रणनीति के साथ जोड़ता है जो स्टोकेस्टिक एक्सप्लोरेशन को एक भौतिकी-सूचित वर्ल्ड मॉडल तक सीमित करती है, जिससे बड़े पैमाने के सिमुलेशन और कुशल वास्तविक-दुनिया के अनुकूलन के बीच के अंतर को प्रभावी ढंग से पाटा जा सके।

मूल लेखक: Weidong Huang, Zhehan Li, Hangxin Liu, Biao Hou, Yao Su, Jingwen Zhang

प्रकाशित 2026-02-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weidong Huang, Zhehan Li, Hangxin Liu, Biao Hou, Yao Su, Jingwen Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ पेपर "Towards Bridging the Gap Between Large-Scale Pretraining and Efficient Finetuning for Humanoid Control" (LIFT) का सरल, रोजमर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।

बड़ी तस्वीर: "सुपर-स्टूडेंट" रोबोट

कल्पना कीजिए कि आप एक रोबोट को इंसान की तरह चलना सिखाना चाहते हैं।

  • समस्या: यदि आप इसे केवल वास्तविक दुनिया में कोशिश करने और असफल होने देकर सिखाते हैं, तो यह बार-बार गिरेगा, इसके पैर टूट जाएंगे, और इसे सीखने में वर्षों लग जाएंगे।
  • पुराना तरीका: अधिकांश शोधकर्ता PPO नामक विधि का उपयोग करते हैं। इसे एक ऐसे छात्र के रूप में सोचें जो एक विशिष्ट पाठ्यपुस्तक (सिमुलेशन) को रटने में बहुत अच्छा है, लेकिन जैसे ही शिक्षक थोड़ा अलग सवाल पूछता है (एक नया वातावरण), वह भ्रमित हो जाता है। वे बुनियादी बातें सीखने में तेज़ हैं लेकिन ढलने (adapt करने) में खराब हैं।
  • नया तरीका (LIFT): लेखक LIFT (Large-scale pretraIning and efficient FineTuning) नामक एक नया ढांचा प्रस्तावित करते हैं। यह एक जीनियस ट्यूटर को काम पर रखने जैसा है जो पहले छात्र को एक विशाल, अराजक वर्चुअल जिम में प्रशिक्षित करता है, और फिर छात्र के वास्तविक मंच पर कदम रखने से पहले उसे नए मूव्स सुरक्षित रूप से अभ्यास करने के लिए एक "क्रिस्टल बॉल" (Crystal Ball) का उपयोग करता है।

तीन चरणों की यात्रा

यह पेपर रोबोट को मजबूत और अनुकूलन योग्य बनाने के लिए तीन-चरणीय प्रक्रिया का वर्णन करता है।

चरण 1: "वर्चुअल जिम" (लार्ज-स्केल प्रीट्रेनिंग)

उपमा: कल्पना कीजिए कि एक जिम्नास्ट एक वीडियो गेम में प्रशिक्षण ले रहा है जहाँ वह एक साथ 1,000 सिमुलेशन चला सकता है। वह मिलीसेकंड में गिर सकता है, उठ सकता है और फिर से प्रयास कर सकता है।

  • उन्होंने क्या किया: मानक "PPO" विधि के बजाय, उन्होंने SAC नामक एक अलग एल्गोरिदम का उपयोग किया।
  • जादू: उन्होंने इसे एक शक्तिशाली कंप्यूटर चिप (NVIDIA RTX 4090) पर चलाया जिसमें हजारों वर्चुअल रोबोट समानांतर (parallel) चल रहे थे।
  • परिणाम: रोबोट सिमुलेशन में इतनी अच्छी तरह से चलना सीख गया कि जब उन्होंने इसे एक वास्तविक रोबोट (Booster T1) पर रखा, तो यह बिना किसी अतिरिक्त प्रशिक्षण के घास, पहाड़ियों और कीचड़ पर चल सका। इसे "जीरो-शॉट डिप्लॉयमेंट" (zero-shot deployment) कहा जाता है। यह एक छात्र के ड्राइविंग टेस्ट पास करने जैसा है जो केवल सिम्युलेटर में अभ्यास करने के तुरंत बाद वास्तविक कार में ड्राइविंग टेस्ट पास कर लेता है।

चरण 2: "क्रिस्टल बॉल" बनाना (वर्ल्ड मॉडल प्रीट्रेनिंग)

उपमा: अब, कल्पना कीजिए कि आप उस जिम्नास्ट को एक नया करतब सिखाना चाहते हैं, जैसे कि रस्सी (tightrope) पर चलना। आप उसे सीधे असली रस्सी पर अभ्यास करने के लिए नहीं छोड़ सकते; वह गिर सकता है और चोटिल हो सकता है।

  • समाधान: आप एक "क्रिस्टल बॉल" (Physics-Informed World Model) बनाते हैं। यह केवल एक रैंडम अनुमान नहीं है; यह एक कंप्यूटर मॉडल है जो भौतिकी के नियमों (गुरुत्वाकर्षण, संवेग, जोड़ों के कोण) को समझता है।
  • यह कैसे काम करता है: रोबोट चरण 1 के डेटा का उपयोग इस "क्रिस्टल बॉल" को यह सिखाने के लिए करता है कि दुनिया कैसे काम करती है। क्रिस्टल बॉल भविष्यवाणी करना सीखता है: "यदि मैं अपना पैर इस तरह हिलाता हूँ, तो मैं गिर जाऊँगा। यदि मैं इसे उस तरह हिलाता हूँ, तो मैं संतुलन बनाए रखूँगा।"
  • यह क्यों विशेष है: अन्य मॉडलों के विपरीत जो केवल पैटर्न का अनुमान लगाने वाले "ब्लैक बॉक्स" होते हैं, इसमें भौतिकी (physics) अंतर्निहित है। यह जानता है कि यदि आप बहुत अधिक झुकते हैं, तो आप गिर जाएंगे। यह इसे बहुत अधिक सटीक और सुरक्षित बनाता है।

चरण 3: "सेफ सैंडबॉक्स" (एफिशिएंट फाइनट्यूनिंग)

उपमा: अब, रोबोट को एक नए वातावरण (जैसे फिसलन भरा फर्श या नई गति) में चलना सीखना है।

  • खतरा: यदि रोबोट वास्तविक दुनिया में अपने हाथ-पैर बेतरतीब ढंग से हिलाकर सीखने की कोशिश करता है, तो वह दुर्घटनाग्रस्त हो जाएगा।
  • LIFT रणनीति:
    1. वास्तविक दुनिया: रोबोट वास्तविक दुनिया में चलता है, लेकिन वह केवल वही करता है जिसके बारे में वह 100% आश्वस्त है। यह एक ऑटोपायलट रोबोट की तरह कार्य करता है, कोई जोखिम भरा अनुमान नहीं लगाता। यह केवल डेटा एकत्र करता है।
    2. वर्चुअल दुनिया: रोबोट उस डेटा को लेता है और वापस क्रिस्टल बॉल में जाता है। क्रिस्टल बॉल के अंदर, उसे पागल, जंगली और प्रयोगात्मक होने की अनुमति है। वह जोखिम भरे मूव्स आज़माता है, गिरता है, और सिमुलेशन के भीतर अपनी गलतियों से सीखता है।
  • लाभ: रोबट बिना कभी वास्तविक दुनिया में क्रैश हुए अविश्वसनीय रूप से तेज़ी से (sample efficiency) नए कौशल सीख सकता है। यह एक खतरनाक स्टंट को तब तक वीडियो गेम में मास्टर करने जैसा है जब तक कि आप उसे पूरी तरह से सीख न लें, और फिर उसे वास्तविक जीवन में एक बार पूरी तरह से सफलतापूर्वक करना।

यह एक बड़ी बात क्यों है?

  1. सुरक्षा: ह्युमनॉइड रोबोट नाजुक होते हैं। यदि वे गिरते हैं, तो वे टूट जाते हैं। LIFT "खतरनाक प्रयोगों" को कंप्यूटर (क्रिस्टल बॉल) के अंदर रखता है और वास्तविक रोबोट को सुरक्षित रखता है।
  2. गति: पारंपरिक तरीकों को एक नए कार्य के अनुकूल होने में कई दिन या सप्ताह लगते हैं। LIFT मिनटों में अनुकूलित हो सकता है क्योंकि "क्रिस्टल बॉल" बहुत स्मार्ट है।
  3. बहुमुखी प्रतिभा: उन्होंने इसका परीक्षण दो अलग-अलग रोबोटों (Booster T1 और Unitree G1) पर किया और यह दोनों के लिए काम कर गया। उन्होंने यह भी दिखाया कि यह शून्य से शुरुआत किए बिना ऊबड़-खाबड़ इलाकों और विभिन्न गतियों पर चल सकता है।

"चीट शीट" सारांश

अवधारणा सरल स्पष्टीकरण उपमा (Metaphor)
PPO (पुराना तरीका) याद करने में अच्छा, अनुकूलन में बुरा। एक छात्र जो कड़ी मेहनत से पढ़ता है लेकिन परीक्षा के प्रश्न बदलने पर घबरा जाता है।
SAC (नया आधार) पिछली गलतियों से कुशलतापूर्वक सीखता है। एक छात्र जो हर गलत उत्तर से तुरंत सीखता है।
World Model एक सिम्युलेटर जो भौतिकी को जानता है। एक क्रिस्टल बॉल जो प्रकृति के नियमों के आधार पर भविष्य की भविष्यवाणी करता है।
Deterministic Execution केवल वही करना जो आप जानते हैं कि सुरक्षित है। आँखों को बंद करके रस्सी पर चलना, केवल तभी हिलना जब आप सुनिश्चित हों।
Stochastic Exploration रैंडम, जोखिम भरी चीजें आज़माना। क्रिस्टल बॉल के अंदर, आप खाई में कूद सकते हैं यह देखने के लिए कि क्या होता है, क्योंकि वहां आपको चोट नहीं लग सकती।

निचोड़ (Bottom Line)

लेखकों ने एक ऐसा सिस्टम बनाया है जो विशाल सिमुलेशन की गति को भौतिकी-आधारित भविष्यवाणी की सुरक्षा के साथ जोड़ता है। यह रोबोट को एक वर्चुअल सैंडबॉक्स में जटिल कौशल सीखने और फिर वास्तविक दुनिया में सुरक्षित रूप से लागू करने की अनुमति देता है, जिससे "लैब में प्रशिक्षण" और "वास्तविक दुनिया में काम करने" के बीच के अंतर को पाटा जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →