← नवीनतम पेपर
🤖 machine learning

Can Tabular Foundation Models Guide Exploration in Robot Policy Learning?

यह शोध पत्र TFM-S3 का प्रस्ताव करता है, जो एक नमूना-कुशल (sample-efficient) हाइब्रिड विधि है जो एक पूर्व-प्रशिक्षित टैबुलर फाउंडेशन मॉडल का लाभ उठाकर एक गतिशील रूप से अपडेट किए गए पॉलिसी सबस्पेस के भीतर वैश्विक अन्वेषण (global exploration) को निर्देशित करती है, जिससे मौजूदा बेसलाइनों की तुलना में उच्च-आयामी निरंतर रोबोट नियंत्रण (high-dimensional continuous robot control) में अभिसरण (convergence) को गति मिलती है और प्रदर्शन में सुधार होता है।

मूल लेखक: Buqing Ou, Frederike Dümbgen

प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Buqing Ou, Frederike Dümbgen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना, दौड़ना या संतुलन बनाना सिखा रहे हैं। यह किसी कुत्ते को कोई करतब सिखाने जैसा नहीं है; यह एक विशाल कंट्रोल पैनल पर लाखों छोटे-छोटे डायल के सही संयोजन को खोजने जैसा है ताकि रोबोट सुचारू रूप से चल सके। यही रोबोट पॉलिसी लर्निंग (Robot Policy Learning) की चुनौती है।

यह शोध पत्र एक नई विधि पेश करता है जिसे TFM-S3 कहा जाता है, ताकि रोबोट इन कौशलों को तेज़ी से और कम गलतियों के साथ सीख सकें। यह कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से समझाया गया है।

समस्या: कीचड़ में फंस जाना

रोबोट को सिखाने के मौजूदा तरीके आमतौर पर दो जाल में फंस जाते हैं:

  1. "लोकल हाइकर" (स्थानीय पदयात्री): ये तरीके उस हाइकर की तरह हैं जो केवल अपने पैरों के ठीक नीचे की ज़मीन को देखता है। वे एक पहाड़ी पर चढ़ने (रोबोट के कौशल में सुधार करने) के लिए छोटे कदम उठाते हैं। लेकिन अगर वे एक छोटी घाटी में शुरू करते हैं, तो वे वहीं फंस सकते हैं, उन्हें यह अहसास ही नहीं होता कि पास में ही एक बहुत ऊँचा पर्वत मौजूद है। उन्हें सबसे अच्छा रास्ता खोजने के लिए बहुत अधिक समय और ऊर्जा की आवश्यकता होती है।
  2. "ब्लाइंड सर्च पार्टी" (अंधा खोज दल): अन्य तरीके एक साथ सैकड़ों रोबोटों को डायल के यादृच्छिक (random) संयोजनों को आज़माने के लिए भेज देते हैं। यह नए ऊँचे शिखरों को खोजने के लिए बेहतरीन है, लेकिन यह अविश्वसनीय रूप से महंगा है। यह एक सेना को किराए पर लेने जैसा है जो केवल यह देखने के लिए हर संभव रास्ते को आज़माती है कि कौन सा काम करता है। इससे बहुत सारे संसाधनों की बर्बादी होती है।

समाधान: स्मार्ट मैप और स्काउट

लेखक एक हाइब्रिड दृष्टिकोण प्रस्तावित करते हैं जो एक स्मार्ट स्काउट और जादुई मानचित्र की तरह काम करता है। यह "लोकल हाइकर" की सावधानीपूर्वक चढ़ाई और "सर्च पार्टी" की व्यापक दृष्टि को जोड़ता है, लेकिन यह इसे बहुत कुशलता से करता है।

यहाँ चरण-दर-चरण प्रक्रिया दी गई है:

1. "मुख्य हाईवे" खोजना (सबस्पेस)

रोबोट के कंट्रोल पैनल में लाखों डायल हैं। एक साथ उन सभी को समायोजित करने की कोशिश करना असंभव है।

  • उपमा: कल्पना कीजिए कि रोबोट की सीखने की प्रक्रिया एक विशाल, समतल मैदान पर चलती कार है। कार को हर दिशा में गाड़ी चलाने की ज़रूरत नहीं है; उसे मुख्य रूप से कुछ विशिष्ट "हाईवे" पर चलना है जहाँ सबसे अधिक प्रगति होती है।
  • विधि: सिस्टम रोबोट के हालिया सीखने के इतिहास को देखता है और गणित (जिसे SVD कहा जाता है) का उपयोग करके इन "हाईवे" को खोजता है। यह लाखों अप्रासंगिक डायल को अनदेखा कर देता है और केवल उन कुछ दर्जनों पर ध्यान केंद्रित करता है जो इस समय वास्तव में मायने रखते हैं। यह एक अराजक भूलभुलैया को एक सरल, सीधी सड़क में बदल देता है।

2. "मैजिक प्रेडिक्टर" (टेबुलर फाउंडेशन मॉडल)

अब जब रोबोट हाईवे पर है, तो उसे तय करने की ज़रूरत है कि किस दिशा में जाना है।

  • उपमा: आमतौर पर, यह जानने के लिए कि कोई रास्ता अच्छा है या नहीं, आपको वास्तव में उस पर गाड़ी चलानी पड़ती है, देखना पड़ता है कि वह किसी खाई की ओर तो नहीं ले जाता, और फिर वापस मुड़ना पड़ता है। यह धीमा और खतरनाक है।
  • नवाचार: लेखक एक पूर्व-प्रशिक्षित "मैजिक प्रेडिक्टर" (एक टेबुलर फाउंडेशन मॉडल) का उपयोग करते हैं। इसे एक सुपर-स्मार्ट मौसम पूर्वानुमानकर्ता के रूप में सोचें। मौसम की जाँच करने के लिए कार चलाने के बजाय, पूर्वानुमानकर्ता कुछ हालिया डेटा बिंदुओं ("कॉन्टेक्स्ट सेट") को देखता है और तुरंत सैकड़ों अन्य संभावित रास्तों के लिए मौसम कैसा होगा, इसका अनुमान लगाता है।
  • परिणाम: सिस्टम अपने दिमाग में 256 अलग-अलग रास्तों पर गाड़ी चलाने का "सिमुलेशन" कर सकता है, भविष्यवाणी कर सकता है कि कौन सा रास्ता सबसे अच्छा इनाम देगा, और उसके बाद ही वास्तव में पुष्टि करने के लिए एक ही सबसे अच्छे रास्ते पर गाड़ी चलाता है। यह बहुत अधिक समय और ऊर्जा बचाता है।

3. लूप: चढ़ो, स्कैन करो, दोहराओ

यह विधि एक चक्र में काम करती है:

  1. चढ़ना (Climb): रोबोट बेहतर होने के लिए छोटे, सावधानीपूर्ण कदम उठाता है (लोकल अपडेट्स)।
  2. स्कैन करना (Scan): समय-समय पर, सिस्टम रुकता है। यह अपना "हाईवे" मैप बनाता है, "मैजिक प्रेडिक्टर" से सैकड़ों संभावित चालों की स्क्रीनिंग करने को कहता है, विजेता को चुनता है, और उसका परीक्षण करता है।
  3. दोहराना (Repeat): रोबोट इस नए, बेहतर स्थान का उपयोग चढ़ाई जारी रखने के लिए करता है।

यह बेहतर क्यों काम करता है

लेखकों ने इसे मानक रोबोट सिमुलेशन गेम्स (जैसे कि एक आभासी चीता को दौड़ना या इंसान को चलना सिखाना) पर परखा।

  • गति: रोबोट पारंपरिक तरीकों की तुलना में बहुत तेज़ी से बुनियादी बातें सीख गया।
  • गुणवत्ता: प्रशिक्षण के अंत तक, रोबोट उन लोगों की तुलना में बेहतर था जो मानक तरीकों का उपयोग कर रहे थे, भले ही उन सभी ने अभ्यास के लिए बिल्कुल समान "प्रैक्टिस टाइम" (रोलआउट्स) का उपयोग किया हो।
  • विश्वसनीयता: यह तरीका अधिक सुसंगत था। इससे कोई फर्क नहीं पड़ता था कि रोबोट किस यादृच्छिक शुरुआती बिंदु से शुरू हुआ; वह लगभग हमेशा एक शानदार समाधान खोज लेता था।

निष्कर्ष

TFM-S3 रोबोट को एक ऐसे जीपीएस (GPS) देने जैसा है जो केवल सबसे महत्वपूर्ण सड़कों को देखता है और एक क्रिस्टल बॉल (जादुई गोला) देने जैसा है जो आपके गाड़ी चलाने से पहले ट्रैफिक की भविष्यवाणी करता है। यह रोबोट को विकल्पों के विशाल क्षेत्र में बिना सोचे-समझे भटकने से रोकता है और उसे छोटी घाटियों में फंसने से भी बचाता है। एक पूर्व-प्रशिक्षित "मस्तिष्क" का उपयोग करके परिणामों की भविष्यवाणी करके, यह बहुत कम परीक्षण और त्रुटि (trial and error) के साथ सर्वोत्तम चालें खोजता है, जिससे रोबोट सीखना तेज़, सस्ता और अधिक प्रभावी हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →