← नवीनतम पेपर
💻 computer science

The Gaussian Is Enough: Flow-Matching Priors Do Not Help When Fine-Tuning Large Behavior Models

यह शोध पत्र यह प्रदर्शित करता है कि अपेक्षाओं के विपरीत, मानक गॉसियन प्रायर्स (priors) को गैर-गॉसियन विकल्पों से बदलने से व्यापक सिमुलेशन और हार्डवेयर बेंचमार्क में प्रीट्रेन्ड लार्ज बिहेवियर मॉडल्स के फाइन-ट्यूनिंग प्रदर्शन में सुधार नहीं होता है, क्योंकि एनकोडर ट्रेनिंग डायनेमिक्स प्रायर्स के चयन पर हावी रहते हैं।

मूल लेखक: Chen Xu, Rishi Shah, Hadas Kress-Gazit, Haruki Nishimura, Masha Itkina

प्रकाशित 2026-09-24✓ Author reviewed ⓘ
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chen Xu, Rishi Shah, Hadas Kress-Gazit, Haruki Nishimura, Masha Itkina

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट एक नए प्रकार की बुद्धिमत्ता के साथ चलना सीख रहे हैं, जो इस बात की नकल करती है कि इंसान देखकर कैसे सीखते हैं। हर संभावित स्थिति के लिए कठोर नियम प्रोग्राम किए जाने के बजाय, ये मशीनें जो वे देखती और सुनती हैं, उसके आधार पर अगले सबसे अच्छे कदम का अनुमान लगाने के लिए जेनेरेटिव मॉडल्स (generative models) का उपयोग करती हैं। कल्पना कीजिए कि एक रोबोटिक हाथ एक छोटे कटोरे से सब्जियों को एक बड़े बिन में डालने की कोशिश कर रहा है। यह पहले से ही एक सटीक पथ की गणना नहीं करता है; इसके बजाय, यह एक यादृच्छिक अनुमान (random guess) के साथ शुरुआत करता है और धीरे-धीरे उस अनुमान को तब तक परिष्कृत करता है जब तक कि वह एक सुगम, सफल गति न पा ले। यह प्रक्रिया एक शुरुआती बिंदु पर निर्भर करती है, जो यादृच्छिकता (randomness) का एक आधार है जिससे रोबोट सही क्रिया की खोज शुरू करता है। वर्षों से, इंजीनियरों ने इस शुरुआती बिंदु के लिए एक मानक, सरल रूप से यादृच्छिकता का उपयोग किया है, जो एक खाली कैनवास की तरह है। हालांकि, हालिया शोध ने सुझाव दिया कि यदि आप एक ऐसे अनुमान के साथ शुरुआत कर सकें जो पहले से ही समाधान के कुछ करीब हो, तो रोबोट बहुत तेज़ी से सीखेगा और बेहतर प्रदर्शन करेगा। इस विचार ने एक नई सोच को जन्म दिया: क्या हम रोबोट को एक स्मार्ट अनुमान के साथ शुरुआत करना सिखा सकते हैं?

टोयोटा रिसर्च इंस्टीट्यूट के शोधकर्ताओं की एक टीम ने, वॉवन बाय टोयोटा (Woven by Toyota) और कॉर्नेल यूनिवर्सिटी के सहयोगियों के साथ मिलकर, बड़े रोबोट मॉडल के एक नए युग पर इस विचार का परीक्षण करने का निर्णय लिया। ये मॉडल, जिन्हें 'लार्ज बिहेवियर मॉडल्स' (Large Behavior Models) के रूप में जाना जाता है, गति कौशल के विशाल पुस्तकालयों की तरह हैं जिन्हें हजारों घंटों के विविध रोबोट डेटा पर प्री-ट्रेन किया गया है। इन मॉडल्स का उपयोग करने का मानक तरीका इस प्री-ट्रेन्ड लाइब्रेरी को लेना और फिर इसे किसी विशिष्ट नए कार्य के लिए फाइन-ट्यून करना है, जैसे कि कैबिनेट खोलना या किसी पुर्जे को जोड़ना। शोधकर्ताओं ने एक सरल लेकिन गहरा प्रश्न पूछा: यदि वे मानक, सरल शुरुआती बिंदु को रोबोट के अपने प्री-ट्रेन्ड ज्ञान से प्राप्त एक अधिक जटिल, "स्मार्टर" शुरुआती बिंदु से बदल देते, तो क्या फाइन-ट्यूनिंग की प्रक्रिया अधिक प्रभावी हो जाती? यह तर्कसंगत लग रहा था कि लक्ष्य के करीब से शुरुआत करने से रोबोट लक्ष्य तक जल्दी पहुँच जाएगा। इस उत्तर को खोजने के लिए, उन्होंने चालीस अलग-अलग कार्यों पर एक लाख से अधिक सिमुलेशन चलाए और प्रयोगशाला में वास्तविक रोबोट हार्डवेयर पर अपने निष्कर्षों का परीक्षण किया, यह देखते हुए कि मशीनें वास्तव में कैसा प्रदर्शन करती हैं।

परिणाम आश्चर्यजनक और विरोधाभासी थे। शोधकर्ताओं ने पाया कि एक स्मार्ट, अधिक सूचित शुरुआती बिंदु का उपयोग करने से रोबोट नए कार्यों को बेहतर ढंग से नहीं सीख पाए। वास्तव में, कई मामलों में, रोबोट ने जटिल शुरुआती बिंदुओं का उपयोग करने की तुलना में साधारण, मानक वाले के मुकाबले समान या कभी-कभी थोड़ा खराब प्रदर्शन किया। यह तब भी सच था जब वे कंप्यूटर सिमुलेशन पर परीक्षण कर रहे थे या वास्तविक वस्तुओं को हिलाने वाले भौतिक रोबोटिक हाथों पर। टीम ने तीन अलग-अलग प्रकार के बड़े रोबोट मॉडल्स पर इसका परीक्षण किया और हर जगह एक ही पैटर्न पाया। एकमात्र समय जब स्मार्ट शुरुआती बिंदु ने स्पष्ट लाभ दिखाया, वह था जब रोबोटों को प्रशिक्षण का एक अत्यंत छोटा हिस्सा दिया गया था—इतना कम कि रोबोट के पास सीखने के लिए लगभग कुछ भी नहीं था। उस विशिष्ट, डेटा-रहित परिदृश्य में, सूचित अनुमान ने एक सहायक धक्का प्रदान किया। लेकिन अधिकांश स्थितियों में, जहाँ रोबोट के पास सीखने के लिए पर्याप्त उदाहरण थे, शुरुआती बिंदु की जटिलता ने अंतिम परिणाम पर कोई अंतर नहीं डाला।

यह समझने के लिए कि ऐसा क्यों हुआ, शोधकर्ताओं ने सीखने की प्रक्रिया के दौरान रोबोट के "मस्तिष्क" के भीतर गहराई से देखा। उन्होंने पाया कि हालांकि रोबोट अलग-अलग अनुमानों के साथ शुरू करते थे, वे सभी चलने के लिए एक ही तरह के अनुमान लगाते थे। रोबोट का वह हिस्सा जो यह संसाधित करता है कि वह क्या देखता है—विजुअल एनकोडर (visual encoder)—फाइन-ट्यूनिंग प्रक्रिया के दौरान काफी बदल गया, चाहे जो भी शुरुआती बिंदु उपयोग किया गया हो। यह विजुअल प्रोसेसिंग वाला हिस्सा ही था, न कि शुरुआती अनुमान, जिसने यह निर्धारित किया कि रोबोट ने कितनी अच्छी तरह सीखा। शोधकर्ताओं ने पाया कि सफलता में विजुअल प्रोसेसिंग की गुणवत्ता ही प्रमुख कारक थी। यदि विजुअल भाग को अच्छी तरह से प्रशिक्षित किया गया था, तो रोबोट सफल रहा, चाहे वह कहीं से भी शुरू हुआ हो। यदि विजुअल भाग अच्छी तरह से प्रशिक्षित नहीं था, तो रोबोट संघर्ष करता रहा, भले ही उसने एक आदर्श अनुमान के साथ शुरुआत की हो। यह बताता है कि शुरुआती बिंदु सीखने के दौरान रोबोट के आंतरिक प्रतिनिधित्व (internal representations) को कैसे बदलते हैं, इससे प्रभावित होता है, लेकिन यह प्रदर्शन की अंतिम गुणवत्ता को नहीं बदलता है।

यह निष्कर्ष रोबोट विकास के भविष्य के लिए एक स्पष्ट दिशा प्रदान करता है। यह सुझाव देता है कि इंजीनियरों को इन बड़े मॉडल्स के लिए जटिल, कस्टम शुरुआती बिंदु डिजाइन करने में समय और कंप्यूटिंग शक्ति खर्च करने की आवश्यकता नहीं है। मानक, सरल दृष्टिकोण पर्याप्त और प्रभावी है। इसके बजाय, ध्यान यह सुनिश्चित करने पर होना चाहिए कि रोबोट की दुनिया को देखने और समझने की क्षमता मजबूत और अच्छी तरह से प्रशिक्षित हो। यह अध्ययन पुष्टि करता है कि बड़े, प्री-ट्रेन्ड रोबोट मॉडल्स के लिए, यात्रा से अधिक मंजिल मायने रखती है, और यात्रा का सबसे महत्वपूर्ण हिस्सा रोबंद की यह क्षमता है कि वह जो देखता है उसे कैसे व्याख्यायित करता है, न कि वह यादृच्छिक अनुमान जो वह शुरू करने से पहले बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →