← नवीनतम पेपर
🤖 AI

FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation

FORCE एक तीन-चरणीय ढांचा है जो एक वैल्यू-कैलिब्रेटेड वॉर्म-अप और सेल्फ-डिस्टिलेशन तंत्र के माध्यम से विजन-लैंग्वेज-एक्शन (VLA) मॉडल फाइन-ट्यूनिंग की सैंपल एफिशिएंसी और स्थिरता को बढ़ाता है, जिससे महत्वपूर्ण प्रदर्शन लाभ और मानवीय हस्तक्षेप के बिना स्वायत्त प्रशिक्षण प्राप्त होता है।

मूल लेखक: Shuyi Zhang, Yunfan Lou, Hongyang Cheng, Yichen Guo, Chuyao Fu, Yaoxu Lyu, Xiaojie Zhang, Haoran Li, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuyi Zhang, Yunfan Lou, Hongyang Cheng, Yichen Guo, Chuyao Fu, Yaoxu Lyu, Xiaojie Zhang, Haoran Li, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक रोबोट है जिसने वर्षों तक इंसानों को घर के काम करते हुए हजारों वीडियो देखे हैं। उसने उनकी हूबहू नकल करना सीख लिया है, लेकिन वह एक "ग्लास सीलिंग" (कांच की छत) से टकरा गया है। वह केवल उतना ही अच्छा कर सकता है जितना उसने उन वीडियो में देखा था। यदि वीडियो थोड़े भी त्रुटिपूर्ण थे, तो रोबोट उन्हीं कमियों के साथ अटक जाता है। वह खुद से बेहतर करना नहीं सीख सकता क्योंकि वह कुछ नया करने से डरता है।

यह वर्तमान रोबोट "ब्रेन" मॉडल्स (जिन्हें विजन-लैंग्वेज-एक्शन या VLA मॉडल कहा जाता है) के साथ होने वाली समस्या है। वे नकल करने में तो बहुत अच्छे हैं, लेकिन सुधार करने में बहुत खराब हैं।

यह पेपर इस कांच की छत को तोड़ने के लिए एक नई विधि पेश करता है जिसे FORCE कहा जाता है। FORCE को एक तीन-चरणीय प्रशिक्षण शिविर (training camp) के रूप में समझें जो रोबोट को यह सिखाता है कि बिना किसी इंसान के लगातार हस्तक्षेप के अपनी गलतियों से कैसे सीखा जाए।

FORCE कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग किया गया है:

समस्या: रोबोट क्यों अटक जाते हैं

आमतौर पर, जब आप एक रोबोट को वास्तविक दुनिया में चीजें आज़माने देकर बेहतर बनने के लिए सिखाने की कोशिश करते हैं (Reinforcement Learning), तो दो बुरी चीजें होती हैं:

  1. "भूलने की बीमारी" (The "Amnesia" Effect) का प्रभाव: जब रोबोट नई चीजें आज़माना शुरू करता है, तो वह भ्रमित हो जाता है। वह भूल जाता है कि उसने वीडियो से क्या सीखा था क्योंकि नया डेटा बहुत अलग दिखता है। यह एक ऐसे छात्र की तरह है जो गणित में तो परफेक्ट है, लेकिन जब उसे एक नए प्रकार का कैलकुलेटर दिया जाता है, तो वह अचानक जोड़ना भी भूल जाता है।
  2. "अनजान खोजकर्ता" (The "Clueless Explorer" Effect) का प्रभाव: जब रोबोट अन्वेषण (explore) करने की कोशिश करता है, तो वह अक्सर मूर्खतापूर्ण और बेकार चीजें करता है। यदि आप उसे अपने सभी प्रयासों से सीखने देते हैं, तो वह गलत प्रयासों से भी सीख लेता है, जिससे उसकी गति धीमी हो जाती है। इसे ठीक करने के लिए, इंसानों को आमतौर पर देखना पड़ता है और कहना पड़ता है, "नहीं, ऐसा मत करो," जो महंगा और धीमा है।

समाधान: FORCE फ्रेमवर्क

FORCE इसे तीन चरणों वाली प्रक्रिया से हल करता है:

चरण 1: "सेफ्टी नेट" वॉर्म-अप (The "Safety Net" Warm-Up)

इससे पहले कि रोबोट को बाहर खेलने की अनुमति दी जाए, सिस्टम एक विशेष "वॉर्म-अप" करता है।

  • उपमा: कल्पना कीजिए कि एक रस्सी पर चलने वाला (tightrope walker) व्यक्ति। पूरी लंबाई तक चलने की कोशिश करने से पहले, वह ज़मीन के ठीक बगल में एक नीची और चौड़ी बीम पर अभ्यास करता है।
  • यह क्या करता है: रोबलेट अपने आप में कुछ छोटे कदम उठाता है जबकि सिस्टम चुपचाप उसके आंतरिक "स्कोरकार्ड" (जिसे Q-function कहा जाता है) को एडजस्ट करता है। यह सुनिश्चित करता है कि जब रोबोट वास्तव में नई चीजें आज़माना शुरू करता है, तो सिस्टम उन नए मूव्स को सही ढंग से स्कोर कर सके। यह "भूलने की बीमारी" को रोकता है क्योंकि यह सुनिश्चित करता है कि रोबोट के नए अनुभव वही हों जिसकी उम्मीद उसका दिमाग करता है।

चरण 2: "स्मार्ट फ़िल्टर" (The "Smart Filter" - Self-Distillation)

अब रोबोट वास्तविक दुनिया में सीखना शुरू करता है। लेकिन हर मूव से सीखने के बजाय, FORCE एक स्मार्ट फ़िल्टर का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि एक शेफ एक नए सूप का स्वाद चख रहा है। यदि सूप का स्वाद खराब है, तो शेफ उस रेसिपी को अनदेखा कर देता है। यदि स्वाद अच्छा है, तो शेफ उसे लिख लेता है। FORCE इसे स्वचालित रूप से करता है।
  • यह क्या करता है: रोबोट एक एक्शन (क्रिया) आज़माता है। सिस्टम चेक करता है: "क्या यह एक्शन हमारे सामान्य काम से बेहतर है?"
    • यदि हाँ: रोबोट इससे सीखता है।
    • यदि नहीं: सिस्टम उस प्रयास को फेंक देता है और रोबोट को बताता है, "इसे अनदेखा करो, कुछ और कोशिश करो।"
    • इसे Value-Guided Policy Self-Distillation कहा जाता है। यह ऐसा है जैसे रोबोट खुद को पढ़ा रहा हो, लेकिन केवल अपने "अच्छे विचारों" को सुन रहा हो और अपने "बुरे विचारों" को अनदेखा कर रहा हो।

चरण 3: "बिना मानव" फिनिश लाइन (The "No-Human" Finish Line)

चूंकि सेफ्टी नेट (चरण 1) और स्मार्ट फ़िल्टर (चरण 2) मौजूद हैं, इसलिए रोबोट अब पूरी तरह से अपने आप सीख सकता है।

  • उपमा: यह एक ऐसे छात्र की तरह है जो, थोड़े मार्गदर्शन के बाद, पूरी तरह स्वतंत्र रूप से परीक्षा के लिए पढ़ाई कर सकता है, यह जानते हुए कि कौन से अभ्यास प्रश्न मददगार हैं और कौन से भटकाव हैं।
  • परिणाम: रोबोट को अब यह बताने के लिए किसी इंसान की ज़रूरत नहीं है कि "रुको!" या "अच्छा काम किया!" वह कार्य को पहले की तुलना में बहुत तेज़ी से और अधिक विश्वसनीयता के साथ खुद ही सीख लेता है।

उन्होंने क्या साबित किया?

शोधकर्ताओं ने कप उठाने, ब्लॉक स्टैक करने और USB ड्राइव प्लग करने जैसे वास्तविक कार्यों को करने के लिए रोबोट पर इसका परीक्षण किया।

  • सफलता दर (Success Rate): FORCE का उपयोग करने वाले रोबोट औसत (लगभग 45% सफलता) से लगभग पूर्ण (लगभग 98% सफलता) तक पहुँच गए।
  • गति (Speed): उन्होंने पिछले तरीकों की तुलना में 32% तेज़ी से सीखा।
  • स्वतंत्रता (Independence): उन्होंने यह सब बिना किसी मानवीय हस्तक्षेप के हासिल किया। किसी को भी रोबोट को रोकने या गलती ठीक करने के लिए बीच में आने की ज़रूरत नहीं पड़ी।

संक्षेप में

FORCE एक प्रशिक्षण विधि है जो रोबोट को यह सिखाती है कि नई चीजें आज़माने के दौरान वह जो जानता है उसे भूलना बंद करे, और उसे अपनी गलतियों को नज़रअंदाज़ करते हुए केवल अपनी सफलताओं पर ध्यान केंद्रित करना सिखाती है। यह उन्हें उनके काम में बहुत बेहतर, तेज़ और बिना किसी इंसान के हाथ पकड़ने की ज़रूरत के, सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →