← नवीनतम पेपर
💻 computer science

FrameSkip: Learning from Fewer but More Informative Frames in VLA Training

यह शोध पत्र FrameSkip को पेश करता है, जो एक डेटा-लेयर फ्रेमवर्क है जो एक्शन वेरिएशन और विजुअल कोहेरेंस के आधार पर उच्च-महत्व वाले फ्रेमों को चुनिंदा रूप से सैंपल करके विजन-लैंग्वेज-एक्शन (VLA) ट्रेनिंग की दक्षता और प्रदर्शन को बढ़ाता है, जिससे मूल ट्राजेक्टरी फ्रेमों के केवल 20% को बनाए रखते हुए बेंचमार्क में 76.15% सफलता दर प्राप्त होती है।

मूल लेखक: Bin Yu, Shijie Lian, Xiaopeng Lin, Zhaolong Shen, Yuliang Wei, Changti Wu, Hang Yuan, Haishan Liu, Bailing Wang, Cong Huang, Kai Chen

प्रकाशित 2026-05-14
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Bin Yu, Shijie Lian, Xiaopeng Lin, Zhaolong Shen, Yuliang Wei, Changti Wu, Hang Yuan, Haishan Liu, Bailing Wang, Cong Huang, Kai Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कॉफी बनाना सिखाने की कोशिश कर रहे हैं। आप एक इंसान को शुरू से अंत तक कॉफी बनाते हुए एक वीडियो रिकॉर्ड करते हैं। यह वीडियो 10 मिनट लंबा है।

पुराना तरीका (समस्या)
अतीत में, जब AI रोबोट को प्रशिक्षित किया जाता था, तो शोधकर्ता उस 10 मिनट के वीडियो का हर एक फ्रेम कंप्यूटर को खिला देते थे। वे हर सेकंड को समान रूप से महत्वपूर्ण मानते थे।

लेकिन इस वीडियो के बारे में सोचें:

  • मिनट 0–2: इंसान धीरे-धीरे किचन काउंटर की ओर चल रहा है। (कुछ खास नहीं हो रहा है)।
  • मिनट 3: वे कॉफी मग उठाते हैं। (यह एक महत्वपूर्ण क्षण है!)।
  • मिनट 4–8: वे कॉफी मशीन की ओर धीरे-धीरे चलते हैं और प्रतीक्षा करते हैं। (फिर से, ज्यादातर सिर्फ चलना ही है)।
  • मिनट 9: वे बटन दबाते हैं और कॉफी छलकती है। (एक और महत्वपूर्ण क्षण!)।
  • मिनट 10: वे दूर चले जाते हैं।

पेपर का तर्क है कि "पुराना तरीका" अक्षम है। रोबोट अपना 80% अध्ययन समय धीरे-धीरे चलने को देखने में बिता देता है, और केवल 20% समय वास्तव में कठिन हिस्सों (पकड़ने, डालने) को देखने में बिताता है। यह गणित की परीक्षा के लिए तैयारी करने जैसा है जहाँ आप बार-बार एक ही उबाऊ अध्याय को पढ़ते रहते हैं, जबकि उन सूत्रों पर केवल एक नज़र डालते हैं जिनकी आपको समस्याओं को हल करने के लिए आवश्यकता है।

नया समाधान: FRAMESKIP
लेखकों ने FRAMESKIP नामक एक टूल बनाया है। इसे एक सुपर-स्मार्ट वीडियो एडिटर के रूप में समझें जो रोबोट के सीखना शुरू करने से पहले काम करता है।

रोबोट को पूरा 10 मिनट का वीडियो दिखाने के बजाय, FRAMESKIP उबाऊ हिस्सों को काट देता है और एक "हाइलाइट रील" बनाता है। यह धीरे-धीरे चलने वाले हिस्सों को बहुत छोटा रखता है लेकिन महत्वपूर्ण हिस्सों (जैसे हाथ से मग पकड़ना) पर ज़ूम करता है और उन्हें दोहराता है ताकि रोबota उन्हें अधिक बार देख सके।

इसे कैसे पता चलता है कि क्या रखना है?
FRAMESKIP यह तय करने के लिए चार सरल "सुरागों" का उपयोग करता है कि कौन से फ्रेम महत्वपूर्ण हैं:

  1. एक्शन परिवर्तन (Action Changes): क्या रोबोट का हाथ अचानक तेज़ चला? (उस फ्रेम को रखें)।
  2. दृश्य परिवर्तन (Visual Changes): क्या तस्वीर इसलिए बदली क्योंकि वस्तु हिल गई? (उस फ्रेम को रखें)।
  3. कार्य प्रगति (Task Progress): क्या यह कार्य का मध्य भाग है जहाँ चीजें आमतौर पर गलत हो जाती हैं? (उस फ्रेम को रखें)।
  4. ग्रिपर की हरकत (Gripper Moves): क्या रोबोट की "उंगलियां" खुली या बंद हुईं? (उस फ्रेम को रखें)।

जादुई ट्रिक
सबसे शानदार बात यह है कि FRAMESKIP रोबोट के दिमाग या उसके सीखने के तरीके को नहीं बदलता है। यह केवल डेटा को बदल देता है जिसे रोबोट देखता है। यह उसी छात्र को एक बेहतर स्टडी गाइड देने जैसा है, बजाय इसके कि छात्र को और अधिक स्मार्ट बनाने की कोशिश की जाए।

परिणाम
शोधकर्ताओं ने इसका परीक्षण तीन अलग-अलग रोबोट सिमुलेशन गेम्स पर किया।

  • परिणाम: जब उन्होंने "हाइलाइट रील" का उपयोग किया (मूल फ्रेम का केवल 20% हिस्सा रखा), तो रोबोट वास्तव में पूरे, उबाऊ वीडियो को देखने की तुलना में अपने कार्यों में बेहतर प्रदर्शन कर रहे थे।
  • स्कोर: नए तरीके के साथ रोबोट लगभग 76% बार सफल हुए, जबकि पुराने तरीके के साथ केवल 66% बार।

संक्षेप में
पेपर कहता है: "हमें रोबोट को सिखाने के लिए वीडियो के हर सेकंड को दिखाने की आवश्यकता नहीं है। यदि हम उबाऊ हिस्सों को छोड़ देते हैं और उन क्षणों पर ध्यान केंद्रित करते हैं जहाँ रोबोट को वास्तव में कुछ करना होता है, तो रोबोट तेजी से सीखता है और बेहतर काम करता है।"

यह जूता बांधने सीखने के लिए पूरी विश्वकोश पढ़ने बनाम किसी को जूता बांधते हुए देखने के 30-सेकंड के वीडियो के बीच का अंतर है। FRAMESKIP रोबोट को उस "विश्वकोश" के अंदर "30-सेकंड का वीडियो" खोजने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →