← नवीनतम पेपर
💻 computer science

NoiseGate: Learning Per-Latent Timestep Schedules as Information Gating in World Action Models

यह शोध पत्र NoiseGate का प्रस्ताव करता है, जो वर्ल्ड एक्शन मॉडल्स (World Action Models) के लिए एक नवीन फ्रेमवर्क है जो साझा टाइमस्टेप शेड्यूल को एक सीखने योग्य प्रति-लेटेंट गेटिंग पॉलिसी (per-latent gating policy) से बदल देता है ताकि एक्शन जनरेशन के लिए भविष्य के ऑब्जर्वेशन लेटेंट्स की विश्वसनीयता को गतिशील रूप से नियंत्रित किया जा सके, जिससे विविध रोबोटिक मैनिपुलेशन कार्यों पर प्रदर्शन में सुधार होता है।

मूल लेखक: Wen Huang, Haoran Sun, Yongjian Guo, Yunxuan Ma, Haoran Li, Jing Long, Zhouying Mo, Zhong Guan, Yucheng Guo, Shuai Di, Junwu Xiong

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wen Huang, Haoran Sun, Yongjian Guo, Yunxuan Ma, Haoran Li, Jing Long, Zhouying Mo, Zhong Guan, Yucheng Guo, Shuai Di, Junwu Xiong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई कार्य करना सिखाने की कोशिश कर रहे हैं, जैसे कि एक कप उठाना और उसे मेज पर रखना। ऐसा करने के लिए, रोबोट एक "वर्ल्ड एक्शन मॉडल" (WAM) का उपयोग करता है। इस मॉडल को एक फिल्म निर्देशक के रूप में सोचें जो एक साथ स्क्रिप्ट (रोबोट के कार्य) लिख रहा है और फ्रेम दर फ्रेम भविष्य के दृश्यों (दुनिया कैसी दिखेगी) की कल्पना कर रहा है।

पारंपरिक रोबोट निर्देशकों में, एक सख्त नियम होता है: भविष्य के हर एक फ्रेम को बिल्कुल एक ही गति से स्पष्ट किया जाना चाहिए।

यदि रोबबोर्ड एक कप पकड़ने वाला है, तो वह वीडियो के अगले 10 सेकंड की कल्पना करता है। पुराने तरीके में, मॉडल "हाथ कप को छू रहा है" (2 सेकंड दूर) और "हाथ कप को मेज पर रख रहा है" (8 सेकंड दूर) की छवि को एक ही समय में समान रूप से स्पष्ट करने की कोशिश करता है। यह एक ही निश्चित फोकस नॉब के साथ एक फूल के क्लोज-अप और एक दूर के पहाड़ दोनों पर एक साथ फोकस करने की कोशिश करने जैसा है। यह तर्क देता है कि यह अक्षम है क्योंकि वर्तमान में निर्णय लेने के लिए भविष्य के कुछ हिस्से अन्य हिस्सों की तुलना में अधिक महत्वपूर्ण होते हैं।

समस्या: "एक-आकार-सभी-के-लिए-फिट" शेड्यूल

लेखक इस पुराने तरीके को "शेयर्ड स्केलर शेड्यूल" (shared scalar schedule) कहते हैं। यह एक ट्रैफिक लाइट की तरह है जो हर कार के लिए बिल्कुल एक ही समय पर हरी हो जाती है, चाहे वह एक धीमी गति वाला ट्रक हो या एक तेज़ स्पोर्ट्स कार।

रोबोट के मस्तिष्क में, इसका अर्थ है कि भविष्य के हर क्षण को समान रूप से विश्वसनीय माना जाता है। लेकिन वास्तव में, यदि रोबोट किसी कठिन चाल (जैसे कि एक फिसलन भरी वस्तु को पकड़ना) को लेकर अनिश्चित है, तो उसके लिए उस विशिष्ट भविष्य के क्षण को थोड़े और समय तक "धुंधला" (अनिश्चित) रखना बेहतर हो सकता है, जबकि तत्काल अगले चरणों को स्पष्ट रखा जाए। पुराना सिस्टम सब कुछ एक साथ स्पष्ट या धुंधला करने के लिए मजबूर करता है, जिससे रोबोट अति-आत्मविश्वासी, समयपूर्व गलतियाँ कर सकता है।

समाधान: NoiseGate

लेखक NoiseGate पेश करते हैं, जो एक नया सिस्टम है जो रोबोट की कल्पना के लिए एक स्मार्ट, अनुकूलन योग्य संपादक (adaptive editor) की तरह कार्य करता है।

एक निश्चित शेड्यूल के बजाय, NoiseGate प्रत्येक भविष्य के फ्रेम के लिए व्यक्तिगत रूप से एक अद्वितीय "शोर स्तर" (या धुंधलेपन का स्तर) निर्धारित करना सीखता है। यह कैसे काम करता है, इसके लिए एक सरल उपमा यहाँ दी गई है:

"सूचना द्वार" (Information Gate) की उपमा:
कल्पना कीजिए कि रोबोट की निर्णय लेने की प्रक्रिया लोगों से भरा एक कमरा है (कार्य टोकन) जो यह तय करने की कोशिश कर रहे हैं कि क्या करना है। वे भविष्य की संभावनाओं को दिखाने वाली स्क्रीनों की एक दीवार (वीडियो लेटेंट्स) को देख रहे हैं।

  • पुराना तरीका: सभी स्क्रीनों को एक ही समय में स्पष्ट किया जाता है। यदि एक स्क्रीन भविष्य की किसी आपदा की भ्रमित करने वाली, धुंधली छवि दिखाती है, तो कमरे में मौजूद लोग घबरा सकते हैं और एक बुरा निर्णय ले सकते हैं क्योंकि उन्हें उस धुंधली छवि को भी बहुत जल्दी देखने के लिए मजबूर किया जाता है।
  • NoiseGate का तरीका: सिस्टम में एक द्वारपाल (Gatekeeper) (गेटिंग पॉलिसी नेटवर्क) होता है। द्वारपाल स्थिति को देखता है और तय करता है: "अरे, 2 सेकंड में कप पकड़ने वाली स्क्रीन बहुत महत्वपूर्ण है; चलिए इसे तुरंत स्पष्ट करते हैं। लेकिन 5 सेकंड में मेज पर रखने वाली स्क्रीन अभी भी धुंधली और अनिश्चित है; चलिए इसे थोड़ी देर के लिए धुंधला ही रहने देते हैं ताकि यह हमें विचलित न करे।"

कम महत्वपूर्ण या अनिश्चित भविष्य के फ्रेमों को "शोर युक्त" (मास्क किया हुआ) रखकर, द्वारपाल यह सुनिश्चित करता है कि रोबोट अविश्वसनीय भविष्यवाणियों पर बहुत अधिक भरोसा न करे। वह केवल तभी विश्वसनीय जानकारी को गेट के माध्यम से अंदर आने देता है जब वह तैयार होती है।

उन्होंने इसे कैसे सिखाया

शोधकर्ताओं ने केवल इन नियमों को हार्ड-कोड नहीं किया। उन्होंने तीन-चरणीय प्रशिक्षण प्रक्रिया का उपयोग किया:

  1. सब्सट्रेट (Substrate): सबसे पहले, उन्होंने रोबोट के मस्तिष्क को यह सिखाया कि वह अलग-अलग फ्रेमों के लिए अलग-अलग धुंधलेपन के स्तरों को संभाल सकता है (यह "डिफ्यूजन फोर्सिंग" नामक तकनीक से ली गई एक ट्रिक है)।
  2. द्वारपाल (The Gatekeeper): उन्होंने एक छोटा, हल्का AI (गेटिंग पॉलिसी नेटवर्क) जोड़ा, जिसका एकमात्र काम यह तय करना था कि प्रत्येक चरण पर प्रत्येक भविष्य के फ्रेम को कितना स्पष्ट किया जाए।
  3. पुरस्कार (The Reward): उन्होंने द्वारपाल को यह नहीं बताया कि उसे यह कैसे करना है। इसके बजाय, उन्होंने रोबोट को एक सिम्युलेटर में कार्य करने दिया। यदि रोबोट कार्य में सफल रहा (उदाहरण के लिए, सफलतापूर्वक कप रख दिया), तो द्वारपाल को पुरस्कार मिला। यदि वह विफल रहा, तो उसे कुछ नहीं मिला। समय के साथ, द्वारपाल ने सीखा: "ओह, मुझे इस विशिष्ट कार्य के लिए 'पकड़ने' वाले फ्रेम को लंबे समय तक धुंधला रखना होगा, लेकिन दूसरे कार्य के लिए इसे तेज़ी से स्पष्ट करना होगा।"

परिणाम

जब RoboTwin (जहाँ रोबोट को यादृच्छिक, अव्यवस्थित वातावरण में वस्तुओं के साथ हेरफेर करना होता है) नामक बेंचमार्क पर परीक्षण किया गया, तो NoiseGate ने पुराने तरीकों से बेहतर प्रदर्शन किया।

  • इसने रोबोट को केवल हर चीज़ में थोड़ा बेहतर नहीं बनाया; इसने विशेष रूप से उन कठिन स्थितियों में मदद की जहाँ रोबोट को सावधान रहने की आवश्यकता थी।
  • एक दृश्य परीक्षण में, पुराने रोबोट ने अपने धुंधले भविष्य के अनुमान के कारण बहुत जल्दी कप पकड़ने की कोशिश की क्योंकि वह "अति-आत्मविश्वासी" था। NoiseGate ने उस भविष्यवाणी को तब तक थोड़ा धुंधला (अनिश्चित) रखा जब तक कि रोबोट वास्तव में तैयार नहीं हो गया, जिससे सफल पकड़ सुनिश्चित हुई।

सारांश

NoiseGate एक ऐसी विधि है जो रोबोट की "कल्पना" को लचीला बनाती है। भविष्य के हर विचार को एक ही समय में स्पष्ट करने के लिए मजबूर करने के बजाय, यह जानकारी को गेट करने (रोकने) का काम करती है, अनिश्चित भविष्य को तब तक धुंधला रखती है जब तक कि उनकी आवश्यकता न हो, और महत्वपूर्ण क्षणों को जल्दी स्पष्ट कर देती है। यह रोबोट को भविष्य के बारे में समयपूर्व या अविश्वसनीय अनुमानों के आधार पर गलतियाँ करने से रोकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →