← नवीनतम पेपर
🤖 machine learning

Object-Centric World Models from Few-Shot Annotations for Sample-Efficient Reinforcement Learning

यह शोध पत्र OC-STORM प्रस्तुत करता है, जो एक ऑब्जेक्ट-सेंट्रिक मॉडल-आधारित सुदृढीकरण लर्निंग (reinforcement learning) फ्रेमवर्क है जो जटिल दृश्य वातावरण में सैंपल दक्षता और डायनेमिक्स प्रेडिक्शन को बेहतर बनाने के लिए फ्यू-शॉट एनोटेटेड फ्रेम्स और प्रीट्रेन सेग्मेंटेशन का लाभ उठाता है, जो Atari 100k और Hollow Knight बेंचमार्क पर मौजूदा बेसलाइनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Weipu Zhang, Adam Jelley, Trevor McInroe, Amos Storkey, Gang Wang

प्रकाशित 2026-02-26
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Weipu Zhang, Adam Jelley, Trevor McInroe, Amos Storkey, Gang Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखा रहे हैं, जैसे कि हॉलो नाइट (Hollow Knight) या कोई पुराना अटारी (Atari) गेम।

समस्या: रोबोट उन चीजों के प्रति "अंधा" है जो मायने रखती हैं

अधिकांश आधुनिक AI रोबोट स्क्रीन को घूरकर और यह अनुमान लगाने की कोशिश करके सीखते हैं कि आगे क्या होने वाला है। वे उन छात्रों की तरह हैं जो किसी विषय को सीखने के लिए पूरी पाठ्यपुस्तक पढ़ने की कोशिश कर रहे हैं, जिसमें वे विशाल, उबाऊ बैकग्राउंड वाले अध्याय भी शामिल हैं, सिर्फ इसलिए ताकि वे पेज नंबर 50 पर मौजूद एक महत्वपूर्ण फॉर्मूले को ढूंढ सकें।

वीडियो गेम्स में, स्क्रीन पर बहुत कुछ होता है: आसमान, ज़मीन, बादल और दुश्मन।

  • पुराना तरीका: रोबोट पूरी तस्वीर को पूरी तरह से फिर से बनाने की कोशिश करता है। वह बादलों के रंग और मिट्टी की बनावट को याद करने में अपने दिमाग की 99% शक्ति खर्च कर देता है।
  • परिणाम: वह महत्वपूर्ण चीजों को भूल जाता है। वह उस छोटे से बॉस मॉन्स्टर को नोटिस नहीं कर पाता जो उसकी ओर कूद रहा है क्योंकि वह विशाल बैकग्राउंड की तुलना में बहुत छोटा है। वह बहुत धीरे सीखता है और गलतियाँ करता है क्योंकि वह "विजुअल नॉइज़" (दृश्य शोर) से अभिभूत हो जाता है।

समाधान: OC-STORM (एक "स्पॉटलाइट" वाला रोबोट)

इस पेपर के लेखकों ने OC-STORM नामक एक नई विधि बनाई है। इसे एक जादुई स्पॉटलाइट और एक स्मार्ट असिस्टेंट देने के रूप में सोचें।

पूरी स्क्रीन को याद करने के बजाय, रोबोट को बैकग्राउंड को अनदेखा करने और केवल दृश्य के "एक्टर्स" (पात्रों) पर ध्यान केंद्रित करने के लिए सिखाया जाता है: खिलाड़ी का पात्र, दुश्मन और गेंद।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. "फ्यू-शॉट" परिचय (एक चीट शीट)

आमतौर पर, रोबोट को वस्तुओं को पहचानने के लिए हजारों लेबल वाली तस्वीरों को दिखाने की आवश्यकता होती है। यह एक शिक्षक को फोटो एल्बम में हर कार के चारों ओर घेरा बनाने के लिए वर्षों बिताने के लिए रखने जैसा है।

OC-STORM अलग है। आपको केवल रोबोट को 6 से 12 फ्रेम (वीडियो के कुछ सेकंड) दिखाने की आवश्यकता है और कहना है, "हे, वह खिलाड़ी है, और वह बॉस है।"

  • जादू: रोबोट एक पूर्व-प्रशिक्षित "विज़न असिस्टेंट" (जैसे कि हमारे पास पहले से मौजूद एक सुपर-स्मार्ट कैमरा ऐप) का उपयोग करता है ताकि भविष्य के हर फ्रेम में इन वस्तुओं को तुरंत पहचाना जा सके, भले ही वे हिलें, आकार बदलें या टकराएं। उसे यह दोबारा सीखने की आवश्यकता नहीं है कि एक "बॉस" कैसा दिखता है; वह बस उस चीट शीट को याद रखता है।

2. "इमेजिनेशन" इंजन (एक सिम्युलेटर)

एक बार जब रोबोट जान जाता है कि महत्वपूर्ण पात्र कौन हैं, तो वह गेम का एक मानसिक मॉडल बनाता है।

  • पुराना रोबोट: "यदि मैं बाईं ओर चलता हूँ, तो पूरी स्क्रीन बाईं ओर खिसक जाएगी, जिसमें बादल और मिट्टी भी शामिल हैं।" (बहुत अधिक डेटा प्रोसेस करना)।
  • OC-STORM: "यदि मैं बाईं ओर चलता हूँ, तो प्लेयर बाईं ओर जाएगा, और बॉस कूद सकता है। बादलों से कोई फर्क नहीं पड़ता।"

यह अपने दिमाग में एक सरलीकृत, फास्ट-फॉरवर्ड सिमुलेशन बनाता है। यह भविष्यवाणी करता है: "यदि मैं अभी हमला करता हूँ, तो बॉस चकमा देगा, और मुझे नुकसान पहुँचेगा।" क्योंकि यह केवल महत्वपूर्ण पात्रों को ट्रैक कर रहा है, यह पुराने रोबोट द्वारा एक सिमुलेशन करने के समय में हजारों परिदृश्यों का अनुकरण कर सकता है।

3. परिणाम: प्रकाश की गति से सीखना

क्योंकि रोबोट बैकग्राउंड पर ऊर्जा बर्बाद नहीं कर रहा है, इसलिए वह बहुत तेज़ी से सीखता है।

  • अटारी गेम्स में: इसने केवल 100,000 फ्रेम (डेटा की एक बहुत छोटी मात्रा) का उपयोग करके पिछले रोबोट्स से बेहतर प्रदर्शन करते हुए सीखा।
  • हॉलो नाइट में: यह एक कठिन गेम है जिसमें जटिल, अस्त-व्यस्त ग्राफिक्स हैं। पुराने रोबोट विजुअल अराजकता के कारण भ्रमित होकर बॉस को हराने में विफल रहे। OC-STORM ने, केवल लड़ाकों पर ध्यान केंद्रित करके, प्रभावी ढंग से बचने और हमला करने का कौशल सीखा, और अन्य सभी की तुलना में बहुत कम प्रयासों में बॉस को हराया।

बड़ी तस्वीर

पुराने तरीके को एक कार चलाने को सीखने के रूप में सोचें जहाँ आप गुजरने वाले हर पेड़ के रंग को याद करने की कोशिश कर रहे हैं।
OC-STORM उन चश्मों को पहनने जैसा है जो केवल सड़क, अन्य कारों और ट्रैफिक लाइट को हाईलाइट करते हैं। यह पेड़ों को अनदेखा कर देता है।

वस्तुओं (एक्टर्स) पर ध्यान केंद्रित करके जो महत्वपूर्ण हैं, न कि उन पिक्सेल्स पर जो महत्वपूर्ण नहीं हैं (बैकग्राउंड), यह नई विधि AI को बहुत कम अभ्यास के साथ जटिल कार्यों को सीखने की अनुमति देती है, जो इसे सेल्फ-ड्राइविंग कारों या रोबोट सहायकों जैसे वास्तविक दुनिया के अनुप्रयोगों के लिए एक बड़ा कदम बनाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →