← नवीनतम पेपर
🤖 AI

Causal Object-Centric Models for Planning with Monte Carlo Tree Search

यह शोध पत्र COMET को प्रस्तुत करता है, जो एक मॉडल-आधारित सुदृढीकरण अधिगम (reinforcement learning) एल्गोरिदम है जो एक फ्रोजन ऑब्जेक्ट-सेंट्रिक एनकोडर को एक्शन-स्लॉट फ्यूजन और ऑब्जेक्ट-कॉज़ल अटेंशन वाले ट्रांसफार्मर-आधारित वर्ल्ड मॉडल के साथ जोड़कर मोंटे कार्लो ट्री सर्च प्लानिंग को बेहतर बनाता है, जिसके परिणामस्वरूप मौजूदा बेसलाइनों की तुलना में विविध दृश्य और गतिशील कार्यों में उत्कृष्ट प्रारंभिक-चरण प्रदर्शन प्राप्त होता है।

मूल लेखक: Rodion Vakhitov, Leonid Ugadiarov, Alexey Skrynnik, Aleksandr Panov

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rodion Vakhitov, Leonid Ugadiarov, Alexey Skrynnik, Aleksandr Panov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल वीडियो गेम खेलना या कोई पहेली सुलझाना सिखाने की कोशिश कर रहे हैं। सबसे बड़ी चुनौती केवल रोबोट को यह बताना नहीं है कि उसे क्या करना है, बल्कि उसे यह समझने में मदद करना है कि एक अराजक दृश्य में क्या मायने रखता है

यह पेपर COMET (Causal Object-centric Model for Efficient Tree search) नामक एक नया AI सिस्टम पेश करता है। COMET को एक ऐसे रोबोट के रूप में सोचें जो केवल एक तस्वीर को पिक्सेल के विशाल, धुंधले ढेर के रूप में नहीं देखता। इसके बजाय, वह दुनिया को अलग-अलग पात्रों और प्रॉप्स (सामान) के संग्रह के रूप में देखता है, जैसे एक निर्देशक मंच पर अभिनेताओं और फर्नीचर को देखता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. "स्लॉट" प्रणाली: अराजकता को छाँटना

अधिकांश AI सिस्टम एक छवि को देखते हैं और एक साथ पूरी चीज़ को समझने की कोशिश करते हैं। COMET अलग है। यह छवि को "स्लॉट्स" में तोड़ देता है।

  • उपमा: एक व्यस्त रसोई की कल्पना करें। एक सामान्य AI बर्तनों, पैन और सामग्रियों के एक विशाल ढेर को देखता है जो सब आपस में मिले हुए हैं। COMET एक 'सू-शेफ' (sous-chef) की तरह काम करता है जो तुरंत हर चीज़ को अलग-अलग कटोरे में छाँट देता है: प्याज के लिए एक कटोरा, चाकू के लिए एक, और चूल्हे के लिए एक।
  • यह कैसे काम करता है: COMET इन व्यक्तिगत वस्तु "स्लॉट्स" में दुनिया को अलग करने के लिए एक विशेष "फ्रोजन" (पूर्व-प्रशिक्षित और अपरिवर्तनीय) टूल का उपयोग करता है। इसे यह सीखने की ज़रूरत नहीं है कि ऐसा कैसे किया जाए; यह इसे स्वचालित रूप से करता है।

2. "मानसिक मूवी" (वर्ल्ड मॉडल)

एक बार जब COMET अपने "स्लॉट्स" में वस्तुओं को छाँट लेता है, तो उसे अपना अगला कदम तय करने की आवश्यकता होती है। यह एक "मानसिक सिमुलेशन" चलाकर ऐसा करता है।

  • उपमा: इससे पहले कि आप वास्तव में एक कप की ओर हाथ बढ़ाएं, आप कल्पना कर सकते हैं कि, "यदि मैं हैंडल पकड़ता हूँ, तो कप ऊपर उठेगा।" COMET भी यही करता है, लेकिन अपने प्रत्येक "स्लॉट" के लिए। यह एक मानसिक मूवी चलाता है कि आगे क्या होगा।
  • ट्विस्ट: कई AI सिस्टम में, क्रिया (जैसे "पकड़ना") पूरे विश्व को भेजी जाने वाली एक एकल कमांड होती है। COMET एक चतुर तकनीक का उपयोग करता है जिसे Action-Slot Fusion कहा जाता है। यह "पकड़ने" के कमांड को विशेष रूप से "कप" स्लॉट से जोड़ देता है, जबकि "चूल्हे" के स्लॉट को अनदेखा कर देता है। यह पूरी भीड़ को आदेश चिल्लाने के बजाय, मंच पर मौजूद किसी विशिष्ट अभिनेता को विशिष्ट निर्देश देने जैसा है।

3. "फोकस फ़िल्टर" (कॉज़ल अटेंशन)

यही COMET का सबसे स्मार्ट हिस्सा है। एक जटिल दृश्य में, हर वस्तु महत्वपूर्ण नहीं होती। यदि आप एक खेल खेल रहे हैं जहाँ आपको एक लाल ब्लॉक को धकेलना है, तो नीला ब्लॉक और पृष्ठभूमि के पेड़ मायने नहीं रखते।

  • उपमा: कल्पना कीजिए कि आप एक भीड़ भरे कमरे में किसी एक व्यक्ति को बोलने की कोशिश कर रहे हैं। एक सामान्य AI एक ही समय में सभी को सुनने की कोशिश करता है, जो भ्रमित करने वाला होता है। COMET के पास एक "फोकस फ़िल्टर" है। यह सभी को एक "प्रासंगिकता स्कोर" (relevance score) देता है। यह उस व्यक्ति की आवाज़ तेज़ कर देता है जिसे आपको सुनने की ज़रूरत है (लाल ब्लॉक) और बाकी सभी (पेड़, नीला ब्लॉक) की आवाज़ शून्य कर देता है।
  • परिणाम: जब COMET निर्णय लेता है, तो वह केवल उन वस्तुओं पर ध्यान देता है जो वास्तव में परिणाम को प्रभावित करती हैं। यह इसे बहुत तेज़ और स्मार्ट बनाता है।

4. "ट्री सर्च" (योजना बनाना)

यह तय करने के लिए कि क्या करना है, COMET मोंटे कार्लो ट्री सर्च (MCTS) का उपयोग करता है।

  • उपमा: एक शतरंज खिलाड़ी की तरह आगे की सोचें। वे सोचते हैं, "यदि मैं यहाँ चलता हूँ, तो प्रतिद्वंद्वी वहाँ चल सकता है। यदि वे ऐसा करते हैं, तो मैं वहाँ जा सकता हूँ..." वे संभावनाओं का एक पेड़ (tree) बनाते हैं।
  • COMET का संस्करण: धुंधली छवियों के बजाय, COMET अपने साफ "ऑब्जेक्ट स्लॉट्स" का उपयोग करके इस पेड़ का निर्माण करता है। यह अपने दिमाग में हजारों भविष्य के परिदृश्यों का अनुकरण करता है, लेकिन क्योंकि यह केवल महत्वपूर्ण वस्तुओं को ट्रैक कर रहा है, यह अन्य सिस्टमों की तुलना में इसे बहुत अधिक कुशलता से कर सकता है।

उन्होंने क्या पाया?

शोधकर्ताओं ने COMET का परीक्षण आठ अलग-अलग कार्यों पर किया, जिसमें सरल 2D पहेलियों से लेकर जटिल 3D रोबोटिक आर्म मूवमेंट और वीडियो गेम परिदृश्य (जैसे राक्षसों से एक रेखा की रक्षा करना) तक शामिल थे।

  • परिणाम: COMET ने अन्य प्रणालियों की तुलना में तेज़ी से सीखा, विशेष रूप से प्रशिक्षण के शुरुआती चरणों में।
  • यह क्यों मायने रखता है: इसने साबित कर दिया कि AI को दुनिया को अलग-अलग, परस्पर क्रिया करने वाली वस्तुओं (एक एकल छवि के बजाय) के रूप में देखने के लिए सिखाकर, AI कार्य को अधिक कुशलता से हल कर सकता है।

संक्षेप में: COMET एक ऐसा रोबोट है जो खेलों को खेलना इसलिए सीखता है क्योंकि वह पहले दुनिया को अलग-अलग टुकड़ों में छाँटता है, फिर मानसिक सिमुलेशन चलाता है जहाँ वह केवल उन्हीं टुकड़ों पर ध्यान देता है जो वास्तव में कार्य के लिए मायने रखते हैं। यह इसे एक बहुत अधिक कुशल शिक्षार्थी बनाता है क्योंकि यह एक साथ पूरी दुनिया को प्रोसेस करने वाले रोबोटों की तुलना में बेहतर काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →