← नवीनतम पेपर
🤖 AI

LPA-CWM: A Learned Physical Adjudicator for Motion Reasoning with Counterfactual World Models

यह शोध पत्र LPA-CWM प्रस्तुत करता है, जो एक विधि है जो एक हल्के Learned Physical Adjudicator का उपयोग करके काउंटरफैक्चुअल वर्ल्ड मॉडल प्रतिक्रियाओं को उनकी विश्वसनीयता के आधार पर गतिशील रूप से भारित करती है, जो यूनिफॉर्म एग्रीगेशन दृष्टिकोणों की तुलना में मोशन रीजनिंग और ट्रैकिंग सटीकता में महत्वपूर्ण सुधार करती है।

मूल लेखक: Kunwei Wu, Xiang Liu, Guocai Yao, Junming Chen, Zhikang Chen, Min Zhang, Pengwei Wang, Sen Cui

प्रकाशित 2026-09-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kunwei Wu, Xiang Liu, Guocai Yao, Junming Chen, Zhikang Chen, Min Zhang, Pengwei Wang, Sen Cui

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस के अध्ययन में, एक प्रमुख सीमा यह है कि मशीनों को न केवल यह समझाना कि कोई छवि कैसी दिखती है, बल्कि यह भी सिखाना कि उसके भीतर दुनिया कैसे चलती है। शोधकर्ताओं ने 'वर्ल्ड मॉडल्स' (world models) के रूप में जाने जाने वाले सिस्टम विकसित किए हैं, जो मूल रूप से ऐसे AI प्रोग्राम हैं जिन्हें वीडियो में आगे क्या होने वाला है, इसका पूर्वानुमान लगाने के लिए प्रशिक्षित किया गया है। यदि आप ऐसे मॉडल को मेज पर लुढ़कती हुई एक गेंद दिखाते हैं, तो वह अनुमान लगा सकता है कि एक सेकंड बाद गेंद कहाँ होगी। इस तकनीक का एक अधिक उन्नत संस्करण, जिसे 'काउंटरफैक्चुअल वर्ल्ड मॉडलिंग' (counterfactual world modeling) कहा जाता है, एक कदम आगे बढ़कर "क्या होगा यदि?" जैसा सवाल पूछता है। यह एक दृश्य में परिवर्तनों का अनुकरण करता है—जैसे कि किसी ऐसे हाथ की कल्पना करना जो उस वस्तु को पकड़ रहा है जो वास्तव में वहाँ नहीं है—यह देखने के लिए कि AI का पूर्वानुमान कैसे बदलता है। मूल पूर्वानुमान की तुलना बदले हुए पूर्वानुमान से करके, सिस्टम विशिष्ट वस्तुओं की गति को अलग कर सकता है। हालाँकि, यह प्रक्रिया जटिल है। क्योंकि AI परिवर्तन की कल्पना करने के कई अलग-अलग तरीके अपना सकता है, इसलिए यह अक्सर उत्तरों का एक भ्रमित करने वाला मिश्रण उत्पन्न करता है। कुछ अनुमान सटीक और स्पष्ट होते हैं, जबकि अन्य अस्पष्ट होते हैं या बैकग्राउंड के शोर से विचलित हो जाते हैं। अब तक, मानक दृष्टिकोण इन सभी अनुमानों का केवल औसत निकालना रहा है, जिसमें हर राय को समान रूप से वैध माना जाता है। यह अक्सर एक धुंधले परिणाम की ओर ले जाता है जहाँ वास्तविक गति शोर में खो जाती है।

एक टीम ने इन प्रतिस्पर्धी अनुमानों के लिए एक न्यायाधीश के रूप में कार्य करने वाली एक नई विधि पेश करके इस समस्या का समाधान किया है। उत्तरों का अंधाधुंध औसत निकालने के बजाय, उनका सिस्टम विश्वसनीयता के आधार पर उन्हें भार (weight) देने के लिए सीखता है। वे इस नए घटक को "लर्नड फिजिकल एडजुडिकेटर" (Learned Physical Adjudicator) कहते हैं। कल्पना कीजिए कि विशेषज्ञों का एक पैनल एक धुंधली तस्वीर को देखकर चलती हुई कार की पहचान करने की कोशिश कर रहा है। कुछ विशेषज्ञ पहियों पर ध्यान केंद्रित कर सकते हैं, कुछ प्रतिबिंब पर, और कुछ एक गुजरते हुए पेड़ से विचलित हो सकते हैं। पुराना तरीका उनके सभी विवरणों का औसत लेगा, जिससे संभवतः एक अर्थहीन धुंधलापन प्राप्त होगा। हालाँकि, नया तरीका यह पहचानने के लिए प्रशिक्षित है कि कौन सा विशेषज्ञ कार के सही हिस्से को देख रहा है और कौन विचलित हो रहा है। यह स्पष्ट और सुसंगत उत्तरों को उच्च महत्व देता है और भ्रमित होने वाले उत्तरों के प्रभाव को कम करता है। यह सिस्टम गति के एक बहुत स्पष्ट पथ को फिर से बनाने की अनुमति देता है, भले ही वस्तु आंशिक रूप से छिपी हो या तेजी से चल रही हो।

शोधकर्ताओं ने जानवरों के दौड़ने से लेकर लोगों द्वारा कार्य करने तक के वीडियो क्लिप्स के दो बड़े संग्रहों पर इस दृष्टिकोण का परीक्षण किया। उन्होंने अपने नए सिस्टम की तुलना साधारण औसत पद्धति और अन्य मौजूदा ट्रैकिंग तकनीकों से की। परिणामों ने एक महत्वपूर्ण सुधार दिखाया। एक डेटासेट पर, नए सिस्टम ने साधारण औसत पद्धति की तुलना में चलते हुए बिंदुओं को ट्रैक करने की सटीकता में साठ प्रतिशत का सुधार किया। दूसरे, अधिक जटिल डेटासेट पर, इसने सटीकता में उनतीस प्रतिशत का सुधार किया। सिस्टम विशेष रूप से कठिन स्थितियों में वस्तुओं का पीछा करने में अच्छा था, जैसे कि जब कोई वस्तु दृष्टि से क्षण भर के लिए ओझल हो जाती है या जब उसका स्वरूप नाटकीय रूप से बदल जाता है। यह पिछले तरीकों की तुलना में अधिक सुचारू और पूर्ण रूप से गति का अनुसरण करने में सक्षम रहा, और शायद ही कभी वस्तु को खोता या बैकग्राउंड की अन्य हलचल से विचलित होता।

यह सुनिश्चित करने के लिए कि ये सुधार वास्तविक थे और केवल संख्याओं का परिणाम नहीं थे, टीम ने सफलता को मापने का एक नया तरीका भी बनाया। पिछले परीक्षण अक्सर केवल यह देखते थे कि क्या सिस्टम ने एक क्षण में सही स्थान का अनुमान लगाया है। नया माप, जिसे शोधकर्ता "कम्प्लीटनेस-अवेयर प्रोटोकॉल" (completeness-aware protocol) कहते हैं, वस्तु की पूरी यात्रा की जाँच करता है। यह न केवल यह पूछता है कि क्या सिस्टम ने वस्तु को ढूँढ लिया, बल्कि यह भी कि क्या उसने हर उस क्षण उसे ढूँढना जारी रखा जब वह दृश्यमान थी, और क्या खींचा गया पथ निरंतर और अटूट था। इस सख्त परीक्षण के तहत, नया सिस्टम लगातार प्रतिस्पर्धा से बेहतर प्रदर्शन करता रहा, जो यह साबित करता है कि यह केवल कुछ अनुमानों के साथ भाग्यशाली नहीं है बल्कि गति के भौतिकी (physics) को बेहतर ढंग से समझता है।

यह सिस्टम एक छोटे, विशिष्ट न्यूरल नेटवर्क का उपयोग करके काम करता है जिसे चलती हुई वस्तुओं के हजारों सिंथेटिक वीडियो क्लिप्स पर प्रशिक्षित किया गया है। यह नेटवर्क एक चलती हुई वस्तु के आसपास के दृश्य संकेतों और मुख्य AI द्वारा बनाए गए विभिन्न अनुमानों के आकार को देखना सीखता है। इसके बाद यह तय करता है कि किन अनुमानों पर भरोसा किया जाए। महत्वपूर्ण बात यह है कि प्रारंभिक अनुमान उत्पन्न करने वाला मुख्य AI स्थिर और अपरिवर्तित रहता है; नया सिस्टम केवल यह सीखता है कि उसे प्राप्त आउटपुट की व्याख्या कैसे की जाए। यह दृष्टिकोण इस प्रकार कुशल और अनुकूलन योग्य बनता है। शोधकर्ताओं ने पाया कि इस छोटे जज नेटवर्क को भार (weights) तय करने देने से, सिस्टम उस गति को पुनः प्राप्त कर सका जो पहले खो गई थी। उन्होंने यह भी खोजा कि पुनर्मूल्यांकन के एक एकल दौर में, जहाँ सिस्टम अपने सबसे अच्छे अनुमान की एक बार फिर से जाँच करता है, अत्यधिक कंप्यूटिंग शक्ति की आवश्यकता के बिना परिणाम को परिष्कृत करने के लिए पर्याप्त था।

हालाँकि परिणाम मजबूत हैं, शोधकर्ता अपने कार्य की सीमाओं को नोट करने में सावधानी बरतते हैं। सिस्टम केवल उन्हीं अनुमानों का न्याय कर सकता है जो पहले से मौजूद हैं; यदि मुख्य AI शुरू में ही सही अनुमान उत्पन्न करने में विफल रहता है, तो जज उसे ठीक नहीं कर सकता। इसके अतिरिक्त, सिस्टम को सिंथेटिक डेटा पर प्रशिक्षित किया गया था, और हालांकि इसने वास्तविक दुनिया के वीडियो पर अच्छा प्रदर्शन किया, लेकिन हर संभावित परिदृश्य में इसके सामान्यीकरण (generalize) की क्षमता अभी भी खोजी जा रही है। टीम का सुझाव है कि भविष्य के कार्य शुरुआती अनुमानों के निर्माण में सुधार करने या जज को अधिक विविध, वास्तविक दुनिया के डेटा पर प्रशिक्षित करने पर केंद्रित हो सकते हैं। फिलहाल, हालाँकि, यह कार्य प्रदर्शित करता है कि AI को अपनी अनिश्चितता का आलोचनात्मक मूल्यांकन करने का तरीका देने से दुनिया में चीजों के चलने की बहुत स्पष्ट समझ विकसित होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →