← नवीनतम पेपर
💻 computer science

CALIPER: Clean Scenes Cannot Rank Physical Inference in Pretrained Visual Representations

यह शोध पत्र CALIPER को प्रस्तुत करता है, जो एक अंशांकन-आधारित (calibration-based) बेंचमार्क है जो यह दर्शाता है कि मानक "स्वच्छ दृश्य" (clean scene) मूल्यांकन यह अंतर करने में विफल रहते हैं कि क्या पूर्व-प्रशिक्षित विज़ुअल एनकोडर वास्तव में द्रव्यमान और घर्षण जैसे भौतिक गुणों का अनुमान लगाते हैं, क्योंकि उनकी स्पष्ट क्षमता अक्सर वास्तविक भौतिक तर्क के बजाय सीधे पिक्सेल-स्तरीय संकेतों पर निर्भर करती है।

मूल लेखक: Aman Mehta, Riya Baviskar

प्रकाशित 2026-09-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aman Mehta, Riya Baviskar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मशीनों को बनाने के लिए जो वास्तविक दुनिया में चल सकें, वैज्ञानिक कंप्यूटरों को न केवल आकृतियों और रंगों को देखना, बल्कि उन छिपे हुए नियमों को भी समझना सिखा रहे हैं जो चीजों की गति को नियंत्रित करते हैं। जब एक रोबोट एक डिब्बे को धक्का देता है, तो उसके फिसलने की दूरी वजन और फर्श के बीच घर्षण जैसे अदृश्य कारकों पर निर्भर करती है। एक कंप्यूटर एक एकल तस्वीर में इन गुणों को सीधे नहीं देख सकता; एक हल्का डिब्बा और एक भारी डिब्बा तब तक बिल्कुल एक जैसे दिखते हैं जब तक कि उन्हें हिलाया न जाए। इस अंतर को पाटने के लिए, शोधकर्ता वीडियो के विशाल पुस्तकालयों पर प्रशिक्षित कृत्रिम बुद्धिमत्ता (AI) मॉडल का उपयोग करते हैं ताकि वे इन रोबोटों की आँखों के रूप में कार्य कर सकें। इन मॉडलों को दुनिया के भौतिक विज्ञान (फिजिक्स) को सीखने के लिए बनाया जाना चाहिए ताकि वे भविष्यवाणी कर सकें कि आगे क्या होगा। लेकिन वर्षों से, इन मॉडलों को ग्रेड देने के लिए उपयोग किए जाने वाले परीक्षण इतने सरल थे कि यह बताना मुश्किल था कि वे वास्तव में भौतिक विज्ञान सीख रहे हैं या केवल कैमरा कोणों को याद कर रहे हैं।

हाल ही में स्वतंत्र शोधकर्ताओं की एक टीम ने यह देखने के लिए एक नया प्रयोग किया कि क्या ये डिजिटल आँखें वास्तव में भौतिक दुनिया को समझ सकती हैं। उन्होंने एक सिमुलेशन तैयार किया जहाँ एक मानक पक्क (puck) अज्ञात वजन और घर्षण वाले डिब्बे से टकराता है। सबसे पहले, कंप्यूटर दो अभ्यास प्रहार देखता है जहाँ पक्क ज्ञात गति से डिब्बे से टकराता है, और डिब्बा एक विशिष्ट दूरी तक फिसलता है। ये अंशांकन (कैलिब्रेशन) के क्षण हैं, जो कंप्यूटर को डिब्बे के रहस्यों को सीखने का अवसर देते हैं। फिर, कंप्यूटर एक नई गति पर तीसरा प्रहार देखता है, लेकिन वीडियो ठीक उसी क्षण कट जाता है जब पक्क डिब्बे को छूता है। अब कंप्यूटर को यह अनुमान लगाना है कि डिब्बा कितनी दूर तक फिसलेगा, जो केवल उन पहले दो प्रहारों से सीखी गई जानकारी पर आधारित होगा। शोधकर्ताओं ने आठ अलग-अलग प्रकार के विजन सिस्टम का परीक्षण किया, जिनमें लाखों वीडियो पर प्रशिक्षित अत्यधिक उन्नत मॉडल से लेकर पूरी तरह से रैंडम, अप्रशिक्षित वेट्स वाला कंप्यूटर विजन सिस्टम शामिल था।

परिणामों ने यह खुलासा किया कि हम वर्तमान में इन मशीनों को आंकने के तरीके में एक चौंकाने वाली खामी है। जब शोधकर्ताओं ने एक पूरी तरह से साफ, स्थिर कमरे में एक निश्चित कैमरे के साथ परीक्षण किया, तो हर एक सिस्टम लगभग पूरी तरह से सफल रहा, जिसमें रैंडम वेट्स वाला सिस्टम भी शामिल था। कंप्यूटर को सही उत्तर पाने के लिए भौतिक विज्ञान समझने की आवश्यकता नहीं थी; इसने बस यह सीख लिया कि एक निश्चित कैमरा दृश्य में, किसी वस्तु की गति पिक्सेल का एक विशिष्ट पैटर्न बनाती है। क्योंकि कैमरा कभी नहीं हिला, कंप्यूटर ने बिना यह जाने कि डिब्बे का द्रव्यमान या घर्षण क्या है, स्क्रीन निर्देशांकों (कोऑर्डिनेट्स) से सीधे स्लाइड को माप लिया। यह एक ऐसे छात्र की तरह था जिसने एक विशिष्ट परीक्षा के लिए उत्तर कुंजी रट ली थी लेकिन यदि संख्याएँ बदल दी जातीं, तो वह समस्या हल नहीं कर पाता। शोधकर्ताओं ने पाया कि इस स्वच्छ वातावरण में, परीक्षण यह नहीं बता सका कि कौन सा मॉडल स्मार्ट है और कौन सा साधारण।

इसे ठीक करने के लिए, शोधकर्ताओं ने हर वीडियो क्लिप के लिए वातावरण बदल दिया। उन्होंने बेतरतीब ढंग से कैमरा एंगल बदला, रोशनी बदली, फर्श का रंग बदला और दृश्य में भटकाने वाली वस्तुएं जोड़ दीं। अचानक, पिक्सेल का पैटर्न जवाब नहीं दे सका। कंप्यूटर अब स्क्रीन निर्देशांकों पर निर्भर नहीं रह सकता था। इस अस्त-व्यस्त, अप्रत्याशित दुनिया में, परिणाम नाटकीय रूप से विभाजित हो गए। वीडियो की भविष्यवाणी करने के लिए प्रशिक्षित सबसे उन्नत मॉडल अभी भी अच्छा प्रदर्शन कर रहे थे, और उन्होंने स्लाइड की दूरी की उच्च सटीकता के साथ सही भविष्यवाणी की। हालाँकि, वे मॉडल जो सिंगल फ्रेम देखने पर निर्भर थे या जिनका कोई प्रशिक्षण नहीं था, पूरी तरह से विफल रहे। अप्रशिक्षित सिस्टम, जिसने साफ कमरे में लगभग सटीक स्कोर किया था, अब उस सिस्टम से बेहतर प्रदर्शन नहीं कर सका जिसने वस्तु को अनदेखा कर दिया था और केवल धक्का देने की गति के आधार पर अनुमान लगाया था।

अध्ययन ने यह भी जांचा कि अन्य वैज्ञानिकों द्वारा इन मॉडलों का परीक्षण कैसे किया जाता है। एक सामान्य विधि में दृश्य में एक गुण को बदलना शामिल है, जैसे किसी वस्तु को थोड़ा भारी बनाना, और यह देखना कि क्या कंप्यूटर का आंतरिक प्रतिनिधित्व बदलता है। शोधकर्ताओं ने पाया कि कई मौजूदा परीक्षणों में, परिवर्तन इतना सूक्ष्म था कि कंप्यूटर की प्रतिक्रिया केवल रैंडिक शोर (रैंडम नॉइज़) थी, जिसका अर्थ था कि परीक्षण वास्तव में कुछ भी नहीं माप रहा था। उन्होंने "प्रोब्स" (probes) को भी देखा, जो सरल परीक्षण हैं जो सीधे कंप्यूटर के मस्तिष्क से द्रव्यमान जैसे विशिष्ट गुण को पढ़ने की कोशिश करते हैं। उन्होंने पाया कि एक मॉडल प्रोब टेस्ट पास कर सकता है और ऐसा लग सकता है कि वह द्रव्यमान जानता है, फिर भी वास्तविक भविष्यवाणी करते समय उस ज्ञान का उपयोग करने में विफल रहता है। इसके विपरीत, एक मॉडल प्रोब टेस्ट में विफल हो सकता है लेकिन यदि दृश्य में अन्य संकेत उपलब्ध हों, तो वह जानकारी का प्रभावी ढंग से उपयोग कर सकता है। इससे सिद्ध हुआ कि केवल मॉडल की मेमोरी से किसी गुण को पढ़ पाना यह नहीं दर्शाता कि मॉडल वास्तव में दुनिया को समझने के लिए उसका उपयोग कर रहा है।

सफलता का अंतिम पैमाना एक व्यावहारिक कार्य था: कंप्यूटर को यह चुनने के लिए कहना कि डिब्बे को एक विशिष्ट लक्ष्य दूरी तक धकेलने के लिए सटीक गति क्या होनी चाहिए। बदलते परिवेश में, सर्वश्रेष्ठ मॉडल ने लक्ष्य से केवल 4.0 मिलीमीटर की चूक की। हालाँकि, अप्रशिक्षित मॉडल ने 19.6 मिलीमीटर की चूक की, जो वस्तु को पूरी तरह से अनदेखा करने वाले सिस्टम की विफलता दर के समान थी। शोधकर्ताओं ने निष्कर्ष निकाला कि एक परीक्षण की क्षमता को, जो अच्छे और बुरे मॉडलों के बीच अंतर कर सके, सिद्ध किया जाना चाहिए, न कि केवल मान लिया जाना चाहिए। यदि कोई परीक्षण एक परिष्कृत AI और एक रैंडम अनुमान लगाने वाले के बीच अंतर नहीं कर सकता, तो वह परीक्षण स्वयं टूटा हुआ है। वास्तविक दुनिया की अराजकता को पेश करके और कंप्यूटर को कई अंतःक्रियाओं से साक्ष्य का उपयोग करने की आवश्यकता देकर, नए तरीके ने सफलतापूर्वक यह प्रकट किया कि कौन से मॉडल गति के भौतिक विज्ञान को वास्तव में समझते हैं और कौन केवल पिक्सेल को देख रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →