CALIPER: Clean Scenes Cannot Rank Physical Inference in Pretrained Visual Representations
यह शोध पत्र CALIPER को प्रस्तुत करता है, जो एक अंशांकन-आधारित (calibration-based) बेंचमार्क है जो यह दर्शाता है कि मानक "स्वच्छ दृश्य" (clean scene) मूल्यांकन यह अंतर करने में विफल रहते हैं कि क्या पूर्व-प्रशिक्षित विज़ुअल एनकोडर वास्तव में द्रव्यमान और घर्षण जैसे भौतिक गुणों का अनुमान लगाते हैं, क्योंकि उनकी स्पष्ट क्षमता अक्सर वास्तविक भौतिक तर्क के बजाय सीधे पिक्सेल-स्तरीय संकेतों पर निर्भर करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मशीनों को बनाने के लिए जो वास्तविक दुनिया में चल सकें, वैज्ञानिक कंप्यूटरों को न केवल आकृतियों और रंगों को देखना, बल्कि उन छिपे हुए नियमों को भी समझना सिखा रहे हैं जो चीजों की गति को नियंत्रित करते हैं। जब एक रोबोट एक डिब्बे को धक्का देता है, तो उसके फिसलने की दूरी वजन और फर्श के बीच घर्षण जैसे अदृश्य कारकों पर निर्भर करती है। एक कंप्यूटर एक एकल तस्वीर में इन गुणों को सीधे नहीं देख सकता; एक हल्का डिब्बा और एक भारी डिब्बा तब तक बिल्कुल एक जैसे दिखते हैं जब तक कि उन्हें हिलाया न जाए। इस अंतर को पाटने के लिए, शोधकर्ता वीडियो के विशाल पुस्तकालयों पर प्रशिक्षित कृत्रिम बुद्धिमत्ता (AI) मॉडल का उपयोग करते हैं ताकि वे इन रोबोटों की आँखों के रूप में कार्य कर सकें। इन मॉडलों को दुनिया के भौतिक विज्ञान (फिजिक्स) को सीखने के लिए बनाया जाना चाहिए ताकि वे भविष्यवाणी कर सकें कि आगे क्या होगा। लेकिन वर्षों से, इन मॉडलों को ग्रेड देने के लिए उपयोग किए जाने वाले परीक्षण इतने सरल थे कि यह बताना मुश्किल था कि वे वास्तव में भौतिक विज्ञान सीख रहे हैं या केवल कैमरा कोणों को याद कर रहे हैं।
हाल ही में स्वतंत्र शोधकर्ताओं की एक टीम ने यह देखने के लिए एक नया प्रयोग किया कि क्या ये डिजिटल आँखें वास्तव में भौतिक दुनिया को समझ सकती हैं। उन्होंने एक सिमुलेशन तैयार किया जहाँ एक मानक पक्क (puck) अज्ञात वजन और घर्षण वाले डिब्बे से टकराता है। सबसे पहले, कंप्यूटर दो अभ्यास प्रहार देखता है जहाँ पक्क ज्ञात गति से डिब्बे से टकराता है, और डिब्बा एक विशिष्ट दूरी तक फिसलता है। ये अंशांकन (कैलिब्रेशन) के क्षण हैं, जो कंप्यूटर को डिब्बे के रहस्यों को सीखने का अवसर देते हैं। फिर, कंप्यूटर एक नई गति पर तीसरा प्रहार देखता है, लेकिन वीडियो ठीक उसी क्षण कट जाता है जब पक्क डिब्बे को छूता है। अब कंप्यूटर को यह अनुमान लगाना है कि डिब्बा कितनी दूर तक फिसलेगा, जो केवल उन पहले दो प्रहारों से सीखी गई जानकारी पर आधारित होगा। शोधकर्ताओं ने आठ अलग-अलग प्रकार के विजन सिस्टम का परीक्षण किया, जिनमें लाखों वीडियो पर प्रशिक्षित अत्यधिक उन्नत मॉडल से लेकर पूरी तरह से रैंडम, अप्रशिक्षित वेट्स वाला कंप्यूटर विजन सिस्टम शामिल था।
परिणामों ने यह खुलासा किया कि हम वर्तमान में इन मशीनों को आंकने के तरीके में एक चौंकाने वाली खामी है। जब शोधकर्ताओं ने एक पूरी तरह से साफ, स्थिर कमरे में एक निश्चित कैमरे के साथ परीक्षण किया, तो हर एक सिस्टम लगभग पूरी तरह से सफल रहा, जिसमें रैंडम वेट्स वाला सिस्टम भी शामिल था। कंप्यूटर को सही उत्तर पाने के लिए भौतिक विज्ञान समझने की आवश्यकता नहीं थी; इसने बस यह सीख लिया कि एक निश्चित कैमरा दृश्य में, किसी वस्तु की गति पिक्सेल का एक विशिष्ट पैटर्न बनाती है। क्योंकि कैमरा कभी नहीं हिला, कंप्यूटर ने बिना यह जाने कि डिब्बे का द्रव्यमान या घर्षण क्या है, स्क्रीन निर्देशांकों (कोऑर्डिनेट्स) से सीधे स्लाइड को माप लिया। यह एक ऐसे छात्र की तरह था जिसने एक विशिष्ट परीक्षा के लिए उत्तर कुंजी रट ली थी लेकिन यदि संख्याएँ बदल दी जातीं, तो वह समस्या हल नहीं कर पाता। शोधकर्ताओं ने पाया कि इस स्वच्छ वातावरण में, परीक्षण यह नहीं बता सका कि कौन सा मॉडल स्मार्ट है और कौन सा साधारण।
इसे ठीक करने के लिए, शोधकर्ताओं ने हर वीडियो क्लिप के लिए वातावरण बदल दिया। उन्होंने बेतरतीब ढंग से कैमरा एंगल बदला, रोशनी बदली, फर्श का रंग बदला और दृश्य में भटकाने वाली वस्तुएं जोड़ दीं। अचानक, पिक्सेल का पैटर्न जवाब नहीं दे सका। कंप्यूटर अब स्क्रीन निर्देशांकों पर निर्भर नहीं रह सकता था। इस अस्त-व्यस्त, अप्रत्याशित दुनिया में, परिणाम नाटकीय रूप से विभाजित हो गए। वीडियो की भविष्यवाणी करने के लिए प्रशिक्षित सबसे उन्नत मॉडल अभी भी अच्छा प्रदर्शन कर रहे थे, और उन्होंने स्लाइड की दूरी की उच्च सटीकता के साथ सही भविष्यवाणी की। हालाँकि, वे मॉडल जो सिंगल फ्रेम देखने पर निर्भर थे या जिनका कोई प्रशिक्षण नहीं था, पूरी तरह से विफल रहे। अप्रशिक्षित सिस्टम, जिसने साफ कमरे में लगभग सटीक स्कोर किया था, अब उस सिस्टम से बेहतर प्रदर्शन नहीं कर सका जिसने वस्तु को अनदेखा कर दिया था और केवल धक्का देने की गति के आधार पर अनुमान लगाया था।
अध्ययन ने यह भी जांचा कि अन्य वैज्ञानिकों द्वारा इन मॉडलों का परीक्षण कैसे किया जाता है। एक सामान्य विधि में दृश्य में एक गुण को बदलना शामिल है, जैसे किसी वस्तु को थोड़ा भारी बनाना, और यह देखना कि क्या कंप्यूटर का आंतरिक प्रतिनिधित्व बदलता है। शोधकर्ताओं ने पाया कि कई मौजूदा परीक्षणों में, परिवर्तन इतना सूक्ष्म था कि कंप्यूटर की प्रतिक्रिया केवल रैंडिक शोर (रैंडम नॉइज़) थी, जिसका अर्थ था कि परीक्षण वास्तव में कुछ भी नहीं माप रहा था। उन्होंने "प्रोब्स" (probes) को भी देखा, जो सरल परीक्षण हैं जो सीधे कंप्यूटर के मस्तिष्क से द्रव्यमान जैसे विशिष्ट गुण को पढ़ने की कोशिश करते हैं। उन्होंने पाया कि एक मॉडल प्रोब टेस्ट पास कर सकता है और ऐसा लग सकता है कि वह द्रव्यमान जानता है, फिर भी वास्तविक भविष्यवाणी करते समय उस ज्ञान का उपयोग करने में विफल रहता है। इसके विपरीत, एक मॉडल प्रोब टेस्ट में विफल हो सकता है लेकिन यदि दृश्य में अन्य संकेत उपलब्ध हों, तो वह जानकारी का प्रभावी ढंग से उपयोग कर सकता है। इससे सिद्ध हुआ कि केवल मॉडल की मेमोरी से किसी गुण को पढ़ पाना यह नहीं दर्शाता कि मॉडल वास्तव में दुनिया को समझने के लिए उसका उपयोग कर रहा है।
सफलता का अंतिम पैमाना एक व्यावहारिक कार्य था: कंप्यूटर को यह चुनने के लिए कहना कि डिब्बे को एक विशिष्ट लक्ष्य दूरी तक धकेलने के लिए सटीक गति क्या होनी चाहिए। बदलते परिवेश में, सर्वश्रेष्ठ मॉडल ने लक्ष्य से केवल 4.0 मिलीमीटर की चूक की। हालाँकि, अप्रशिक्षित मॉडल ने 19.6 मिलीमीटर की चूक की, जो वस्तु को पूरी तरह से अनदेखा करने वाले सिस्टम की विफलता दर के समान थी। शोधकर्ताओं ने निष्कर्ष निकाला कि एक परीक्षण की क्षमता को, जो अच्छे और बुरे मॉडलों के बीच अंतर कर सके, सिद्ध किया जाना चाहिए, न कि केवल मान लिया जाना चाहिए। यदि कोई परीक्षण एक परिष्कृत AI और एक रैंडम अनुमान लगाने वाले के बीच अंतर नहीं कर सकता, तो वह परीक्षण स्वयं टूटा हुआ है। वास्तविक दुनिया की अराजकता को पेश करके और कंप्यूटर को कई अंतःक्रियाओं से साक्ष्य का उपयोग करने की आवश्यकता देकर, नए तरीके ने सफलतापूर्वक यह प्रकट किया कि कौन से मॉडल गति के भौतिक विज्ञान को वास्तव में समझते हैं और कौन केवल पिक्सेल को देख रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।