COGITAO: A Visual Reasoning Framework To Study Compositionality & Generalization
यह शोध पत्र COGITAO को प्रस्तुत करता है, जो एक ओपन-सोर्स, मॉड्यूलर फ्रेमवर्क और बेंचमार्क है जो सीखी गई अवधारणाओं को संयोजित करने और नवीन परिवेशों में सामान्यीकरण करने में वर्तमान अत्याधुनिक मॉडलों की सीमाओं का व्यवस्थित रूप से अध्ययन और प्रदर्शन करने के लिए लाखों अद्वितीय, नियम-आधारित दृश्य कार्यों (visual tasks) को उत्पन्न करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को अपना कमरा साफ करना सिखा रहे हैं। आप उसे एक मोजा उठाने और उसे टोकरी में रखने का तरीका दिखाते हैं। आप उसे एक किताब उठाने और उसे शेल्फ पर रखने का तरीका दिखाते हैं।
यदि रोबोट वास्तव में स्मार्ट है, तो वह यह समझ जाना चाहिए कि एक मोजा कैसे उठाया जाए और फिर उसे शेल्फ पर कैसे रखा जाए, या एक किताब कैसे उठाई जाए और फिर उसे टोकरी में कैसे डाला जाए, भले ही आपने उसे विशेष रूप से वे सटीक संयोजन कभी न दिखाए हों। कौशल के इस तरह के मिश्रण और मिलान करने की क्षमता को कंपोजिशनल जनरलाइजेशन (compositional generalization) कहा जाता है। यह मानव बुद्धि की एक सुपरपावर है, लेकिन आर्टिफिशियल इंटेलिजेंस (AI) के लिए, यह कुत्ते को कैलकुलस सिखाने जैसा है।
यह पेपर COGITAO नामक एक नया टूल पेश करता है (एक लंबा नाम, तो चलिए इसे "लेगो लैब" कहते हैं) जिसे ठीक इसी चीज़ का परीक्षण करने के लिए डिज़ाइन किया गया है कि AI इस तरह के मिश्रण और मिलान में कितना अच्छा है।
समस्या: AI एक "पैटर्न मैचर" है, "विचारक" नहीं
वर्तमान AI मॉडल (जैसे कि चैटबॉट्स या इमेज जेनरेटर को चलाने वाले मॉडल) पैटर्न याद करने में अविश्वसनीय रूप से अच्छे हैं। यदि आप उन्हें बिल्ली की दस लाख तस्वीरें दिखाते हैं, तो वे बिल्ली को पहचान सकते हैं। लेकिन यदि आप उनसे कुछ थोड़ा नया करने के लिए कहते—जैसे कि "बिल्ली को घुमाएं और फिर उसे नीला बनाएं"—तो वे अक्सर भ्रमित हो जाते हैं। वे केवल वही करने की कोशिश करते हैं जो उन्होंने पहले देखा है, बजाय इसके कि वे कार्यों को संयोजित करने के नियमों को वास्तव में समझें।
शोधकर्ताओं ने इस परीक्षण के लिए एक ऐसा तरीका चाहते थे जो वास्तविक दुनिया की अव्यवस्था (जैसे खराब रोशनी या बिखरे हुए कमरे) से मुक्त हो। उन्हें एक स्वच्छ, नियंत्रित वातावरण की आवश्यकता थी।
समाधान: "लेगो लैब" (COGITAO)
COGITAO को ग्रिड्स (ग्राफ पेपर की तरह) से बने एक विशाल, अनंत डिजिटल सैंडबॉक्स के रूप में सोचें।
- वस्तुएं (Objects): असली बिल्लियों या कारों के बजाय, AI रंगीन पिक्सेल से बनी सरल आकृतियाँ (वर्ग, वृत्त, अजीब आकार) देखता है।
- क्रियाएं (Actions): शोधकर्ताओं ने 28 सरल चालों का एक "टूलबॉक्स" बनाया है। आप एक आकृति को घुमा (rotate) सकते हैं, उसे ऊपर खिसका (move) सकते हैं, उसे पलट (flip) सकते हैं, उसका रंग बदल (change color) सकते हैं, या उसका एक हिस्सा काट (cut) सकते हैं।
- खेल: AI को एक "इनपुट ग्रिड" (आकृतियों की एक तस्वीर) और एक "नियम" (चालों की एक सूची, जैसे "90 डिग्री घुमाएं, फिर ऊपर ले जाएं") दिया जाता है। इसे "आउटपुट ग्रिड" बनाना होता है (कि चालों के बाद तस्वीर कैसी दिखेगी)।
COGITAO की खासियत यह है कि यह लाखों अद्वितीय पहेलियाँ बना सकता है। यह नियमों को आसान बना सकता है (बस एक आकृति को हिलाना) या अविश्वसनीय रूप से कठिन (तीन आकृतियों को घुमाना, दो को पलटना, और उन सभी के रंगों को एक विशिष्ट क्रम में बदलना)।
प्रयोग: AI के मस्तिष्क का परीक्षण
शोधकर्ताओं ने कई अत्याधुनिक AI मॉडलों को लिया (कुछ विजन के लिए डिज़ाइन किए गए, कुछ भाषा के लिए, कुछ स्टेप-बाय-स्टेप "सोचने" के लिए) और उन्हें COGITAO लैब में डाला।
उन्होंने दो मुख्य प्रकार के परीक्षण चलाए:
"मिक्स-एंड-मैच" टेस्ट (कंपोजिशनल जनरलाइजेशन):
- ट्रेनिंग: AI अलग से "घुमाना" (Rotate) और "ऊपर ले जाना" (Move Up) सीखता है। वह "घुमाएं और फिर ऊपर ले जाएं" भी सीखता है।
- टेस्ट: AI को "ऊपर ले जाएं और फिर घुमाएं" करने के लिए कहा जाता है।
- परिणाम: भले ही AI दोनों चालों को पूरी तरह से जानता था, लेकिन जब उसे क्रम बदलने के लिए कहा गया, तो वह बुरी तरह विफल रहा। यह एक ऐसे शेफ की तरह था जो प्याज काटने और अंडे तलने का तरीका जानता है, लेकिन जब उससे अंडा पहले तलने और फिर प्याज काटने के लिए कहा गया, तो उसने प्याज तल दिया और अंडा काट दिया।
"नया वातावरण" टेस्ट (सिस्टमैटिक जनरलाइजेशन):
- ट्रेनिंग: AI एक छोटे 10x10 ग्रिड पर 2 आकृतियों को हिलाना सीखता है।
- टेस्ट: AI को एक बड़े 20x20 ग्रिड पर 10 आकृतियों को हिलाने के लिए कहा जाता है।
- परिणाम: AI भ्रमित हो गया। वह अपने तर्क को स्केल नहीं कर सका। यह किसी को पार्किंग लॉट में गाड़ी चलाना सिखाने और फिर तुरंत हाईवे पर फॉर्मूला 1 कार चलाने की उम्मीद करने जैसा है।
बड़ी हैरानी: "ज़िद" (Stubbornness)
पेपर में यह जानकर बहुत आश्चर्य हुआ कि AI कैसे विफल हुआ। उन्होंने इसे "स्टबर्ननेस" (Stubbornness) कहा।
जब AI के सामने एक नई, कठिन पहेली आती है, तो वह नए नियमों को समझने की कोशिश नहीं करता। इसके बजाय, वह मौजूदा निर्देशों को अनदेखा कर देता है और वही करता है जिसके लिए उसे सबसे अधिक प्रशिक्षित किया गया था।
- उदाहरण: यदि AI को ज्यादातर "दाएं ले जाएं" (Move Right) पर प्रशिक्षित किया गया था, और आपने इसे "बाएं ले जाएं" (Move Left) करने के लिए कहा, तो यह अक्सर फिर भी "दाएं ही जाएगा"। यह नया नियम सीखने के लिए बहुत आलसी था और अपने पुराने व्यवहार पर ही टिक गया।
यह क्यों मायने रखता है?
आप सोच सकते हैं, "तो क्या हुआ? यह सिर्फ एक ग्रिड गेम है।"
लेकिन यह AI के भविष्य के लिए बहुत बड़ी बात है।
- वास्तविक दुनिया के रोबोट: यदि एक रोबोट "फ्रिज खोलना" और "दूध लेना" अलग-अलग नहीं सीख सकता, और फिर उन्हें मिलाकर "फ्रिज से दूध निकालना" नहीं सीख सकता, तो वह एक वास्तविक घर में उपयोगी कभी नहीं होगा।
- वास्तविक बुद्धिमत्ता: मनुष्य कुछ बुनियादी अवधारणाएं सीख सकते हैं और उन्हें अनंत तरीकों से संयोजित कर सकते हैं। वर्तमान AI याद रखने के एक लूप में फंसा हुआ है। COGITAO साबित करता है कि केवल AI को बड़ा बनाना या उसे अधिक डेटा पर प्रशिक्षित करना ही समाधान नहीं है। हमें ऐसा AI बनाने की आवश्यकता है जो वास्तव में विचारों को संयोजित करना समझता हो, न कि केवल उन्हें कॉपी करना।
निष्कर्ष (The Takeaway)
COGITAO AI की मानव जैसी तर्क शक्ति के लिए एक स्ट्रेस टेस्ट की तरह है। यह हमें दिखाता है कि हालांकि हमारा वर्तमान AI एक शानदार याद रखने वाला (memorizer) है, लेकिन यह अभी भी एक बहुत बुरा "संयोजक" (combinator) है। यह नए समस्याओं को हल करने के लिए अपने कौशल को मिक्स और मैच नहीं कर सकता।
पेपर यह निष्कर्ष निकालता है कि जब तक हम ऐसा AI नहीं बना लेते जो COGITAO टेस्ट पास कर सके, तब तक हम वास्तव में मनुष्यों की तरह सोचने वाली मशीनों से बहुत दूर हैं। हम स्मार्ट तोते बना रहे हैं जो वही दोहरा सकते हैं जो उन्होंने सुना है, लेकिन हमने अभी तक वे विचारक नहीं बनाए हैं जो अपने स्वयं के गीत लिख सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।