From Checklists to Clusters: A Homeostatic Account of AGI Evaluation
यह शोध पत्र तर्क देता है कि एजीआई (AGI) का मूल्यांकन सममित डोमेन स्कोर के एक स्थिर योग के रूप में नहीं, बल्कि एक होमियोस्टैटिक प्रॉपर्टी क्लस्टर (homeostatic property cluster) के रूप में किया जाना चाहिए, जो नए मेट्रिक्स का प्रस्ताव करता है जो डोमेन को उनके कारण संबंधी केंद्रीयता (causal centrality) द्वारा भारित करते हैं और टिकाऊ बुद्धिमत्ता को भंगुर प्रदर्शन से अलग करने के लिए तनाव के तहत क्षमताओं की निरंतरता को मापते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप यह समझने की कोशिश कर रहे हैं कि किसी व्यक्ति को "बुद्धिमान" क्या बनाता है। लंबे समय से, वैज्ञानिकों ने लोगों को विभिन्न कार्यों की एक विशाल सूची देकर इसे मापने की कोशिश की है—जैसे गणित की पहेलियाँ सुलझाना, कहानियाँ याद रखना, आकृतियों में पैटर्न पहचानना, या भाषा को समझना। वे इन्हें "डोमेन" (क्षेत्र) कहते हैं। विचार यह है कि यदि आप इन सभी में अच्छा प्रदर्शन करते हैं, तो आपकी बुद्धि उच्च है। लेकिन इसमें एक पेच है: जब हम ये परीक्षण देते हैं, तो हम आमतौर पर हर एक कार्य को इस तरह देखते हैं जैसे कि वे सभी समान रूप से महत्वपूर्ण हों। यह एक छात्र को ग्रेड देने जैसा है जहाँ उनके जूते के फीते बाँधने की क्षमता को उतनी ही अहमियत दी जाती है जितनी कि उनकी कविता लिखने की क्षमता को। इसके अलावा, ये परीक्षण आमतौर पर "स्नैपशॉट" (एक क्षणिक झलक) होते हैं। आप एक बार परीक्षण देते हैं, एक स्कोर प्राप्त करते हैं, और बस। आपको यह नहीं पता कि क्या छात्र अगले सप्ताह भी पहेली सुलझाने में सक्षम होगा, या क्या वह बिखर जाएगा यदि आप परीक्षण को थोड़ा कठिन बना दें या दोबारा प्रयास करने से पहले कुछ दिन का समय ले लें।
यही आर्टिफिशियल जनरल इंटेलिजेंस (AGI) मूल्यांकन की दुनिया है। AGI एक ऐसा कंप्यूटर बनाने का सपना है जो इंसान की तरह स्मार्ट और लचीला हो, जो किसी भी स्थिति में सीखने और समस्याओं को हल करने में सक्षम हो, न कि केवल उसी के लिए जिसे उसके लिए प्रोग्राम किया गया है। अभी, शोधकर्ता इन AI सिस्टमों का परीक्षण उन्हीं "स्नैपशॉट" चेकलिस्ट का उपयोग करके कर रहे हैं। लेकिन यदि हम जानना चाहते हैं कि क्या कोई AI वास्तव में "सामान्यतः" बुद्धिमान है, तो हमें यह जानने की आवश्यकता है कि उसकी बुद्धिमत्ता वास्तविक और स्थायी है, या केवल एक भाग्यशाली चाल है जो तनावपूर्ण स्थितियों में टूट जाती है। यह शोध पत्र एक बड़ा सवाल पूछता है: हम केवल अंक गिनना कैसे बंद कर सकते हैं और एक मशीन के मस्तिष्क की स्थिरता को मापना कैसे शुरू कर सकते हैं?
इस शोध पत्र के लेखक सुझाव देते हैं कि वर्तमान में AI का परीक्षण करने का तरीका एक कार को केवल एक धूप वाले दिन सीधे रास्ते पर कितनी तेज़ चला सकती है, इसके आधार पर आंकने जैसा है। यह तेज़ दिख सकती है, लेकिन यह हमें यह नहीं बताता कि ऊबड़-खाबड़ सड़क पर इंजन कैसा प्रदर्शन करेगा या बारिश होने पर ब्रेक काम करेंगे या नहीं। उनका तर्क है कि वास्तविक बुद्धिमत्ता—चाहे वह मानव हो या मशीन—केवल कौशलों की एक सूची नहीं है। इसके बजाय, यह एक होमियोस्टैटिक प्रॉपर्टी क्लस्टर (homeostatic property cluster) की तरह है। यह कहने का एक भारी-भरकम तरीका है कि यह क्षमताओं का एक समूह है जो आपस में इसलिए जुड़े रहते हैं क्योंकि आंतरिक तंत्र उन्हें जोड़े रखते हैं, भले ही चीजें कितनी भी अस्त-व्यस्त या परिवर्तनशील क्यों न हो जाएं।
सोचिए कि बुद्धिमत्ता एक अच्छी तरह से बनी हुई अलाव (कैंपफायर) की तरह है। "डोमेन" (गणित, भाषा, तर्क) लकड़ी के लट्ठे हैं। लेकिन आग स्वयं वह गर्मी और लौ है जो उन सभी लट्ठों को एक साथ जलाए रखती है। यदि आप केवल लट्ठे (कौशल) जमा करते हैं लेकिन उन्हें जलाए रखने के लिए (होमियोस्टैटिक भाग) तंत्र नहीं रखते हैं, तो एक छोटा सा झोंका (तनाव या देरी) आग को बुझा देगा। शोध पत्र सुझाव देता है कि वर्तमान परीक्षण केवल यह जाँचते हैं कि लट्ठे वहाँ हैं या नहीं, लेकिन वे इस बात की अनदेखी करते हैं कि क्या आग हवा के झोंके में जीवित रह सकती है।
लेखक इस समस्या को ठीक करने के लिए दो मुख्य बदलावों का प्रस्ताव करते हैं। पहला, वे कहते हैं कि हमें हर परीक्षण प्रश्न को समान रूप से महत्वपूर्ण नहीं मानना चाहिए। ठीक वैसे ही जैसे कुछ लट्ठे अधिक घने और अधिक गर्मी पैदा करने वाले होते हैं, कुछ कौशल अधिक "केंद्रीय" होते हैं जो पूरे अस्तित्व को स्थिर बनाए रखने में मदद करते हैं। वे एक नई स्कोरिंग पद्धति का सुझाव देते हैं जिसे सेंट्रैलिटी-प्रायर स्कोर (centrality-prior score) कहा जाता है। यह परीक्षणों को इस आधार पर भार देगा कि एक विशिष्ट कौशल पूरे सिस्टम को स्थिर रखने में कितनी मदद करता है, जो मानव बुद्धि के अध्ययन के तरीकों से प्रेरित है। यह एक छात्र को उसके नए चीजें सीखने की क्षमता के लिए उसके एक तथ्य को याद रखने की क्षमता से अधिक अधिक महत्व देने जैसा है।
दूसरा, वे एक बार के स्नैपशॉट पर निर्भर रहना बंद करना चाहते हैं। इसके बजाय, वे एक क्लस्टर स्टेबिलिटी इंडेक्स (Cluster Stability Index) का प्रस्ताव करते हैं। यह केवल एक बार उच्च स्कोर प्राप्त करने के बारे में नहीं है; यह यह साबित करने के बारे la कि AI समय के साथ और दबाव में भी उस स्कोर को बनाए रख सकता है। वे AI का तीन विशिष्ट तरीकों से परीक्षण करने का सुझाव देते हैं:
- प्रोफाइल पर्सिस्टेंस (Profile Persistence): क्या AI दिनों या हफ्तों बाद भी चीजें करना याद रखता है?
- ड्यूरेबल लर्निंग (Durable Learning): यदि आप उसे कुछ नया सिखाते हैं, तो क्या वह टिकता है, या वह तुरंत भूल जाता है?
- एरर करेक्शन (Error Correction): यदि AI कोई गलती करता है, तो क्या वह क्रैश हुए बिना खुद को सुधार सकता है?
यह शोध पत्र यह दावा नहीं करता है कि हमने अभी तक कोई आदर्श परीक्षण नहीं बनाया है या हमने AGI को मापने की समस्या को हल नहीं कर लिया है। इसके बजाय, लेखक सुझाव देते हैं कि ये नए तरीके बेहतर होंगे। वे प्रयोगशालाओं को इन विचारों को आज़माने के लिए एक ब्लूप्रिंट प्रदान करते हैं। वे प्रस्तावित करते हैं कि ये परीक्षण तब भी किए जा सकते हैं जब प्रयोगशालाओं को यह पता न हो कि AI अंदर से कैसे बना है (एक "ब्लैक-बॉक्स" दृष्टिकोण)। वे कुछ भविष्यवाणियां भी करते हैं कि यदि हम इन नए परीक्षणों का उपयोग करते हैं तो क्या होगा, जिससे पता चलता है कि कई वर्तमान AI सिस्टम बहुत अलग दिखेंगे—शायद कम "सामान्यतः" बुद्धिमान और अधिक नाजुक—एक बार जब हम स्थिरता और तनाव प्रतिरोध की जांच करना शुरू करेंगे।
संक्षेप में, शोध पत्र का तर्क है कि हमें बॉक्स टिक करने से हटकर यह देखने की ओर बढ़ना चाहिए कि क्या आग जलती रहती है। महत्वपूर्ण कौशलों को अधिक भार देकर और यह परीक्षण करके कि क्या AI देरी और गलतियों को संभाल सकता है, हम अंततः एक स्पष्ट तस्वीर प्राप्त कर सकते हैं कि क्या कोई मशीन वास्तव में स्मार्ट है या केवल दिखावा कर रही है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।