Assessing the Creativity of Large Language Models: Testing, Limits, and New Frontiers
यह शोध पत्र लेखन, अपसारी चिंतन (divergent thinking) और वैज्ञानिक विचारोन्मेष (scientific ideation) के क्षेत्र में लार्ज लैंग्वेज मॉडल (LLM) के प्रदर्शन की भविष्यवाणी करने के लिए मौजूदा मानव रचनात्मकता परीक्षणों का व्यवस्थित रूप से मूल्यांकन करता है, जो उनकी सीमित वैधता को प्रकट करता है और 'डाइवर्जेंट रिमोट एसोसिएशन टेस्ट' (DRAT) को पहले सुदृढ़ उपकरण के रूप में प्रस्तुत करता है जो अभिसारी (convergent) और अपसारी दोनों प्रकार के चिंतन का एक साथ आकलन करके वैज्ञानिक विचारोन्मेष की भविष्यवाणी करने में सक्षम है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास बहुत बुद्धिमान रोबोटों (लार्ज लैंग्वेज मॉडल्स, या LLMs) का एक विशाल पुस्तकालय है। आप जानना चाहते हैं कि उनमें से कौन वास्तव में "रचनात्मक" (creative) है। लेकिन हम एक मशीन में रचनात्मकता को कैसे माप सकते हैं?
लंबे समय से, वैज्ञानिक उन्हीं परीक्षणों का उपयोग कर रहे हैं जो वे मनुष्यों को ग्रेड देने के लिए करते हैं। यह एक मछली की पेड़ पर चढ़ने की क्षमता मापने की कोशिश करने जैसा है क्योंकि आप जानना चाहते हैं कि वह पेड़ पर चढ़ने में कितनी अच्छी है। यह शोध पत्र तर्क देता है कि हालांकि ये पुराने परीक्षण कुछ हद तक काम करते हैं, लेकिन वे अक्सर पूरी कहानी बताने में विफल रहते हैं, विशेष रूप से वैज्ञानिक विचारों के मामले में।
यहाँ शोधकर्ताओं द्वारा की गई खोजों और इसे ठीक करने के लिए उनके द्वारा बनाए गए समाधान का एक सरल विवरण दिया गया है।
1. समस्या: गलत पैमाने का उपयोग करना
शोधकर्ताओं ने "रचनात्मकता परीक्षणों" के दो मुख्य प्रकारों को देखा जिनका उपयोग मनुष्य करते हैं:
- डाइवर्जेंट थिंकिंग (Divergent Thinking): किसी को एक प्रश्न के कई अलग-अलग, अजीब उत्तर देने के लिए कहना (जैसे "10 ऐसी चीजें सूचीबद्ध करें जो एक-दूसरे से पूरी तरह अलग हों")।
- कन्वर्जेंट थिंकिंग (Convergent Thinking): किसी को तीन असंबंधित चीजों को जोड़ने वाला एक सही उत्तर खोजने के लिए कहना (जैसे "cottage," "Swiss," और "cake" "cheese")।
टीम ने दर्जनों AI मॉडलों का इन मानव परीक्षणों का उपयोग करके परीक्षण किया। उन्होंने कुछ आश्चर्यजनक चीजें खोजीं:
- "बुद्धिमत्ता" का जाल (The "Smartness" Trap): कई परीक्षण जो रचनात्मकता को मापते प्रतीत होते थे, वास्तव में केवल यह माप रहे थे कि रोबोट कितना "स्मार्ट" या जानकार था। यदि कोई रोबोट गणित और पढ़ने में अच्छा है, तो वह स्वाभाविक रूप से इन परीक्षणों पर उच्च स्कोर करता है, भले ही वह वास्तव में रचनात्मक न हो। यह एक छात्र को गणित के टेस्ट पर ग्रेड देने और इसे "रचनात्मकता परीक्षण" कहने जैसा है क्योंकि उसने उच्च स्कोर प्राप्त किया है।
- "वैज्ञानिक" अंध बिंदु (The "Scientific" Blind Spot): सबसे चौंकाने वाली खोज यह थी कि कोई भी मौजूदा मानव परीक्षण विश्वसनीय रूप से यह अनुमान नहीं लगा सका कि क्या कोई AI अच्छे वैज्ञानिक विचार दे सकता है। आपके पास एक ऐसा रोबोट हो सकता है जो कहानियाँ लिखने या यादृच्छिक शब्द सूचीबद्ध करने में बहुत अच्छा हो, लेकिन एक नया वैज्ञानिक सिद्धांत आविष्कार करने में बहुत खराब हो। पुराने पैमाने इस काम के लिए काम नहीं आए।
- नए मॉडलों का विरोधाभास (The Paradox of Newer Models): जैसे-जैसे AI मॉडल नए और अधिक शक्तिशाली होते गए, वे वास्तव में डाइवर्जेंट थिंकिंग (अद्वितीय, अजीब विचार उत्पन्न करने) में बदतर होते गए। वे अधिक कठोर और मानक बन गए, जैसे एक फैक्ट्री जो बार-बार एक ही कुकी बनाती है, बजाय एक ऐसे शेफ के जो एक नई रेसिपी का आविष्कार करता है।
2. समाधान: एक नया हाइब्रिड टेस्ट (DRAT)
चूंकि पुराने परीक्षण वैज्ञानिक रचनात्मकता की भविष्यवाणी करने में विफल रहे, इसलिए लेखकों ने डाइवर्जेंट रिमोट एसोसिएशन टेस्ट (DRAT) नामक एक नया परीक्षण बनाया।
सोचिए कि पुराने परीक्षण दो अलग-अलग उपकरणों की तरह हैं:
- उपकरण A (Divergent): एक बड़ा हथौड़ा जो चीजों को तोड़कर देखता है कि आपको कितने अलग-अलग टुकड़े मिलते हैं।
- उपकरण B (Convergent): एक पेचकस जो चीजों को आपस में कसता है ताकि एक आदर्श फिट मिल सके।
वैज्ञानिक रचनात्मकता के साथ समस्या यह है कि आपको एक ही समय में दोनों की आवश्यकता होती है। आपको कुछ नया खोजने के लिए विचारों को तोड़ना पड़ता है, लेकिन फिर आपको यह सुनिश्चित करने के लिए उन्हें जोड़ना पड़ता है कि वे वास्तव में समझ में आएं और समस्या में फिट बैठें।
DRAT कैसे काम करता है:
कल्पना कीजिए कि आप AI को तीन बहुत अलग "एंकर" शब्द देते हैं (जैसे "heartbeat," "pipeline," और "topology")।
- चुनौती: AI को 10 ऐसे शब्द उत्पन्न करने होंगे जो आपस में अलग-अलग हों (Divergent)।
- शर्त: लेकिन, उन 10 शब्दों में से प्रत्येक शब्द तीनों एंकर शब्दों से रूपक रूप से (metaphorically) जुड़ने में भी सक्षम होना चाहिए (Convergent)।
यह एक कवि को 10 पूरी तरह से अलग कविताएँ लिखने के लिए कहने जैसा है, लेकिन हर कविता गुप्त रूप से एक विशिष्ट, जटिल मशीन के बारे में होनी चाहिए। यदि AI यह कर सकता है, तो यह साबित करता है कि वह एक ही समय में जंगली (wild) और तार्किक (logical) दोनों तरह से सोच सकता है।
3. परिणाम
जब उन्होंने इस नए DRAT टूल का परीक्षण किया:
- यह काम कर गया! यह पहला परीक्षण था जो सफलतापूर्वक भविष्यवाणी कर सका कि कौन से AI मॉडल वैज्ञानिक विचार देने में अच्छे हैं।
- यह केवल हिस्सों का योग नहीं था: शोधकर्ताओं ने यह देखने के लिए पुराने "तोड़" (smash) परीक्षण और पुराने "जोड़ने" (screw) परीक्षण को मिलाने का प्रयास किया कि क्या वह काम करेगा। ऐसा नहीं हुआ। नए DRAT टूल ने कुछ ऐसा विशेष किया जो दो पुराने उपकरणों के अकेले करने में सक्षम नहीं थे। इसने साबित किया कि वैज्ञानिक रचनात्मकता को मापने के लिए, आपको जंगली और तार्किक होने की क्षमता का एक साथ परीक्षण करना होगा।
मुख्य निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि हम AI रचनात्मकता को ग्रेड देने के लिए पुराने मानव परीक्षणों का उपयोग नहीं कर सकते।
- यदि आप जानना चाहते हैं कि क्या कोई AI कहानियां लिखने में अच्छा है, तो "डाइवर्जेंट एसोसिएशन टास्क" (अजीब शब्द सूची) का उपयोग करें।
- यदि आप जानना चाहते हैं कि क्या कोई AI डाइवर्जेंट थिंकिंग (कई विकल्प सूचीबद्ध करना) में अच्छा है, तो "कंडीशनल डाइवर्जेंट एसोसिएशन टास्क" का उपयोग करें।
- लेकिन यदि आप जानना चाहते हैं कि क्या कोई AI नया विज्ञान आविष्कार कर सकता है, तो आपको नए DRAT परीक्षण की आवश्यकता है, क्योंकि यह जांचता है कि क्या मशीन एक ही समय में जंगली कल्पनाशील और तार्किक रूप से जुड़ी हुई है।
संक्षेप में: एक रोबोट की वैज्ञानिक प्रतिभा को मापने के लिए, आपको एक ऐसे परीक्षण की आवश्यकता है जो उसे एक पतली रस्सी पर चलते हुए (convergence) आग के साथ करतब दिखाने (divergence) के लिए मजबूर करे। पुराने परीक्षणों ने तो केवल एक ही चीज़ करने के लिए कहा था।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।