CreativityPrism: A Cross-Domain Evaluation Framework for Large Language Model Creativity
यह शोध पत्र CreativityPrism को प्रस्तुत करता है, जो एक स्केलेबल, क्रॉस-डोमेन मूल्यांकन ढांचा है जो तीन आयामों (गुणवत्ता, नवीनता और विविधता) का उपयोग करके डाइवर्जेंट थिंकिंग (अपसारी चिंतन), रचनात्मक लेखन और तार्किक तर्क के आठ कार्यों में लार्ज लैंग्वेज मॉडल्स का आकलन करता है, जिससे यह पता चलता है कि जबकि फ्रंटियर मॉडल्स लेखन और तर्क में उत्कृष्ट हैं, वे डाइवर्जेंट थिंकिंग में कोई महत्वपूर्ण लाभ नहीं दिखाते हैं और प्रदर्शन शायद ही कभी विभिन्न रचनात्मक आयामों में सामान्यीकृत होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास टेक्स्ट जनरेटरों (लार्ज लैंग्वेज मॉडेल्स, या LLMs) का एक विशाल, जादुई पुस्तकालय है। हर कोई पूछ रहा है: "क्या ये मशीनें वास्तव में रचनात्मक (creative) हैं?"
समस्या यह है कि "रचनात्मकता" एक बहुत ही फिसलन भरा शब्द है। कभी इसका अर्थ एक मज़ेदार कहानी लिखना होता है, कभी इसका अर्थ किसी गणित की समस्या को एक अजीब तरीके से हल करना होता है, और कभी इसका अर्थ एक पेपरक्लिप के नए उपयोग के बारे में सोचना होता है। इस शोध पत्र से पहले, शोधकर्ता अलग-अलग कामों के लिए अलग-अलग पैमानों से रचनात्मकता को मापने की कोशिश कर रहे थे, या वे हर एक उत्तर को ग्रेड देने के लिए इंसानों से कह रहे थे, जो धीमा और महंगा था।
"CreativityPrism" से मिलिए।
CreativityPrism को एक नए, हाई-टेक प्रिज्म की तरह समझें जिसके माध्यम से आप प्रकाश की एक किरण (AI का आउटपुट) गुज़ारते हैं। केवल एक सफेद धब्बे को देखने के बजाय, यह प्रिज्म प्रकाश को तीन अलग-अलग रंगों में विभाजित कर देता है, जिससे मशीन की रचनात्मकता का वास्तविक स्वरूप प्रकट होता है।
रचनात्मकता के तीन रंग
लेखकों का तर्क है कि यह समझने के लिए कि क्या कोई मशीन रचनात्मक है, आपको इसे तीन विशिष्ट तरीकों से मापना होगा:
- गुणवत्ता (Quality - "क्या यह काम करता है?" वाला रंग): यह आधार है। यदि कोई मशीन ऐसी कहानी लिखती है जिसका कोई अर्थ नहीं निकलता या गणित की समस्या गलत हल करती है, तो इससे कोई फर्क नहीं पड़ता कि उसका विचार कितना "नया" है। वह केवल शोर (noise) है। गुणवत्ता यह मापती है कि आउटपुट वास्तव में कार्य को पूरा करता है या नहीं।
- नवीनता (Novelty - "यह कितना अजीब है?" वाला रंग): यह मापता है कि उत्तर साधारण से कितना दूर गया है। क्या मशीन ने ऐसा समाधान निकाला है जो किसी इंसान ने पहले कभी नहीं देखा? या उसने केवल अपने ट्रेनिंग डेटा की नकल की है?
- विविधता (Diversity - "कितने विकल्प हैं?" वाला रंग): यह विस्तार को मापता है। यदि आप मशीन को 10 विचार देने के लिए कहते हैं, तो क्या वे 10 पूरी तरह से अलग विचार हैं, या वे केवल एक ही विचार के 10 थोड़े बहुत अलग संस्करण हैं?
उपमा (Analogy): एक शेफ (रसोइया) की कल्पना करें।
- गुणवत्ता: खाना स्वादिष्ट है और जला हुआ नहीं है।
- नवीनता: शेफ स्वाद का एक ऐसा संयोजन आविष्कार करता है जो किसी ने पहले कभी नहीं आज़माया (जैसे, चॉकलेट और अचार)।
- विविधता: शेफ 10 अलग-अलग प्रकार के डेसर्ट बना सकता है, न कि केवल चॉकलेट केक के 10 संस्करण।
- CreativityPrism इन तीनों की जांच करता है। एक शेफ जो 100 अलग-अलग तरह के जले हुए चॉकलेट केक बना सकता है, उसमें उच्च विविधता (high diversity) है लेकिन कम गुणवत्ता (low quality) और कम नवीनता (low novelty) है।
बड़ा परीक्षण: रसोई में 17 शेफ
लेखकों ने वर्तमान में उपलब्ध 17 सबसे स्मार्ट AI मॉडलों को (OpenAI, Google, Anthropic और DeepSeek जैसी कंपनियों से) लिया और उन्हें 8 अलग-अलग चुनौतियों के माध्यम से परखने के लिए रखा, जो तीन क्षेत्रों में फैली हुई थीं:
- डाइवर्जेंट थिंकिंग (Divergent Thinking): जैसे कि "अल्टरनेटिव यूजेस टेस्ट" (उदाहरण के लिए, "ईंट का दीवार बनाने के अलावा और क्या उपयोग किया जा सकता है?")।
- क्रिएटिव राइटिंग (Creative Writing): प्रॉम्प्ट के आधार पर कहानियाँ या कविताएँ लिखना।
- लॉजिकल रीजनिंग (Logical Reasoning): सख्त और अजीब बाधाओं के तहत गणित की समस्याओं को हल करना या कोड लिखना।
उन्होंने क्या पाया (ट्विस्ट)
1. "बड़ा बनाम छोटा" का अंतर
विशाल, महंगे AI मॉडल (फ्रंटियर मॉडल्स) आम तौर पर क्रिएटिव राइटिंग और लॉजिकल रीजनिंग में बेहतर होते हैं। वे उन मास्टर शेफ की तरह हैं जो जटिल रेसिपी का पालन कर सकते हैं और सुंदर मेनू लिख सकते हैं। हालाँकि, जब बात डाइवर्जेंट थिंकिंग (अजीब, असंबंधित विचार लाने) की आती है, तो सुपर-महंगे मॉडलों और छोटे, ओपन-सोर्स मॉडलों के बीच का अंतर लगभग समाप्त हो जाता है। बड़े मॉडल "आउट ऑफ द बॉक्स" सोचने में छोटे मॉडलों से अनिवार्य रूप से बेहतर नहीं हैं।
2. "विशेषज्ञ" की समस्या
यहाँ सबसे आश्चर्यजनक खोज है: एक प्रकार की रचनात्मकता में अच्छा होने का मतलब यह नहीं है कि आप दूसरे प्रकार में भी अच्छे हैं।
- एक मॉडल उपन्यास लिखने में अद्भुत (उच्च गुणवत्ता) हो सकता है, लेकिन चम्मच के अजीब नए उपयोग बताने में बहुत खराब (कम नवीनता) हो सकता है।
- एक मॉडल 1,000 अलग-अलग उत्तर उत्पन्न कर सकता है (उच्च विविधता), लेकिन उनमें से कोई भी वास्तव में नया या उपयोगी नहीं हो सकता (कम नवीनता)।
लेखकों ने पाया कि "नवीनता" सबसे अराजक आयाम है। सिर्फ इसलिए कि एक मॉडल गणित की समस्या में "नया" होने में अच्छा है, इसका मतलब यह नहीं है कि वह कहानी में भी "नया" होगा। वे पूरी तरह से अलग कौशल हैं।
3. "जज" (निर्णायक) समाधान
चूंकि इंसान इन सभी परीक्षणों को ग्रेड देने के लिए बहुत धीमे हैं, इसलिए लेखकों ने एक चतुर तरीका अपनाया: उन्होंने जवाबों को ग्रेड करने के लिए अन्य AI का उपयोग किया। लेकिन उन्होंने आँख मूँदकर उन पर भरोसा नहीं किया। उन्होंने पहले यह सुनिश्चित करने के लिए कि "AI जज" वास्तव में इंसानों के साथ सहमत हैं या नहीं, मानव विशेषज्ञों से एक छोटे नमूने को ग्रेड करवाया। यह एक हेड शेफ द्वारा कुछ व्यंजनों को चखने जैसा है ताकि यह सुनिश्चित किया जा सके कि उनके सहायक शेफ पूरे किचन के खाने को सही ढंग से ग्रेड कर रहे हैं।
मुख्य निष्कर्ष (The Bottom Line)
CreativityPrism एक नया उपकरण है जो हमें "यह AI रचनात्मक है" जैसा एक एकल, अस्पष्ट कथन कहने से रोकता है। इसके बजाय, यह हमें बताता है: "यह AI अच्छी कहानियाँ लिखने में महान है, रचनात्मक रूप से गणित हल करने में ठीक है, लेकिन अजीब, असंबंधित विचार लाने में बहुत अच्छा नहीं है।"
यह सिद्ध करता है कि रचनात्मकता कोई एक एकल सुपरपावर नहीं है; यह विभिन्न कौशलों का एक संग्रह है जो हमेशा एक साथ नहीं चलते। वास्तव में रचनात्मक मशीनें बनाने के लिए, हमें उन्हें रचनात्मकता के इन विभिन्न "रंगों" के लिए विशेष रूप से प्रशिक्षित करने की आवश्यकता है, न कि केवल इस उम्मीद में कि वे संयोग से सब कुछ सही कर लेंगे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।