← नवीनतम पेपर
💬 NLP

CreativityPrism: A Cross-Domain Evaluation Framework for Large Language Model Creativity

यह शोध पत्र CreativityPrism को प्रस्तुत करता है, जो एक स्केलेबल, क्रॉस-डोमेन मूल्यांकन ढांचा है जो तीन आयामों (गुणवत्ता, नवीनता और विविधता) का उपयोग करके डाइवर्जेंट थिंकिंग (अपसारी चिंतन), रचनात्मक लेखन और तार्किक तर्क के आठ कार्यों में लार्ज लैंग्वेज मॉडल्स का आकलन करता है, जिससे यह पता चलता है कि जबकि फ्रंटियर मॉडल्स लेखन और तर्क में उत्कृष्ट हैं, वे डाइवर्जेंट थिंकिंग में कोई महत्वपूर्ण लाभ नहीं दिखाते हैं और प्रदर्शन शायद ही कभी विभिन्न रचनात्मक आयामों में सामान्यीकृत होता है।

मूल लेखक: Zhaoyi Joey Hou, Bowei Alvin Zhang, Yining Lu, Bhiman Kumar Baghel, Anneliese Brei, Ximing Lu, Meng Jiang, Faeze Brahman, Snigdha Chaturvedi, Haw-Shiuan Chang, Daniel Khashabi, Xiang Lorraine Li

प्रकाशित 2026-07-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhaoyi Joey Hou, Bowei Alvin Zhang, Yining Lu, Bhiman Kumar Baghel, Anneliese Brei, Ximing Lu, Meng Jiang, Faeze Brahman, Snigdha Chaturvedi, Haw-Shiuan Chang, Daniel Khashabi, Xiang Lorraine Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास टेक्स्ट जनरेटरों (लार्ज लैंग्वेज मॉडेल्स, या LLMs) का एक विशाल, जादुई पुस्तकालय है। हर कोई पूछ रहा है: "क्या ये मशीनें वास्तव में रचनात्मक (creative) हैं?"

समस्या यह है कि "रचनात्मकता" एक बहुत ही फिसलन भरा शब्द है। कभी इसका अर्थ एक मज़ेदार कहानी लिखना होता है, कभी इसका अर्थ किसी गणित की समस्या को एक अजीब तरीके से हल करना होता है, और कभी इसका अर्थ एक पेपरक्लिप के नए उपयोग के बारे में सोचना होता है। इस शोध पत्र से पहले, शोधकर्ता अलग-अलग कामों के लिए अलग-अलग पैमानों से रचनात्मकता को मापने की कोशिश कर रहे थे, या वे हर एक उत्तर को ग्रेड देने के लिए इंसानों से कह रहे थे, जो धीमा और महंगा था।

"CreativityPrism" से मिलिए।

CreativityPrism को एक नए, हाई-टेक प्रिज्म की तरह समझें जिसके माध्यम से आप प्रकाश की एक किरण (AI का आउटपुट) गुज़ारते हैं। केवल एक सफेद धब्बे को देखने के बजाय, यह प्रिज्म प्रकाश को तीन अलग-अलग रंगों में विभाजित कर देता है, जिससे मशीन की रचनात्मकता का वास्तविक स्वरूप प्रकट होता है।

रचनात्मकता के तीन रंग

लेखकों का तर्क है कि यह समझने के लिए कि क्या कोई मशीन रचनात्मक है, आपको इसे तीन विशिष्ट तरीकों से मापना होगा:

  1. गुणवत्ता (Quality - "क्या यह काम करता है?" वाला रंग): यह आधार है। यदि कोई मशीन ऐसी कहानी लिखती है जिसका कोई अर्थ नहीं निकलता या गणित की समस्या गलत हल करती है, तो इससे कोई फर्क नहीं पड़ता कि उसका विचार कितना "नया" है। वह केवल शोर (noise) है। गुणवत्ता यह मापती है कि आउटपुट वास्तव में कार्य को पूरा करता है या नहीं।
  2. नवीनता (Novelty - "यह कितना अजीब है?" वाला रंग): यह मापता है कि उत्तर साधारण से कितना दूर गया है। क्या मशीन ने ऐसा समाधान निकाला है जो किसी इंसान ने पहले कभी नहीं देखा? या उसने केवल अपने ट्रेनिंग डेटा की नकल की है?
  3. विविधता (Diversity - "कितने विकल्प हैं?" वाला रंग): यह विस्तार को मापता है। यदि आप मशीन को 10 विचार देने के लिए कहते हैं, तो क्या वे 10 पूरी तरह से अलग विचार हैं, या वे केवल एक ही विचार के 10 थोड़े बहुत अलग संस्करण हैं?

उपमा (Analogy): एक शेफ (रसोइया) की कल्पना करें।

  • गुणवत्ता: खाना स्वादिष्ट है और जला हुआ नहीं है।
  • नवीनता: शेफ स्वाद का एक ऐसा संयोजन आविष्कार करता है जो किसी ने पहले कभी नहीं आज़माया (जैसे, चॉकलेट और अचार)।
  • विविधता: शेफ 10 अलग-अलग प्रकार के डेसर्ट बना सकता है, न कि केवल चॉकलेट केक के 10 संस्करण।
  • CreativityPrism इन तीनों की जांच करता है। एक शेफ जो 100 अलग-अलग तरह के जले हुए चॉकलेट केक बना सकता है, उसमें उच्च विविधता (high diversity) है लेकिन कम गुणवत्ता (low quality) और कम नवीनता (low novelty) है।

बड़ा परीक्षण: रसोई में 17 शेफ

लेखकों ने वर्तमान में उपलब्ध 17 सबसे स्मार्ट AI मॉडलों को (OpenAI, Google, Anthropic और DeepSeek जैसी कंपनियों से) लिया और उन्हें 8 अलग-अलग चुनौतियों के माध्यम से परखने के लिए रखा, जो तीन क्षेत्रों में फैली हुई थीं:

  • डाइवर्जेंट थिंकिंग (Divergent Thinking): जैसे कि "अल्टरनेटिव यूजेस टेस्ट" (उदाहरण के लिए, "ईंट का दीवार बनाने के अलावा और क्या उपयोग किया जा सकता है?")।
  • क्रिएटिव राइटिंग (Creative Writing): प्रॉम्प्ट के आधार पर कहानियाँ या कविताएँ लिखना।
  • लॉजिकल रीजनिंग (Logical Reasoning): सख्त और अजीब बाधाओं के तहत गणित की समस्याओं को हल करना या कोड लिखना।

उन्होंने क्या पाया (ट्विस्ट)

1. "बड़ा बनाम छोटा" का अंतर
विशाल, महंगे AI मॉडल (फ्रंटियर मॉडल्स) आम तौर पर क्रिएटिव राइटिंग और लॉजिकल रीजनिंग में बेहतर होते हैं। वे उन मास्टर शेफ की तरह हैं जो जटिल रेसिपी का पालन कर सकते हैं और सुंदर मेनू लिख सकते हैं। हालाँकि, जब बात डाइवर्जेंट थिंकिंग (अजीब, असंबंधित विचार लाने) की आती है, तो सुपर-महंगे मॉडलों और छोटे, ओपन-सोर्स मॉडलों के बीच का अंतर लगभग समाप्त हो जाता है। बड़े मॉडल "आउट ऑफ द बॉक्स" सोचने में छोटे मॉडलों से अनिवार्य रूप से बेहतर नहीं हैं।

2. "विशेषज्ञ" की समस्या
यहाँ सबसे आश्चर्यजनक खोज है: एक प्रकार की रचनात्मकता में अच्छा होने का मतलब यह नहीं है कि आप दूसरे प्रकार में भी अच्छे हैं।

  • एक मॉडल उपन्यास लिखने में अद्भुत (उच्च गुणवत्ता) हो सकता है, लेकिन चम्मच के अजीब नए उपयोग बताने में बहुत खराब (कम नवीनता) हो सकता है।
  • एक मॉडल 1,000 अलग-अलग उत्तर उत्पन्न कर सकता है (उच्च विविधता), लेकिन उनमें से कोई भी वास्तव में नया या उपयोगी नहीं हो सकता (कम नवीनता)।

लेखकों ने पाया कि "नवीनता" सबसे अराजक आयाम है। सिर्फ इसलिए कि एक मॉडल गणित की समस्या में "नया" होने में अच्छा है, इसका मतलब यह नहीं है कि वह कहानी में भी "नया" होगा। वे पूरी तरह से अलग कौशल हैं।

3. "जज" (निर्णायक) समाधान
चूंकि इंसान इन सभी परीक्षणों को ग्रेड देने के लिए बहुत धीमे हैं, इसलिए लेखकों ने एक चतुर तरीका अपनाया: उन्होंने जवाबों को ग्रेड करने के लिए अन्य AI का उपयोग किया। लेकिन उन्होंने आँख मूँदकर उन पर भरोसा नहीं किया। उन्होंने पहले यह सुनिश्चित करने के लिए कि "AI जज" वास्तव में इंसानों के साथ सहमत हैं या नहीं, मानव विशेषज्ञों से एक छोटे नमूने को ग्रेड करवाया। यह एक हेड शेफ द्वारा कुछ व्यंजनों को चखने जैसा है ताकि यह सुनिश्चित किया जा सके कि उनके सहायक शेफ पूरे किचन के खाने को सही ढंग से ग्रेड कर रहे हैं।

मुख्य निष्कर्ष (The Bottom Line)

CreativityPrism एक नया उपकरण है जो हमें "यह AI रचनात्मक है" जैसा एक एकल, अस्पष्ट कथन कहने से रोकता है। इसके बजाय, यह हमें बताता है: "यह AI अच्छी कहानियाँ लिखने में महान है, रचनात्मक रूप से गणित हल करने में ठीक है, लेकिन अजीब, असंबंधित विचार लाने में बहुत अच्छा नहीं है।"

यह सिद्ध करता है कि रचनात्मकता कोई एक एकल सुपरपावर नहीं है; यह विभिन्न कौशलों का एक संग्रह है जो हमेशा एक साथ नहीं चलते। वास्तव में रचनात्मक मशीनें बनाने के लिए, हमें उन्हें रचनात्मकता के इन विभिन्न "रंगों" के लिए विशेष रूप से प्रशिक्षित करने की आवश्यकता है, न कि केवल इस उम्मीद में कि वे संयोग से सब कुछ सही कर लेंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →