Rethinking Creativity Evaluation: A Critical Analysis of Existing Creativity Evaluations
यह शोध पत्र विविध डोमेन में चार सामान्य रचनात्मकता मूल्यांकन मेट्रिक्स का आलोचनात्मक विश्लेषण करता है, जो उनकी महत्वपूर्ण विसंगतियों, डोमेन-विशिष्ट सीमाओं और मानवीय निर्णयों के साथ उनके मिसअलाइनमेंट को प्रकट करता है, जिससे अधिक सुदृढ़ और सामान्यीकरण योग्य ढांचों की तत्काल आवश्यकता रेखांकित होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक टैलेंट स्काउट (प्रतिभा खोजकर्ता) हैं जो दुनिया के सबसे रचनात्मक लेखकों, समस्या सुलझाने वालों और वैज्ञानिकों को खोजने की कोशिश कर रहे हैं। आपके पास प्रविष्टियों (entries) का एक विशाल ढेर है, लेकिन आपको "प्रतिभाशाली" वालों को "बोरिंग" वालों से जल्दी से अलग करने के लिए एक तरीके की आवश्यकता है। चूंकि बहुत अधिक प्रविष्टियाँ हैं जिन्हें हाथ से पढ़ा जा सके, इसलिए आपने उन्हें छाँटने के लिए चार अलग-अलग स्वचालित उपकरणों (मेट्रिक्स) का उपयोग करने का निर्णय लिया।
यह शोध पत्र उन चार उपकरणों का एक रिपोर्ट कार्ड है जिनका आपने परीक्षण किया। लेखकों ने यह देखने के लिए उनका परीक्षण किया कि क्या वे वास्तव में काम करते हैं, और बुरी खबर यह है: वे सभी काफी अविश्वसनीय हैं।
यहाँ उन चार उपकरणों का विवरण दिया गया जिनका उन्होंने परीक्षण किया और वे क्यों विफल हुए, सरल उपमाओं (analogies) का उपयोग करते हुए:
परीक्षण किए गए चार उपकरण
1. "कॉपी-पेस्ट" डिटेक्टर (क्रिएटिविटी इंडेक्स)
- यह कैसे काम करता है: यह टूल इंटरनेट को स्कैन करता है कि क्या कोई वाक्य पहले लिखा गया है। यदि कोई वाक्यांश अद्वितीय है और इसके विशाल डेटाबेस में कहीं नहीं मिला, तो यह एक उच्च "रचनात्मकता" स्कोर देता है।
- समस्या: यह एक शेफ की रचनात्मकता को केवल इस आधार पर आंकने जैसा है कि उसने कितने ऐसे अवयवों (ingredients) का उपयोग किया है जिन्हें आज तक किसी और ने नहीं खरीदा है।
- क्रिएटिव राइटिंग (रचनात्मक लेखन) में, यह ठीक-ठाक काम करता है क्योंकि अनूठे शब्द अक्सर एक ताज़ा कहानी का संकेत देते हैं।
- प्रॉब्लम सॉल्विंग (समस्या समाधान) और साइंस (विज्ञान) में, यह बुरी तरह विफल रहा। एक शानदार नया वैज्ञानिक विचार बहुत ही सामान्य, मानक शब्दों (जैसे "प्रयोग" या "डेटा") का उपयोग कर सकता है, इसलिए यह टूल उसे बोरिंग समझ लेता है। इसके विपरीत, एक लेखक दिखावा करने के लिए अजीब, दुर्लभ शब्दों का उपयोग कर सकता है, और यह टूल उसे प्रतिभाशाली समझ लेता है। यह शब्दावली की विविधता को मापता है, विचार की नवीनता को नहीं।
2. "सरप्राइज मीटर" (परप्लेक्सिटी - Perplexity)
- यह कैसे काम करता है: यह टूल अनुमान लगाता है कि एक वाक्य में अगले शब्द को देखकर कंप्यूटर कितना "हैरान" होगा। यदि टेक्स्ट बहुत ही अनुमानित (predictable) है, तो स्कोर कम होता है। यदि टेक्स्ट अजीब और अप्रत्याशित है, तो स्कोर अधिक होता है। विचार यह है कि रचनात्मकता = आश्चर्य।
- समस्या: यह एक कॉमेडियन को इस आधार पर आंकने जैसा है कि दर्शकों ने कितनी बार भ्रम में आकर आह भरी या चौंक गए।
- कभी-कभी, कोई टेक्स्ट उच्च-स्कोर वाला (बहुत आश्चर्यजनक) केवल इसलिए होता है क्योंकि वह व्याकरण की दृष्टि से अव्यवset या निरर्थक होता, न कि इसलिए कि वह रचनात्मक है।
- कभी-कभी, एक वास्तव में शानदार, स्पष्ट विचार बहुत सहज और पढ़ने में आसान होता है, जिससे टूल उसे कम स्कोर देता है।
- लेखकों ने पाया कि "रचनात्मक" और "गैर-रचनात्मक" टेक्स्ट अक्सर बिल्कुल एक जैसे स्कोर प्राप्त करते थे, जिससे यह टूल उन्हें अलग करने में बेकार हो जाता है।
3. "सेंटेंस स्ट्रक्चर स्कैनर" (सिंटैक्टिक टेम्पलेट्स - Syntactic Templates)
- यह कैसे काम करता है: यह टूल वाक्यों के ढांचे (जैसे, "The [Noun] [Verb] the [Adjective] [Noun]") को देखता है। यह जाँचता है कि क्या लेखक बार-बार एक ही प्रकार के वाक्य पैटर्न का उपयोग कर रहा है।
- समस्या: यह एक चित्रकार को केवल उसके ब्रश के स्ट्रोक के आकार से आंकने जैसा है, उसके द्वारा बनाई गई तस्वीर को अनदेखा करते हुए।
- क्रिएटिव राइटिंग में, इसने पकड़ लिया कि AI अक्सर दोहराव वाले, फॉर्मूला आधारित वाक्य संरचनाओं का उपयोग करता है (जैसे, "नायक की यात्रा तब शुरू हुई जब...")।
- हालाँकि, साइंस और प्रॉब्लम सॉल्विंग में, विशेषज्ञों को स्पष्ट और सटीक होने के लिए अक्सर मानक, फॉर्मूला आधारित भाषा का उपयोग करने की जरूरत होती है। इस टूल ने उन्हें स्पष्ट होने के लिए दंडित किया, यह सोचकर कि वे अनक्रेटीव हैं क्योंकि उन्होंने व्याकरण के नियमों का पालन किया।
4. "AI जज" (LLM-as-a-Judge)
- यह कैसे काम करता है: यह एक अन्य AI का उपयोग करता है जो काम को पढ़ता है और उसे ग्रेड देता है, ठीक वैसे ही जैसे एक मानव शिक्षक करेगा।
- समस्या: यह एक छात्र को दूसरे छात्र का होमवर्क ग्रेड करने के लिए काम पर रखने जैसा है। वे असंगत होते हैं और आसानी से धोखा खा जाते हैं।
- सक्वीजेबल (Squeezable): यदि आप प्रश्न को थोड़ा बदल देते हैं (जैसे, "क्या यह रचनात्मक है?" बनाम "क्या यह गैर-रचनात्मक है?"), तो AI अपना निर्णय पूरी तरह से बदल देता है।
- बायस्ड (Biased): यह एक पक्ष चुनने की प्रवृत्ति रखता है (जैसे, वास्तविक गुणवत्ता की परवाह किए बिना हमेशा यह कहना कि "नहीं, यह रचनात्मक नहीं है")।
- अनरिलायबल (Unreliable): जब एक ही निबंध को तीन बार ग्रेड करने के लिए कहा गया, तो वह खुद से केवल 40% बार ही सहमत हुआ। यह मूल रूप से केवल अनुमान लगा रहा है।
बड़ी तस्वीर (The Big Picture)
लेखकों ने इन उपकरणों का तीन अलग-अलग प्रकार की रचनात्मकता पर परीक्षण किया:
- क्रिएटिव राइटिंग (कहानियां, कविताएं)।
- प्रॉब्लम सॉल्विंग (रोजमर्रा की वस्तुओं का उपयोग करने के अजीब तरीके खोजना)।
- रिसर्च आइडिएशन (नए वैज्ञानिक सिद्धांत सामने लाना)।
परिणाम: कोई भी एक टूल तीनों के लिए काम नहीं कर सका। एक टूल जो एक रचनात्मक कहानी को पहचानने में अच्छा था, वह एक रचनात्मक वैज्ञानिक विचार को पहचानने में बेकार था। कभी-कभी, उपकरण एक ही टेक्स्ट पर एक-दूसरे से असहमत भी थे।
निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि वर्तमान में हमारे पास वास्तविक रचनात्मकता को मापने का कोई विश्वसनीय तरीका नहीं है।
- वर्तमान उपकरण ज्यादातर सतही चीजों को मापते हैं जैसे शब्द चयन, वाक्य की लंबाई, या टेक्स्ट कितना "अजीब" दिखता है।
- वे टेक्स्ट के पीछे के वास्तविक विचार या अवधारणा को मापने में विफल रहते हैं।
- सिर्फ इसलिए कि एक कंप्यूटर इन नंबरों के आधार पर किसी चीज़ को "रचनात्मक" कहता है, इसका मतलब यह नहीं है कि कोई इंसान उससे सहमत होगा।
लेखक मूल रूप से यह कह रहे हैं: "हमें इन सरल गणितीय ट्रिक्स पर भरोसा करना बंद करने की आवश्यकता है। हमें बेहतर सिस्टम बनाने की आवश्यकता है जो वास्तव में शब्दों को नहीं, बल्कि विचारों को समझते हों, इससे पहले कि हम मानव (या मशीन) की रचनात्मकता को आंकने के लिए उन पर भरोसा कर सकें।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।