← नवीनतम पेपर
💬 NLP

Are LLMs becoming similarly creative? Evidence from three years of models

यह शोध पत्र लार्ज लैंग्वेज मॉडल (LLM) की तीन वर्षों की रिलीज़ का विश्लेषण करता है और मुक्त-अंत वाली रचनात्मक कार्यों (open-ended creative tasks) पर आउटपुट विविधता में सांख्यिकीय रूप से महत्वपूर्ण कमी पाता है, जो एकत्रीकरण (homogenization) की ओर एक प्रवृत्ति का सुझाव देता है जो मानव-एआई सह-रचनात्मक कार्य में मानवीय एजेंसी को कम कर सकता है।

मूल लेखक: Nirav Patel, Josiah Crossman, Eva Aggarwal, Emily Wenger

प्रकाशित 2026-08-21
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Nirav Patel, Josiah Crossman, Eva Aggarwal, Emily Wenger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: "क्या LLMs समान रूप से रचनात्मक होते जा रहे हैं? मॉडलों के तीन वर्षों का साक्ष्य"

समस्या विवरण (Problem Statement)
जबकि कई बेंचमार्क सत्यापन योग्य उत्तरों वाले कार्यों पर लार्ज लैंग्वेज मॉडल (LLM) के प्रदर्शन को ट्रैक करते हैं, ओपन-एंडेड कार्यों पर LLM के प्रदर्शन के संबंध में दीर्घकालिक डेटा (longitudinal data) की कमी है, जहाँ रचनात्मकता, मौलिकता और विविधता सर्वोपरि होती है। मौजूदा शोध सुझाव देते हैं कि हालांकि LLMs व्यक्तिगत रूप से रचनात्मक दिखाई दे सकते हैं, वे अक्सर सामूहिक एकरूपता (collective homogeneity) प्रदर्शित करते हैं, जिससे विभिन्न मॉडलों और समय के दौरान उनके आउटपुट एक-दूसरे के समान होते हैं। हालांकि, यह स्पष्ट नहीं है कि क्या यह एकरूपता विकसित होती तकनीक का एक अस्थायी प्रभाव है या सांख्यिकीय भाषा मॉडलों की एक अनिवार्य विशेषता। वर्तमान बेंचमार्क (जैसे, MMLU, HELM) स्पष्ट मानदंडों पर ध्यान केंद्रित करते हैं जिनमें सत्यापन योग्य उत्तर होते हैं और समय के साथ रचनात्मक आउटपुट की विविधता या मौलिकता के रुझानों को पकड़ने में विफल रहते हैं।

कार्यप्रणाली (Methodology)
लेखकों ने चार-चरणीय प्रक्रिया का उपयोग करके LLM आउटपुट विविधता का एक प्रारंभिक टेम्पोरल विश्लेषण किया:

  1. प्रॉम्ट चयन (Prompt Selection): रचनात्मक व्यवहार को प्रेरित करने के लिए दो पूरक सेट चुने गए:
    • अल्टरनेट यूजेस टास्क (AUT): विचलनशील सोच (divergent thinking) का एक मानकीकृत मनोवैज्ञानिक मूल्यांकन, जहाँ मॉडल सामान्य वस्तुओं के अपरंपरागत उपयोग उत्पन्न करते हैं।
    • इन्फिनिटी-चैट100 (Infinity-Chat100): वास्तविक दुनिया के 100 ओपन-एंडेड उपयोगकर्ता प्रश्नों का संग्रह, जो छह श्रेणियों में फैला हुआ है, जिसमें रचनात्मक सामग्री निर्माण, मंथन (brainstorming) और विचारोत्पत्ति (ideation) शामिल है।
  2. डेटा संग्रह (Data Collection): मार्च 2023 से जुलाई 2026 के बीच जारी किए गए 68 मॉडलों पर प्रॉम्ट्स को चलाया गया, जो 12 प्रमुख मॉडल प्रदाताओं (33 क्लोज्ड-वेट और 34 ओपन-वेट) का प्रतिनिधित्व करते हैं। स्टोकेस्टिक सैंपलिंग को बनाए रखने के लिए सभी जनरेशन में तापमान (temperature) और टॉप-पी (top-p) का मान 1.0 का उपयोग किया गया।
  3. सिमेंटिक एम्बेडिंग (Semantic Embedding): प्रतिक्रियाओं को all-MiniLM-L6-v2 सेंटेंस-ट्रांसफॉर्मर मॉडल का उपयोग करके एम्बेड किया गया। AUT के लिए, एक ही वस्तु के सभी उपयोगों को एक एकल वेक्टर के रूप में एम्बेड किया गया; Infinity-Chat के लिए, प्रत्येक प्रतिक्रिया को व्यक्तिगत रूप से एम्बेड किया गया।
  4. रिग्रेशन विश्लेषण (Regression Analysis): अध्ययन ने सेमेंटिक विचलन को मापने के लिए क्रॉस-फैमिली मॉडल पेयर्स (विभिन्न प्रदाताओं के मॉडल) के एम्बेडिंग्स के बीच कोसाइन डिस्टेंस (cosine distances) की गणना की। इन पेयर्स को रिलीज तिथियों के आधार पर नौ टेम्पोरल बिन्स में समूहीकृत किया गया। बाइन इंडेक्स के विरुद्ध मीन कोसाइन डिस्टेंस पर एक ऑर्डिनरी लीस्ट स्क्वायर्स (OLS) रिग्रेशन किया गया। असमान फैमिली प्रतिनिधित्व से होने वाले पूर्वाग्रह को कम करने के लिए, लेखकों ने स्लोप अनुमानों का वितरण उत्पन्न करने के लिए फैमिली-बैलेंस्ड रीसैंपलिंग के 1,000 पुनरावृत्तियों (iterations) को निष्पादित किया।

प्रमुख योगदान (Key Contributions)

  • अनुदैर्ध्य ढांचा (Longitudinal Framework): यह पेपर मॉडल व्यवहार के स्थिर स्नैपशॉट से आगे बढ़कर, समय के साथ LLM रचनात्मक आउटपुट के विकास को ट्रैक करने के लिए पहला ढांचा प्रदान करता है।
  • दोहरी-कार्य विश्लेषण (Dual-Task Analysis): एक नियंत्रित मनोवैज्ञानिक कार्य (AUT) को वास्तविक दुनिया के उपयोगकर्ता प्रश्नों (Infinity-Chat100) के साथ जोड़कर, यह अध्ययन संरचित और असंरचित संदर्भों में रचनात्मकता का आकलन करता है।
  • अभिसरण का मात्रात्मक साक्ष्य (Quantitative Evidence of Convergence): यह अध्ययन इस बात का अनुभवजन्य साक्ष्य प्रदान करता है कि LLM के आउटपुट समय के साथ तेजी से समान होते जा रहे हैं, जो इस धारणा को चुनौती देता है कि नए मॉडल स्वाभाविक रूप से अधिक रचनात्मक विविधता प्रदान करते हैं।

परिणाम (Results)
विश्लेषण तीन साल की अवलोकन अवधि के दौरान मॉडल आउटपुट विविधता में सांख्यिकीय रूप से महत्वपूर्ण कमी को प्रकट करता है:

  • रुझान (Trend): AUT और Infinity-Chat दोनों डेटासेट समय के साथ क्रॉस-फैमिली कोसाइन डिस्टेंस में निरंतर नकारात्मक ढलान (negative slope) दिखाते हैं, जो बढ़ती सेमेंटिक समानता (एकरूपता) का संकेत देते हैं।
  • परिमाण (Magnitude): गिरावट 'अल्टरनेट यूजेस टास्क' में सबसे अधिक स्पष्ट है, जहाँ औसत क्रॉस-फैमिली डिस्टेंस सबसे शुरुआती रिलीज बिन के लगभग 0.50 से गिरकर सबसे हालिया बिन में 0.40 से नीचे आ गया। Infinity-Chat डेटासेट ने ~0.34 से ~0.32 तक एक मंद लेकिन निरंतर गिरावट दिखाई।
  • मजबूती (Robustness): सभी 1,000 रीसैंपलिंग पुनरावृत्तियों ने दोनों डेटासेट के लिए नकारात्मक ढलान उत्पन्न किए, जो पुष्टि करते हैं कि यह रुझान प्रत्येक परिवार के मॉडलों के विभिन्न संयोजनों में मजबूत है।

महत्व और दावे (Significance and Claims)
यह पेपर तर्क देता है कि LLMs ओपन-एंडेड प्रतिक्रियाओं की आवश्यकता वाले कार्यों में कम रचनात्मक होते जा रहे हैं, जो मॉडलों के बीच रचनात्मक सार में अभिसरण (convergence) का सुझाव देता है। लेखक तर्क देते हैं कि यदि यह प्रवृत्ति जारी रहती है, तो "LLM-संचालित एकरूपता मानव-AI सह-रचनात्मक कार्य में मानवीय एजेंसी को प्रगतिशील रूप से कम कर सकती है।"

अध्ययन इन निष्कर्षों को एक प्रारंभिक विश्लेषण के रूप में प्रस्तुत करता है जो मानव रचनात्मक प्रक्रिया में LLMs की भूमिका के सावधानीपूर्वक विचार की मांग करता है। यह एक संभावित "AI रचनात्मकता विरोधाभास" (AI creativity paradox) को रेखांकित करता है: जबकि मॉडल व्यक्तिगत रूप से रचनात्मक प्रतीत हो सकते हैं, उनके समग्र आउटपुट कम विविध होते जा रहे हैं, जो संभावित रूप से उन विचारों की सीमा को सीमित कर सकते हैं जिनका सामना उपयोगकर्ता करते हैं और डाउनस्ट्रीम मानवीय रचनात्मकता को नकारात्मक रूप से प्रभावित कर सकते हैं। लेखक स्पष्ट रूप से कहते हैं कि उनका कार्य प्रारंभिक है और भविष्य के शोध के लिए आह्वान करते हैं जो अभिसरण को चलाने वाले अंतर्निहित तंत्रों (जैसे साझा प्रशिक्षण डेटा या डिस्टिलेशन) और विशिष्ट कारकों की जांच करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →