← नवीनतम पेपर
💬 NLP

Task-Dependent Evaluation of LLM Output Homogenization: A Taxonomy-Guided Framework

यह शोध पत्र एलएलएम (LLM) आउटपुट होमोजेनाइजेशन (एकरूपता) के मूल्यांकन के लिए एक कार्य-निर्भर ढांचे का प्रस्ताव करता है, जिसमें कार्यात्मक विविधता के एक वर्गीकरण को पेश किया गया है जिसे उपयोगकर्ता अध्ययनों द्वारा प्रमाणित किया गया है ताकि यह प्रदर्शित किया जा सके कि जब विविधता को विशिष्ट कार्य आवश्यकताओं के अनुसार अवधारणाबद्ध किया जाता है, तो विविधता और गुणवत्ता स्वाभाविक रूप से एक-दूसरे के विपरीत (ट्रेड-ऑफ) नहीं होते हैं।

मूल लेखक: Shomik Jain, Jack Lanchantin, Maximilian Nickel, Candace Ross, Karen Ullrich, Ashia Wilson, Jamelle Watson-Daniels

प्रकाशित 2026-04-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shomik Jain, Jack Lanchantin, Maximilian Nickel, Candace Ross, Karen Ullrich, Ashia Wilson, Jamelle Watson-Daniels

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, विद्वान मित्र है जो आपके किसी भी प्रश्न का उत्तर दे सकता है। कभी-कभी, आप उससे एक रचनात्मक कहानी मांगते हैं, और वह हर बार बस कुछ शब्द बदलकर बिल्कुल एक ही कथानक (plot) सुनाता है। दूसरी ओर, कभी आप उससे गणित का कोई सवाल पूछते हैं, और वह सही उत्तर तो देता है लेकिन उसे समझाने का तरीका उबाऊ और दोहराव वाला होता है।

यह शोध उस "एक ही रिकॉर्ड बजने" वाली भावना को ठीक करने के बारे में है। लेखक इसे होमोजेनाइजेशन (homogenization) कहते हैं—जब एआई (AI) मॉडल ऐसे व्यवहार करने लगते हैं जैसे वे सब एक ही स्क्रिप्ट पढ़ रहे हों।

यहाँ मुख्य विचार दिया गया है, जिसे रोजमर्रा के उदाहरणों के माध्यम से समझाया गया है:

1. समस्या: एक आकार सबके लिए उपयुक्त नहीं है (One Size Does Not Fit All)

शोध का तर्क है कि हम एआई की विविधता (diversity) को गलत तरीके से माप रहे हैं। हम हर चीज़ को मापने के लिए एक ही पैमाने का उपयोग कर रहे हैं, जैसे किसी सूप के "तीखेपन" और एक पेंटिंग के "रंग" को मापने के लिए एक ही उपकरण का उपयोग करना।

  • रचनात्मक कार्य (जैज़ संगीतकार): यदि आप एआई को समय पर एक कविता लिखने के लिए कहते हैं, तो आप चाहते हैं कि वह एक जैज़ संगीतकार की तरह हो जो सुधार (improvisation) कर रहा हो। आप अलग-अलग धुनें, अलग-अलग लय और अलग-अलग भावनाएं चाहते हैं। यदि वह तीन बार लगातार बस यही कहता है कि "समय एक नदी है," तो यह उबाऊ है। यह खराब होमोजेनाइजेशन है।
  • तथ्यात्मक कार्य (जीपीएस): यदि आप एआई से पूछते हैं, "फ्रांस की राजधानी क्या है?", तो आप चाहते हैं कि वह एक जीपीएस (GPS) की तरह हो। आप नहीं चाहते कि वह एक बार कहे "पेरिस," फिर कहे "पेरिस (लगभग)," और फिर कहे "रोशनी का शहर।" आप चाहते हैं कि वह सुसंगत और सटीक हो। यदि वह "रचनात्मक" होने की कोशिश करता है और कहता है "शायद पेरिस, शायद लंदन," तो यह वास्तव में एक विफलता है।

बड़ी गलती: पिछले शोध ने एआई के सभी उत्तरों को अलग दिखाने के लिए मजबूर करने की कोशिश की, भले ही उन्हें अलग नहीं होना चाहिए था। यह एक जीपीएस को यह बताने जैसा है कि जब भी आप पूछें, वह आपको एक ही मंजिल तक पहुँचने के तीन अलग-अलग रास्ते बताए। यह भ्रमित करने वाला और अनुपयोगी है।

2. समाधान: "टास्क टैक्सोनॉमी" (मेन्यू)

लेखकों ने एक मेन्यू (टैक्सोनॉमी) बनाया है जिसमें 8 अलग-अलग प्रकार के कार्य हैं। इसे एक रेस्टोरेंट के मेन्यू की तरह समझें जहाँ शेफ को पता है कि प्रत्येक व्यंजन को अलग तरह से कैसे पकाना है।

  • श्रेणी A (गणित की समस्या): "मुझे एक सही उत्तर दें।" (निरंतरता/consistency महत्वपूर्ण है)।
  • श्रेणी G (रचनात्मक लेखन): "मुझे एक अनूठी कहानी दें।" (विविधता महत्वपूर्ण है)।
  • श्रेणी H (राय/विचार): "माँ के लिए एक अच्छा उपहार क्या है?" (विभिन्न दृष्टिकोण महत्वपूर्ण हैं)।

उपयोगकर्ता के प्रश्न को मेन्यू के सही "व्यंजन" में वर्गीकृत करके, एआई को पता चल जाता है कि उसे एक सख्त लाइब्रेरियन बनना है या एक जंगली कलाकार।

3. समाधान: "टास्क-डिपेंडेंट सैंपलिंग" (स्मार्ट स्विच)

यह शोध पत्र एआई से बात करने का एक नया तरीका पेश करता है जिसे टास्क-डिपेंडेंट सैंपलिंग (Task-Dependent Sampling) कहा जाता है।

कल्पना कीजिए कि एआई एक शेफ है।

  • पुराना तरीका: आप शेफ से कहते हैं, "मेरे लिए 5 अलग-अलग भोजन बनाओ!" शेफ घबरा जाता है। गणित की समस्या के लिए, वह केवल "विविध" दिखने के लिए आपको 5 अलग-अलग गलत उत्तर दे सकता है। एक रचनात्मक कहानी के लिए, वह शायद कहानी को समान रखते हुए केवल उसका फॉन्ट रंग बदल दे।
  • नया तरीका: आप शेफ से कहते हैं, "यह एक गणित की समस्या है। मुझे इसे हल करने के 5 अलग-अलग तरीके दें, लेकिन सुनिश्चित करें कि वे सभी एक ही उत्तर की ओर ले जाएं।" फिर, आप कहते हैं, "यह एक कहानी का प्रॉम्प्ट है। मुझे अलग-अलग पात्रों और अंत के साथ 5 बिल्कुल अलग कहानियाँ दें।"

एआई अब जानता है कि उसे किस प्रकार की भिन्नता लानी है।

  • गणित के लिए, यह रणनीति (चरणों) को बदलता है, उत्तर को नहीं।
  • कहानियों के लिए, यह कथानक (plot) और टोन को बदलता है।

4. परिणाम: "गुणवत्ता बनाम विविधता" के मिथक को तोड़ना

एक आम धारणा थी कि आपको चुनना होगा: या तो एआई स्मार्ट और सुसंगत (उच्च गुणवत्ता) है, या वह रचनात्मक और विविध (उच्च विविधता) है। आप दोनों नहीं हो सकते।

यह शोध सिद्ध करता है कि यह एक मिथक है। यह यह कहने जैसा है कि आप एक ऐसी कार नहीं रख सकते जो सुरक्षित और तेज़ दोनों हो।

  • जब आप "गुणवत्ता" को सही ढंग से मापते हैं (क्या गणित का उत्तर सही है? क्या कहानी दिलचस्प है?), तो एआई उच्च-गुणवत्ता वाला और अत्यधिक विविध दोनों हो सकता है।
  • "ट्रेड-ऑफ" (समझौता) केवल इसलिए मौजूद था क्योंकि हम गलत मापने के डंडों का उपयोग कर रहे थे (जैसे कि यह गिनना कि कितने अलग-अलग शब्दों का उपयोग किया गया, बजाय इसके कि यह जांचना कि क्या विचार वास्तव में अलग थे)।

5. यह क्यों मायने रखता है

यदि हम इसे ठीक नहीं करते हैं, तो एआई दो तरह से खतरनाक हो जाता है:

  1. बोरियत का जाल (The Boredom Trap): आप एक कहानी मांगते हैं, और वह आपको लाखों बार वही "नायक जीत जाता है" वाला कथानक देता है।
  2. भ्रम का जाल (The Hallucination Trap): आप एक तथ्य पूछते हैं, और एआई केवल अलग दिखने के लिए काल्पनिक तथ्य गढ़ने की कोशिश करता है।

संक्षेप में:
यह शोध हमें एआई को एक टूटे हुए रिकॉर्ड की तरह न देखने की शिक्षा देता जिसे झटक कर ठीक करने की जरूरत है। इसके बजाय, हमें इसे एक कुशल कर्मचारी की तरह मानना चाहिए जो जानता है कि कब एक सख्त अकाउंटेंट (तथ्यों के लिए) और कब एक जंगली कलाकार (रचनात्मकता के लिए) बनना है। एआई को विशिष्ट कार्य के लिए सही निर्देश देकर, हमें बेहतर उत्तर मिलते हैं जो सटीक भी होते हैं और ताज़ा भी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →