← नवीनतम पेपर
💬 NLP

Diverse, not Short: A Length-Controlled Data Selection Strategy for Improving Response Diversity of Language Models

यह शोधपत्र Diverse-NS को प्रस्तुत करता है, जो एक लंबाई-नियंत्रित डेटा चयन रणनीति है जो भाषा मॉडलों में छोटे आउटपुट के प्रति व्यवस्थित पूर्वाग्रह को कम करती है, जिससे गुणवत्ता बनाए रखते हुए विभिन्न रचनात्मक कार्यों में प्रतिक्रिया विविधता और अभिव्यक्ति को महत्वपूर्ण रूप से बढ़ाया जाता है।

मूल लेखक: Vijeta Deshpande, Debasmita Ghose, John D. Patterson, Roger Beaty, Anna Rumshisky

प्रकाशित 2026-02-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vijeta Deshpande, Debasmita Ghose, John D. Patterson, Roger Beaty, Anna Rumshisky

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Diverse, not Short" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ स्पष्टीकरण दिया गया है।

समस्या: "छोटा और उबाऊ" वाला जाल (The "Short and Boring" Trap)

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली लेखक (एक Large Language Model) है जिसे मददगार, सुरक्षित और विनम्र होने के लिए प्रशिक्षित किया गया है। आप उनसे एक कहानी लिखने के लिए कहते हैं।

समस्या यह है कि "परफेक्ट" और सुरक्षित होने की कोशिश में, लेखक एक डरे हुए छात्र की तरह व्यवहार करने लगा है जो परीक्षा दे रहा हो। वे बहुत अधिक लिखने से डरते हैं क्योंकि उन्हें लगता है कि छोटे उत्तर बेहतर उत्तर होते हैं

क्यों? क्योंकि उनके काम को ग्रेड देने वाले उपकरण (diversity metrics) खराब हैं। ये उपकरण एक ऐसे जज की तरह हैं जो यह सोचता है कि 3-शब्दों वाला वाक्य 30-शब्दों वाले पैराग्राफ से अधिक "रचनात्मक" है क्योंकि वह छोटा है। लेखक इस बात को नोटिस करता है और अच्छे ग्रेड पाने के लिए आपको छोटे, सुरक्षित और दोहराव वाले उत्तर देने लगता है।

लेखक इसे "Brevity Bias" (संक्षिप्तता का पूर्वाग्रह) कहते हैं। यह एक ऐसे शेफ की तरह है जो मसाले डालना बंद कर देता है क्योंकि टेस्ट करने वाला केवल सादा खाना पसंद करता है। इसका परिणाम यह होता है कि AI कम रचनात्मक, कम अभिव्यंजक हो जाता है, और अंततः, सभी AI आउटपुट बिल्कुल एक जैसे लगने लगते हैं (जिसे "model collapse" कहा जाता है)।

समाधान: "Diverse, not Short" (विविध, न कि छोटा)

लेखकों ने Diverse, not Short (Diverse-NS) नामक एक नई रणनीति बनाई है। इसे लेखक के लिए एक नए प्रशिक्षण कार्यक्रम के रूप में समझें जो खराब ग्रेडिंग सिस्टम को ठीक करता है।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

  1. "दो-ड्राफ्ट" वाला खेल (The "Two-Draft" Game):
    शोधकर्ता AI को दो बार एक कहानी लिखने के लिए कहते हैं।

    • ड्राफ्ट A: AI स्वाभाविक रूप से लिखता है (उसका डिफ़ॉल्ट, अक्सर उबाऊ स्टाइल)।
    • ड्राफ्ट B: AI से कहानी को एक विशिष्ट नियम के साथ फिर से लिखने के लिए कहा जाता है: "इसे अधिक दिलचस्प और विविध बनाएं, लेकिन इसे ड्राफ्ट A के समान लंबाई का ही रखें।"
  2. "निष्पक्ष जज" फ़िल्टर (The "Fair Judge" Filter):
    आमतौर पर, यदि आप अधिक रचनात्मकता मांगते हैं, तो टेक्स्ट लंबा हो जाता है। लेकिन शोधकर्ताओं का एक सख्त नियम है: यदि ड्राफ्ट B, ड्राफ्ट A से लंबा है, तो उसे फेंक दें।
    वे केवल उन जोड़ों को रखते हैं जहाँ "अधिक रचनात्मक" संस्करण "उबाऊ" संस्करण के लगभग समान लंबाई का होता है। यह AI को सिखाता है: "आप अधिक शब्दों का उपयोग किए बिना भी रचनात्मक हो सकते हैं।"

  3. "छोटे शिक्षक" की तरकीब (The "Small Teacher" Trick):
    शोधकर्ताओं ने कुछ आश्चर्यजनक पाया। एक छोटा, सस्ता AI मॉडल (जैसे 7-बिलियन पैरामीटर वाला मॉडल) एक बहुत बड़े, अधिक महंगे मॉडल (जैसे 13-बिलियन पैरामीटर वाला मॉडल) के लिए "विविधता शिक्षक" (diversity teacher) के रूप में कार्य कर सकता है।

    • उपमा (Analogy): कल्पना कीजिए कि एक छोटा, स्थानीय कलाकार एक प्रसिद्ध, बड़े बजट वाले स्टूडियो को अधिक अनूठे तरीके से पेंट करना सिखा रहा है। छोटा कलाकार नियमों को रचनात्मक रूप से तोड़ने का तरीका जानता है, और बड़ा स्टूडियो उनसे सीखता है। इससे बहुत सारा पैसा और कंप्यूटिंग पावर बचती है।

परिणाम: अधिक स्वाद, वही आकार (More Flavor, Same Size)

शोधकर्ताओं ने चार अलग-अलग रचनात्मक कार्यों पर इसका परीक्षण किया:

  • Divergent Associations: एक दूसरे से बहुत अलग शब्दों की सूची बनाना।
  • Persona Generation: अद्वितीय पात्र प्रोफाइल (नाम, पेशा, शहर) बनाना।
  • Alternate Uses: किसी सामान्य वस्तु (जैसे ईंट) के अजीब उपयोगों के बारे में सोचना।
  • Creative Writing: तीन रैंडम शब्दों का उपयोग करके छोटी कहानियाँ लिखना।

क्या हुआ?

  • अधिक विविधता: "Diverse, not Short" के साथ प्रशिक्षित मॉडलों ने बहुत अधिक विविध और दिलचस्प आउटपुट दिए। उन्होंने अधिक अद्वितीय शब्दों और विचारों का उपयोग किया।
  • गुणवत्ता में कोई कमी नहीं: आमतौर पर, जब आप चीजों को अधिक विविध बनाते हैं, तो उनकी गुणवत्ता खराब हो जाती है (जैसे एक अव्यवस्थित, अराजक कहानी)। लेकिन यहाँ, गुणवत्ता उच्च बनी रही। कुछ मामलों में, यह और भी बेहतर हो गई।
  • दक्षता (Efficiency): उन्हें इस नए कौशल को सिखाने के लिए केवल 3,000 उदाहरणों की आवश्यकता थी। यह एक छात्र को वर्षों के बजाय कुछ घंटों तक पढ़ाने जैसा है।

नया टूल: "Diversity Decile"

लेखकों ने यह भी महसूस किया कि रचनात्मकता को मापने वाले पुराने उपकरण लंबे उत्तरों के प्रति अनुचित थे। इसलिए, उन्होंने Diversity Decile नामक एक नया पैमाना बनाया।

  • उपमा (Analogy): कल्पना कीजिए कि एक दौड़ हो रही है। पुराना पैमाना केवल यह मापता था कि आप कितनी तेज़ दौड़े, लेकिन इसने इस बात को नज़रअंदाज़ कर दिया कि कुछ धावक भारी बैकपैक (लंबा टेक्स्ट) लेकर दौड़ रहे थे और कुछ बिना बैकपैक के।
  • नया पैमाना: "Diversity Decile" यह देखता है कि आपने उसी आकार के बैकपैक वाले अन्य धावकों के सापेक्ष कितनी तेज़ी से दौड़ लगाई। यह पूछता है: "क्या यह लंबी कहानी अन्य लंबी कहानियों की तुलना में अधिक रचनात्मक है?" यह सुनिश्चित करता है कि लंबे, अभिव्यंजक उत्तरों को उनका उचित श्रेय मिले।

सारांश

यह पेपर तर्क देता है कि AI मॉडल बहुत छोटे और दोहराव वाले हो गए हैं क्योंकि जिस तरह से हम "रचनात्मकता" को मापते हैं, वह अनजाने में संक्षिप्तता को पुरस्कृत करता है।

Diverse, not Short नामक रणनीति का उपयोग करके, लेखकों ने मॉडलों को सिखाया कि वे अपने उत्तरों को लंबा किए बिना रचनात्मक कैसे बनें। उन्होंने यह किया:

  1. एक उबाऊ ड्राफ्ट की तुलना एक रचनात्मक ड्राफ्ट से की जो समान लंबाई का था।
  2. एक छोटे, सस्ते AI का उपयोग करके एक बड़े AI को विविध होना सिखाया।
  3. एक नया, अधिक निष्पक्ष पैमाना बनाया जो लंबे उत्तरों को दंडित नहीं करता है।

परिणामस्वरूप, ऐसा AI प्राप्त हुआ जो अधिक अभिव्यंजक, अधिक रचनात्मक और उच्च गुणवत्ता वाला है, और यह सब प्रशिक्षण के दौरान सस्ता और तेज़ भी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →