← नवीनतम पेपर
💬 NLP

Standardizing the Measurement of Text Diversity: A Tool and a Comparative Analysis of Scores

यह शोध पत्र "diversity" को प्रस्तुत करता है, जो एक ओपन-सोर्स पायथन पैकेज और इंटरैक्टिव प्लेटफॉर्म है जो यह अनुभवजन्य रूप से प्रमाणित करके कि कम-सहसंबंध वाले मेट्रिक्स का संयोजन—जिसमें कंप्रेशन रेश्यो, लॉन्ग एन-ग्राम सेल्फ-रिपिटिशन, Self-BLEU और BERTScore शामिल हैं—टेक्स्ट रिपिटिशन पैटर्न को प्रभावी ढंग से कैप्चर करता है, LLM आउटपुट में टेक्स्ट विविधता के मापन को मानकीकृत करता है।

मूल लेखक: Chantal Shaib, Venkata S. Govindarajan, Joe Barrow, Jiuding Sun, Alexa F. Siu, Byron C. Wallace, Ani Nenkova

प्रकाशित 2026-02-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chantal Shaib, Venkata S. Govindarajan, Joe Barrow, Jiuding Sun, Alexa F. Siu, Byron C. Wallace, Ani Nenkova

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल रसोई चला रहे हैं जहाँ एक शेफ हैं। आपने भोजन के ऑर्डर के आधार पर खाना पकाने के लिए छह अलग-अलग रोबोट (AI मॉडल) रखे हैं। आपका काम यह जांचना है कि क्या ये रोबोट वास्तव में अनोखे व्यंजन बना रहे हैं या वे बस एक ही रेसिपी को बार-बार कॉपी कर रहे हैं, शायद केवल सजावट (garnish) को थोड़ा बदलकर।

यह पेपर एक यूनिवर्सल रूलर (सार्वभौमिक पैमाना) बनाने के बारे में है जिससे यह मापा जा सके कि ये रोबोट शेफ कितने "उबाऊ" या "दोहराव वाले" हैं, और फिर वह पैमाना दूसरों को भी इस्तेमाल करने के लिए देना है।

यहाँ सरल उपमाओं (analogies) का उपयोग करके पेपर का विवरण दिया गया है:

1. समस्या: "कॉपी-पेस्ट" किचन

जब लार्ज लैंग्वेज मॉडल्स (LLMs) टेक्स्ट लिखते हैं, तो वे कभी-कभी एक लूप में फंस जाते हैं। वे शायद कह सकते हैं, "मौसम अच्छा है," फिर "मौसम अच्छा है," फिर "मौसम अच्छा है" अलग-अलग दस्तावेजों में।

  • समस्या: अब तक, इसे मापने का कोई मानक तरीका नहीं था। कुछ शेफ शायद ऐसा पैमाना इस्तेमाल करते होंगे जो वाक्य की लंबाई मापता है, जबकि अन्य शब्दों के रंग को मापते हैं। यह एक मैराथन धावक की गति की तुलना तैराक की गति से अलग-अलग इकाइयों का उपयोग करके करने जैसा है।
  • परिणाम: यदि कोई मॉडल केवल "बॉयलरप्लेट" (तैयार किए गए) वाक्यांशों को दोहरा रहा है, तो यह रोबोटिक और निम्न-गुणवत्ता वाला लगता है, लेकिन हम बड़े पैमाने पर टेक्स्ट के बीच इसे आसानी से सिद्ध नहीं कर पा रहे थे।

2. समाधान: "डाइवर्सिटी" टूलकिट

लेखकों ने एक नया टूल बनाया है जिसे diversity कहा जाता है। इसे एक स्मार्ट किचन स्केल के रूप में सोचें जो केवल भोजन का वजन नहीं करता; बल्कि यह सामग्रियों का विश्लेषण भी करता है।

  • पैकेज: यह एक मुफ्त सॉफ्टवेयर टूल (जैसे कि मापने वाले कप का सेट) है जिसे कोई भी अपने टेक्स्ट की जांच करने के लिए डाउनलोड कर सकता है।
  • वेबसाइट: उन्होंने एक विजुअल प्लेग्राउंड (एक "डैशबोर्ड") भी बनाया है जहाँ आप अपना टेक्स्ट अपलोड कर सकते हैं और देख सकते हैं कि रोबोट कहाँ खुद को दोहरा रहे हैं। यह उबाऊ हिस्सों को लाल रंग में हाइलाइट करता है, जैसे एक शिक्षक किसी छात्र के निबंध में बहुत अधिक क्लीशे (clichés) के उपयोग के लिए निशान लगाता है।

3. सीक्रेट सॉस: संपीड़न (Compression) ही कुंजी है

लेखकों ने भारी गणित किए बिना दोहराव को मापने का एक चतुर तरीका खोजा।

  • उपमा: कल्पना कीजिए कि आपके पास 100 पन्नों की एक कहानी है जहाँ एक ही पैराग्राफ 50 बार दोहराया गया है। यदि आप उस फ़ाइल को स्पेस बचाने के लिए ज़िप (zip) करने की कोशिश करते हैं, तो कंप्यूटर कहेगा, "ओह, यह आसान है! मैं इस विशाल फ़ाइल को केवल 5 पन्नों तक सिकोड़ सकता हूँ क्योंकि यह सब एक जैसा ही है।"
  • निष्कर्ष: लेखकों ने पाया कि कंप्रेशन रेशियो (जब किसी फ़ाइल को ज़िप किया जाता है तो वह कितनी सिकुड़ती है) दोहराव को मापने का एक सुपर-फास्ट और सुपर-सटीक तरीका है।
    • हाई कंप्रेशन (उच्च संपीड़न) = टेक्स्ट बहुत दोहराव वाला है (उबाऊ)।
    • लो कंप्रेशन (कम संपीड़न) = टेक्स्ट अद्वितीय और विविध है (दिलचस्प)।
  • यह क्यों महत्वपूर्ण है: अन्य तरीकों के लिए कंप्यूटर को हर एक शब्द को पढ़ना और हर दूसरे शब्द से उसकी तुलना करना आवश्यक होता है (जैसे डुप्लिकेट खोजने के लिए लाइब्रेरी को पढ़ना)। कंप्रेशन केवल फ़ाइल के आकार को देखने जैसा है; यह तुरंत और सस्ता है।

4. "लंबाई" का जाल

पेपर एक प्रमुख खतरे के बारे में चेतावनी देता है: टेक्स्ट की लंबाई।

  • उपमा: यदि आप रोबोट A को 10 शब्दों का वाक्य लिखने के लिए कहते हैं और रोबोट B को 100 शब्दों का निबंध लिखने के लिए कहते हैं, तो रोबोट B में स्वाभाविक रूप से अधिक अद्वितीय शब्द होंगे क्योंकि वह लंबा है। यदि आप सीधे तुलना करते हैं, तो रोबोट B केवल इसलिए "अधिक विविध" दिखता है क्योंकि उसने अधिक बात की।
  • समाधान: आपको सेब की तुलना सेब से करनी होगी। यदि आप जानना चाहते हैं कि कौन सा रोबोट वास्तव में अधिक रचनात्मक है, तो आपको यह सुनिश्चित करना होगा कि वे समान मात्रा में टेक्स्ट लिख रहे हैं, या आपको अपनी गणित को लंबाई के अनुसार समायोजित करना होगा। पेपर इस बात पर जोर देता है कि आप विविधता स्कोर पर तब तक भरोसा नहीं कर सकते जब तक कि आप यह न जानते हों कि टेक्स्ट कितना लंबा है।

5. परिणाम: सबसे अच्छा शेफ कौन है?

लेखकों ने छह प्रसिद्ध AI मॉडल्स (जैसे Llama-2, GPT-4, Mistral) का समाचार सारांश (news summarization) कार्यों पर परीक्षण किया।

  • आश्चर्य: कुछ मॉडल्स जिन्होंने बहुत लंबे सारांश लिखे, वे वास्तव में सबसे कम विविध थे। वे केवल जगह भरने के लिए बड़बड़ा रहे थे और खुद को दोहरा रहे थे।
  • विजेता: GPT-4 जैसे मॉडल्स अधिक संक्षिप्त और विविध होने की प्रवृत्ति रखते हैं।
  • मानव तुलना: दिलचस्प बात यह है कि जब उन्होंने रोबोट्स की तुलना मानव पत्रकारों से की, तो रोबोट अक्सर अधिक दोहराव वाले लगे। हालाँकि, कुछ विशिष्ट मेट्रिक्स (जैसे कि एक मॉडल कितनी बार 4-शब्दों के वाक्यांश को दोहराता है) अन्य तरीकों की तुलना में इस बात को पकड़ने में बेहतर थे।

6. मुख्य निष्कर्ष (Takeaway)

लेखक कह रहे हैं: "अनुमान लगाना बंद करें। हमारा रूलर इस्तेमाल करें।"
वे टेक्स्ट विविधता की वास्तविक तस्वीर पाने के लिए तीन सरल जाँचों के संयोजन की सिफारिश करते हैं:

  1. कंप्रेशन रेशियो: ज़िप करने पर टेक्स्ट कितना सिकुड़ता है? (तेज़ और आसान)।
  2. सेल्फ-रेपिटिशन (स्व-दोहराव): क्या मॉडल लंबे वाक्यांशों को दोहराता है?
  3. सेल्फ-BLEU: मॉडल के विभिन्न उत्तर एक-दूसरे के कितने समान हैं?

इन उपकरणों का उपयोग करके, शोधकर्ता और डेवलपर्स केवल अपने अंतर्ज्ञान (gut feelings) पर निर्भर रहने के बजाय डेटा का उपयोग करके यह सुनिश्चित कर सकते हैं कि उनके AI मॉडल वास्तव में रचनात्मक हो रहे हैं, न कि केवल आलसी नकलची।

संक्षेप में: यह पेपर हमें बताता है कि कैसे AI के उबाऊ होने का पता लगाने के लिए एक मुफ्त, आसान-से-उपयोग करने वाला टूलकिट उपलब्ध है, जो इस सरल तर्क पर आधारित है कि "यदि आप इसे आसानी से ज़िप कर सकते हैं, तो यह संभवतः दोहराव वाला है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →