ConCISE: A Reference-Free Conciseness Evaluation Metric for LLM-Generated Answers
यह शोध पत्र ConCISE को प्रस्तुत करता है, जो एक नवीन संदर्भ-मुक्त मीट्रिक है जो एब्स्ट्रैक्टिव और एक्सट्रैक्टिव समराइजेशन के साथ शब्द-हटाने की तकनीक से संपीड़न अनुपात (कंप्रेशन रेश्यो) का औसत निकालकर LLM-जनित प्रतिक्रियाओं की संक्षिप्तता का मूल्यांकन करता है, जिससे मानव एनोटेशन की आवश्यकता के बिना पुनरावृत्ति का स्वचालित पता लगाना संभव हो जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक डेली (deli) में सैंडविच ऑर्डर कर रहे हैं। आप एक साधारण हैम और चीज़ (ham and cheese) मांगते हैं। सैंडविच थमा देने के बजाय, शेफ आपको गेहूं के इतिहास पर 20 पन्नों का निबंध, सूअरों के प्रवास पैटर्न और चीज़ के बारे में एक दार्शनिक बहस थमा देता है, फिर अंत में आपको सैंडविच देता है।
यह तकनीकी रूप से सही है, लेकिन यह थका देने वाला, भ्रमित करने वाला और कष्टप्रद है क्योंकि आप लिखे गए हर एक शब्द के लिए भुगतान कर रहे हैं।
आज के लार्ज लैंग्वेज मॉडल्स (LLMs) के साथ बिल्कुल ऐसा ही होता है। वे सवालों के जवाब देने में माहिर हैं, लेकिन वे अक्सर "शब्दों की अधिकता" (wordiness) का शिकार हो जाते हैं। वे बड़बड़ाते हैं, अपनी बात दोहराते हैं, और फालतू की बातों से उत्तर को भर देते हैं। यह उपयोगकर्ताओं (जो त्वरित उत्तर चाहते हैं) के लिए बुरा है और कंपनियों (जो प्रति शब्द/टोकन भुगतान करती हैं) के लिए भी बुरा है।
यह पेपर एक नया टूल पेश करता है जिसे ConCISE (कंसीज़ - Conciseness Evaluation Metric) कहा जाता है, ताकि इस समस्या को हल किया जा सके। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है।
समस्या: "बहुत ज़्यादा" को हम कैसे मापें?
आमतौर पर, किसी निबंध को ग्रेड देने के लिए, आपको एक "परफेक्ट" उत्तर (गोल्ड स्टैंडर्ड) की आवश्यकता होती है जिसकी तुलना आप अपने उत्तर से कर सकें। लेकिन वास्तविक दुनिया में, हमारे पास हमेशा एक परफेक्ट उत्तर नहीं होता। हमारे पास केवल AI का उत्तर होता है।
तो, आप बिना किसी 'टीचर की की' (teacher's key) के यह कैसे बता सकते हैं कि क्या AI बहुत ज़्यादा बातें कर रहा है? ConCISE एक "रेफरेंस-फ्री" (संदर्भ-मुक्त) जज है। इसे यह जानने के लिए किसी परफेक्ट उत्तर की आवश्यकता नहीं है कि वर्तमान उत्तर बहुत लंबा है या नहीं। यह एक स्मार्ट संपादक की तरह काम करता है जो जानता है कि कहाँ कटौती करनी है।
समाधान: "तीन-कट" (Three-Cut) विधि
ConCISE केवल अनुमान नहीं लगाता; यह AI के उत्तर को तीन अलग-अलग "फिल्टर्स" से गुजारता है ताकि यह देखा जा सके कि अर्थ को बरकरार रखते हुए कितनी फालतू सामग्री हटाई जा सकती है। इसे एक मूर्तिकार की तरह समझें जो पत्थर के भीतर मूर्ति खोजने की कोशिश कर रहा है।
- "रीराइट" (Abstractive Summary - पुनर्रचना):
कल्प dáng करें कि आप एक दूसरे, बहुत बुद्धिमान AI से अपने लंबे उत्तर को अपने शब्दों में फिर से लिखने के लिए कहते हैं, लेकिन उसे बहुत छोटा बनाने के लिए कहते हैं। यदि मूल उत्तर 500 शब्दों का था और पुनर्रचित उत्तर 100 शब्दों का है, तो यह एक बड़ा संकेत है: मूल उत्तर में बहुत सारी अतिरिक्त चीजें थीं। - "हाइलाइटर" (Extractive Summary - निष्कर्षण):
कल्पना कीजिए कि आप एक AI से कहते हैं कि वह मूल पाठ में केवल सबसे महत्वपूर्ण वाक्यों को हाइलाइट करे और बाकी को छोड़ दे। यदि मूल पाठ 10 पन्नों का उपन्यास था और "हाइलाइट" किया गया संस्करण केवल 2 पन्नों का है, तो मूल पाठ बहुत अधिक भरा हुआ (bloated) था। - "कैंची" (Word Removal - शब्द हटाना):
यह सबसे सीधा परीक्षण है। AI को एक जोड़ी कैंची लेने के लिए कहा जाता है और उस हर एक शब्द को काटने के लिए कहा जाता है जो अर्थ बनाए रखने के लिए बिल्कुल आवश्यक नहीं है। यदि आप 80% शब्द काट सकते हैं और वाक्य फिर भी समझ में आता है, तो मूल उत्तर बहुत अधिक शब्दबहुल (verbose) था।
स्कोर: ConCISE इन तीन परीक्षणों के परिणामों को लेता है, उनका औसत निकालता है, और आपको एक स्कोर देता है। स्कोर जितना अधिक होगा, उतनी ही अधिक "फालतू सामग्री" हटाई गई होगी, जिसका अर्थ है कि मूल उत्तर बहुत अधिक शब्दबहुल था।
प्रयोग: क्या यह काम आया?
शोधकर्ताओं ने इसका परीक्षण प्रश्नों और उत्तरों के एक डेटासेट (विकिपीडिया पर आधारित) पर किया। उन्होंने उत्तरों के दो संस्करण बनाए:
- अच्छा वाला: छोटा और सटीक।
- बुरा वाला: वही तथ्य, लेकिन उन्हें अविश्वसनीय रूप से लंबा, दोहराव वाला और उबाऊ बनाया गया (जैसे शेफ का 20 पन्नों का निबंध)।
इसके बाद उन्होंने इंसानों से रेटिंग करने को कहा कि कौन से उत्तर बेहतर थे। उसके बाद, उन्होंने ConCISE को उन्हें रेट करने दिया।
परिणाम:
- ConCISE मानवीय निर्णय के अनुरूप था। जब इंसानों ने कहा, "यह उत्तर बहुत लंबा है," तो ConCISE भी इससे सहमत था।
- पुराने तरीके: अन्य मानक AI ग्रेडिंग टूल्स (जो केवल 10 में से एक स्कोर देते हैं) बुरी तरह विफल रहे। वे अक्सर लंबे, बड़बड़ाने वाले उत्तरों को बेहतर समझते थे क्योंकि वे अधिक "आत्मविश्वासी" या विस्तृत लगते थे। ConCISE ने सही ढंग से पहचाना कि वे व्यर्थ थे।
यह क्यों महत्वपूर्ण है
ConCISE को एक क्लब के बाउंसर की तरह समझें।
- पुराने AI ग्रेडर्स उन बाउंसरों की तरह थे जो किसी को भी अंदर आने देते थे जब तक कि उनके पास टिकट हो, भले ही वे चिल्ला रहे हों और मेजों पर नाच रहे हों।
- ConCISE वह बाउंसर है जो लिस्ट चेक करता है, देखता है कि वास्तव में किसकी ज़रूरत है, और उन लोगों को बाहर निकाल देता है जो सिर्फ जगह घेर रहे हैं और डीजे का समय बर्बाद कर रहे हैं।
मुख्य बात (The Bottom Line)
यह पेपर हमें एक व्यावहारिक तरीका देता है जिससे हम स्वचालित रूप से यह जांच सकते हैं कि क्या AI बहुत अधिक बातें कर रहा है, बिना हर उत्तर को पढ़ने के लिए किसी इंसान की आवश्यकता के। यह डेवलपर्स को ऐसा AI बनाने में मदद करता है जो कुशल, स्पष्ट और उपयोगकर्ता के समय का सम्मान करने वाला हो—और अनावश्यक शब्द उत्पन्न न करके कंप्यूटिंग लागतों पर भी पैसे बचाता है।
संक्षेप में: ConCISE AI को कम शब्दों में अधिक कहना सीखने में मदद करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।