← नवीनतम पेपर
🤖 AI

RWGBench: Evaluating Scholarly Positioning in Related Work Generation

यह शोध पत्र RWGBench प्रस्तुत करता है, जो एक नया बेंचमार्क और बहुआयामी मूल्यांकन ढांचा है जो पारंपरिक पाठ समानता के बजाय उद्धरण निर्णय लेने (citation decision-making) और विद्वत्तापूर्ण स्थिति निर्धारण (scholarly positioning) के आधार पर संबंधित कार्य पीढ़ी (Related Work Generation) का आकलन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल प्रवाहपूर्ण पाठ उत्पन्न करने के बावजूद अक्सर महत्वपूर्ण शैक्षणिक कार्यों में विफल रहते हैं।

मूल लेखक: Anzhe Xie, Weihang Su, Jiaxin Mao, Yiqun Liu, Shaoping Ma, Qingyao Ai

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anzhe Xie, Weihang Su, Jiaxin Mao, Yiqun Liu, Shaoping Ma, Qingyao Ai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए व्यंजन की तैयारी कर रहे एक शेफ हैं। आप सिर्फ यह नहीं कहना चाहते कि, "इसका स्वाद अच्छा है।" आपको यह समझाना होगा कि आपका व्यंजन क्यों खास है, इसके लिए अन्य प्रसिद्ध व्यंजनों से तुलना करनी होगी। आप कह सकते हैं, "मेरा सूप क्लासिक फ्रेंच अनियन सूप की तरह है, लेकिन मैंने इसमें एक तीखा ट्विस्ट जोड़ा है जो फ्रेंच संस्करण में नहीं है," या "इतालवी पास्ता के विपरीत, मेरा व्यंजन सूखे हुए हर्ब्स के बजाय ताजे हर्ब्स का उपयोग करता है।"

अकादमिक शोध की दुनिया में, इस प्रक्रिया को "रिलेटेड वर्क" (Related Work) लिखना कहा जाता है। यह वह जगह है जहाँ एक वैज्ञानिक बताता है कि उनका नया शोध मौजूदा शोध के विशाल पुस्तकालय में कहाँ फिट बैठता है। उन्हें अपने नए विचार को समझाने के लिए सही "प्रसिद्ध व्यंजनों" (पिछले शोध पत्रों) को चुनना होता है, उनके बीच के अंतर को स्पष्ट करना होता है, और यह दिखाना होता है कि उनका नया विचार क्यों मायने रखता है।

हाल ही में, आर्टिफिशियल इंटेलिजेंस (AI) टेक्स्ट लिखने में बहुत कुशल हो गया है जो सुनने में सहज और प्रवाहपूर्ण लगता है। लेकिन, जैसा कि RWGBench पेपर समझाता है, केवल इसलिए कि AI अच्छा सुनाई देता है, इसका मतलब यह नहीं है कि वह वास्तव में एक वैज्ञानिक की तरह सही ढंग से काम कर रहा है।

यहाँ इस पेपर का एक सरल विवरण दिया गया है:

1. समस्या: "स्मूथ टॉकर" (मीठी बातें करने वाला) का जाल

AI लेखन को परखने के मौजूदा तरीके ऐसे हैं जैसे किसी शेफ को केवल इस आधार पर आंकना कि भोजन कितना सुंदर दिखता है या उसका वर्णन कितना लयबद्ध है।

  • पुराना तरीका: यदि कोई AI एक ऐसा पैराग्राफ लिखता है जो मानव-लिखित पैराग्राफ के समान शब्दों का उपयोग करता है, तो उसे उच्च स्कोर मिलता है।
  • वास्तविकता: एक AI एक सुंदर पैराग्राफ लिख सकता है जो गलत शोध पत्रों का हवाला देता है, सबसे महत्वपूर्ण पिछले कार्यों को अनदेखा करता है, या अपने अध्ययन की तुलना उन चीजों से करता है जिनका उससे कोई लेना-देना नहीं है। यह एक शेफ की तरह है जो कहता है कि उसका तीखा सूप चॉकलेट केक के समान है क्योंकि दोनों में "चीनी" का उपयोग किया गया है। टेक्स्ट सुचारू है, लेकिन तर्क टूटा हुआ है।

2. समाधान: RWGBench (द "साइटेशन डिटेक्टिव")

लेखकों ने RWGBench नामक एक नया परीक्षण बनाया है। केवल यह जाँचने के बजाय कि शब्द मेल खाते हैं या नहीं, यह परीक्षण एक जासूस की तरह काम करता है जो AI द्वारा लिए गए निर्णयों को देखता है।

  • लाइब्रेरी: उन्होंने AI के चुनने के लिए "सामग्री" के रूप में 10 लाख से अधिक कंप्यूटर साइंस शोध पत्रों की एक विशाल लाइब्रेरी बनाई।
  • परीक्षण: उन्होंने 100 वास्तविक, उच्च-गुणवत्ता वाले शोध पत्र लिए और AI को उनके लिए "रिलेटेड वर्क" सेक्शन लिखने के लिए कहा।
  • स्कोरकार्ड: व्याकरण की जाँच करने के बजाय, वे चार विशिष्ट चीजों की जाँच करते हैं:
    1. क्या इसने सही शोध पत्रों को चुना? (सटीकता/Precision)
    2. क्या इसने समझाया कि वे शोध पत्र क्यों महत्वपूर्ण हैं? (संदर्भ/Context)
    3. क्या इसने उन्हें तार्किक रूप से व्यवस्थित किया? (संरचना/Structure)
    4. क्या इसने साइटेशन (उद्धरण) को सही स्थानों पर रखा? (प्लेसमेंट/Placement)

3. उन्होंने क्या पाया: AI अभी भी सोचने की प्रक्रिया सीख रहा है

जब उन्होंने परीक्षण किए, तो उन्हें कुछ आश्चर्यजनक चीजें मिलीं जो मानक परीक्षणों से छूट गई थीं:

  • "रिट्रीवल" (खोज) की बाधा: सबसे स्मार्ट AI मॉडल भी विशाल लाइब्रेरी से सही शोध पत्र खोजने में संघर्ष करते हैं। यह एक शेफ को मसालों से भरी पेंट्री देने जैसा है लेकिन वह उस विशिष्ट मसाले को नहीं ढूंढ पाता जिसकी उसे आवश्यकता है।
  • "फ्लुएंसी" (प्रवाह) का भ्रम: कुछ AI मॉडल बहुत सुचारू, पेशेवर दिखने वाला टेक्स्ट लिखते थे लेकिन उनके साइटेशन पूरी तरह से गलत होते थे। वे विशेषज्ञों की तरह सुनाई देते थे लेकिन शौकिया गलतियाँ करते थे।
  • "प्लेसमेंट" की समस्या: यहाँ तक कि जब AI को उपयोग करने के लिए सही शोध पत्रों की सूची दी गई थी (खोजने के चरण को दरकिनार करते हुए), तब भी उसे कहानी में उन्हें कहाँ रखना है या उन्हें कैसे फ्रेम करना है, इसमें संघर्ष करना पड़ा। वह जानता था कि क्या उद्धृत करना है, लेकिन नहीं जानता था कि उन्हें एक तर्क में कैसे उपयोग करना है।
  • मानव बनाम रोबोट: जब मनुष्यों ने AI को रेटिंग दी, तो उन्होंने उन मॉडलों को पसंद किया जिन्होंने सही ढंग से साइटेशन किया, भले ही उनका लेखन थोड़ा कम "पॉलिश" था। हालाँकि, स्वचालित कंप्यूटर जज अक्सर अधिक प्रवाहपूर्ण लेकिन गलत AI को पसंद करते थे, जिससे साबित हुआ कि वर्तमान कंप्यूटर ग्रेडिंग सिस्टम अकादमिक त्रुटियों को पकड़ने में खराब हैं।

4. मुख्य निष्कर्ष

यह पेपर तर्क देता है कि "रिलेटेड वर्क" सेक्शन लिखना केवल टेक्स्ट का सारांश देना नहीं है; यह रणनीतिक निर्णय लेना है। यह मौजूदा विचारों के एक जटिल जाल के भीतर एक नए विचार को स्थापित करने के बारे में है।

RWGBench एक नया उपकरण है जिसे हमें सुचारू सुनाई देने वाले AI से मूर्ख बनने से रोकने के लिए डिज़ाइन किया गया है। यह हमें यह देखने के लिए मजबूर करता है कि क्या AI वास्तव में स्मार्ट विद्वत्तापूर्ण निर्णय ले रहा है, न कि केवल यह कि क्या वह एक ऐसा वाक्य लिख सकता है जो अच्छा सुनाई दे। यह AI को एक सच्चे शोध भागीदार बनाने की दिशा में एक कदम है, न कि केवल एक फैंसी स्पेल-चेकर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →