← नवीनतम पेपर
💬 NLP

DeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research Synthesis

यह शोध पत्र DeepScholar-bench को प्रस्तुत करता है, जो एक लाइव बेंचमार्क और स्वचालित मूल्यांकन ढांचा है जिसे हाल के ArXiv शोध पत्रों से जानकारी प्राप्त करने और उन्हें संश्लेषित करके उद्धृत, दीर्घ-रूप रिपोर्ट तैयार करने के माध्यम से जनरेटिव रिसर्च सिंथेसिस करने की एआई प्रणालियों की क्षमता का आकलन करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Liana Patel, Negar Arabzadeh, Harshit Gupta, Ankita Sundar, Ion Stoica, Matei Zaharia, Carlos Guestrin

प्रकाशित 2026-02-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Liana Patel, Negar Arabzadeh, Harshit Gupta, Ankita Sundar, Ion Stoica, Matei Zaharia, Carlos Guestrin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शोधकर्ता हैं जिन्हें एक "साहित्य समीक्षा" (Literature Review) लिखने का काम सौंपा गया है—यह वैज्ञानिक शोध पत्र का वह हिस्सा है जहाँ आप अपने क्षेत्र में अब तक जो कुछ भी हुआ है, उसका सारांश लिखते हैं। एक इंसान के लिए, इसमें पुस्तकालयों को खंगालने, सैकड़ों शोध पत्र पढ़ने और सावधानी से यह नोट करने में कई दिन लग जाते हैं कि किसने क्या कहा था।

अब, कल्पना कीजिए कि आपके पास यह काम करने के लिए एक AI सहायक है। यह सुनने में बहुत अच्छा लगता है, है ना? लेकिन एक बहुत बड़ी समस्या है: आप कैसे जानेंगे कि AI वास्तव में अच्छा काम कर रहा है या नहीं?

यदि AI आपको एक सारांश देता है, तो क्या वह वास्तव में सच बता रहा है? क्या उसने पिछले महीने की सबसे महत्वपूर्ण खोज को छोड़ दिया? या क्या उसने बस एक फर्जी तथ्य "गढ़" (hallucinate) दिया है जो पेशेवर लगता है?

यह शोध पत्र DeepScholar-Bench को पेश करता है, जो मूल रूप से एक "मास्टर परीक्षक" (Master Examiner) है जिसे विशेष रूप से AI शोधकर्ताओं को ग्रेड देने के लिए डिज़ाइन किया गया है।


समस्या: "पुराना पाठ्यपुस्तक" और "लघु उत्तर" का जाल

इस शोध पत्र से पहले, AI का मूल्यांकन करना एक छात्र को दो त्रुटिपूर्ण तरीकों से परखने जैसा था:

  1. लघु उत्तर का जाल (The Short Answer Trap): अधिकांश परीक्षण केवल सरल प्रश्न पूछते थे (जैसे, "फ्रांस की राजधानी क्या है?")। यह AI के लिए आसान है, लेकिन एक शोध रिपोर्ट लिखना 10 पन्नों का निबंध लिखने जैसा है। आप बहुविकल्पीय प्रश्नों (multiple-choice questions) के माध्यम से एक निबंध का मूल्यांकन नहीं कर सकते।
  2. पुरानी पाठ्यपुस्तक की समस्या (The Stale Textbook Problem): अधिकांश डेटासेट समय में "जमे हुए" होते हैं। यदि आप एक AI को 2022 की पाठ्यपुस्तक पर प्रशिक्षित करते हैं, तो उसे 2024 की सफलताओं के बारे में पता नहीं होगा। यह AI को "पुराना/अप्रासंगिक" बना देता है।

समाधान: DeepScholar-Bench (लाइव परीक्षक)

शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो पुरानी पाठ्यपुस्तकों का उपयोग नहीं करती है। इसके बजाय, यह एक लाइव समाचार रिपोर्टर की तरह कार्य करती है। यह लगातार ArXiv (नए शोध का एक विशाल भंडार) से नवीनतम वैज्ञानिक शोध पत्रों को खंगालती रहती है।

यह AI को एक "लाइव" कार्य देती है: "यहाँ एक बिल्कुल नया शोध पत्र है जो अभी प्रकाशित हुआ है। इस विषय का इतिहास खोजने के लिए इंटरनेट पर जाओ, और इसके लिए एक 'संबंधित कार्य' (Related Works) अनुभाग लिखो।"

ग्रेडिंग रूब्रिक: सत्य के तीन स्तंभ

AI को ग्रेड देने के लिए, "मास्टर परीक्षक" तीन विशिष्ट चीजों को देखता है:

  1. ज्ञान संश्लेषण (Knowledge Synthesis - "कहानीकार" स्कोर): क्या रिपोर्ट वास्तव में समझ में आती है? क्या यह एक सुसंगत कहानी है जो तार्किक रूप से आगे बढ़ती है, या यह केवल तथ्यों का एक बेतरतीब ढेर है जिसे एक अव्यवस्थित दराज की तरह एक साथ फेंक दिया गया है?
  2. प्राप्ति की गुणवत्ता (Retrieval Quality - "लाइब्रेरियन" स्कोर): क्या AI सही जगहों पर गया? यदि आप "क्वांटम फिजिक्स" के बारे में पूछते हैं, तो क्या AI ने गलती से आधा समय "क्वांटम कुकिंग" के बारे में पढ़ने में बिता दिया? क्या उसने "सेलिब्रिटी" शोध पत्रों (सबसे महत्वपूर्ण, अत्यधिक उद्धृत किए गए) को खोजा या केवल अप्रासंगिक और मामूली शोधों को?
  3. सत्यापनीयता (Verifiability - "डिटेक्टिव" स्कोर): यह सबसे महत्वपूर्ण है। जब AI कोई दावा करता है, तो क्या वह इसे सिद्ध कर सकता है? यदि AI कहता है, "Smith et al. ने X की खोज की," तो परीक्षक स्रोत की जाँच करता है। यदि स्रोत वास्तव में कहता है "Smith etol. ने X के बारे में विचार किया लेकिन इसे सिद्ध नहीं किया," तो AI डिटेक्टिव टेस्ट में फेल हो जाता है।

बड़ा खुलासा: AI अभी भी एक "छात्र" है

शोधकर्ताओं ने दुनिया के सर्वश्रेष्ठ AI का परीक्षण किया—जिसमें OpenAI का DeepResearch और विभिन्न ओपन-सोर्स मॉडल शामिल हैं।

परिणाम? AI अभी भी संघर्ष कर रहे हैं।

भले ही सबसे स्मार्ट सिस्टम भी सभी श्रेणियों में 31% औसत से अधिक स्कोर नहीं कर पाए। वे पेशेवर दिखने में अच्छे हैं ("कहानीकार" वाला हिस्सा), लेकिन वे सबसे महत्वपूर्ण शोध पत्रों को खोजने ( "लाइब्रेरियन" वाला हिस्सा) और यह सुनिश्चित करने में अभी भी काफी खराब हैं कि हर एक दावा किसी स्रोत द्वारा समर्थित है या नहीं ("डिटेक्टिव" वाला हिस्सा)।

यह क्यों मायने रखता है?

यह शोध पत्र अगली पीढ़ी के AI के लिए "गोल्ड स्टैंडर्ड" परीक्षण प्रदान करता है। यह डेवलपर्स को बताता है: "केवल अपने AI को स्मार्ट दिखने के लिए न बनाएं; इसे एक विश्वसनीय, गहराई से छानबीन करने वाला और तथ्य-जांच करने वाला शोधकर्ता बनाएं।" यह AI को एक "बातूनी सहायक" से एक "विश्वसनीय वैज्ञानिक साथी" में बदलने का एक रोडमैप है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →