← नवीनतम पेपर
💬 NLP

Super Research: Answering Highly Complex Questions with Large Language Models through Super Deep and Super Wide Research

यह शोध पत्र "सुपर रिसर्च" (Super Research) प्रस्तुत करता है, जो एक नवीन कार्य और बेंचमार्क है जिसे संरचित योजना (structured planning), सुपर-वाइड रिट्रीवल (super-wide retrieval) और सुपर-डीप इटरेटिव इन्वेस्टिगेशन (super-deep iterative investigation) को एकीकृत करके अत्यधिक जटिल प्रश्नों को हल करने की लार्ज लैंग्वेज मॉडेल्स की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिसे पांच महत्वपूर्ण आयामों में प्रदर्शन का आकलन करने के लिए एक ग्राफ-एंकर ऑडिटिंग प्रोटोकॉल द्वारा समर्थित किया गया है।

मूल लेखक: Yubo Dong, Nianhao You, Yuxuan Hou, Zixun Sun, Yue Zhang, Liang Zhang, Siyuan Zhao, Hehe Fan

प्रकाशित 2026-03-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yubo Dong, Nianhao You, Yuxuan Hou, Zixun Sun, Yue Zhang, Liang Zhang, Siyuan Zhao, Hehe Fan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, दुनिया बदलने वाली गुत्थी को सुलझाने की कोशिश कर रहे हैं। आप केवल एक किताब के लिए लाइब्रेरियन से नहीं पूछ सकते; आपको 1,000 किताबें पढ़नी होंगी, 100 विशेषज्ञों का साक्षात्कार लेना होगा, परस्पर विरोधी गवाहियों का मिलान करना होगा और एक 50 पन्नों का जासूसी उपन्यास लिखना होगा जो आपके सिद्धांत को सिद्ध करे।

यही सुपर रिसर्च (Super Research) की चुनौती है।

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (LLMs)—जो ChatGPT जैसे टूल्स के पीछे के AI मस्तिष्क हैं—का परीक्षण करने का एक नया तरीका पेश करता है। लेखक तर्क देते हैं कि जबकि वर्तमान AI सरल प्रश्नों या एक विषय में गहरी डुबकी लगाने में माहिर हैं, वे तब संघर्ष करते हैं जब उनसे एक साथ सब कुछ करने के लिए कहा जाता है: यानी अत्यधिक गहराई में जाना और एक ही समय में अत्यधिक विस्तार में जाना।

यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "टनल विजन" बनाम "सूचना का अतिभार" का जाल

यह शोध पत्र तीन प्रकार के शोध की तुलना करता है, जिसमें एक अंधेरे कमरे में टॉर्चलाइट का दृश्य रूपक (visual metaphor) उपयोग किया गया है:

  • स्टैंडर्ड सर्च (RAG): एक मंद टॉर्च की तरह। यह पास की वस्तु को तो ढूंढ लेता है लेकिन कमरे के बाकी हिस्सों को छोड़ देता है।
  • डीप रिसर्च (गहन शोध): एक लेजर बीम की तरह। यह दीवार की एक विशिष्ट दरार में बहुत उज्ज्वल और गहरा प्रकाश डालता है (विवरणों के लिए बेहतरीन), लेकिन इसमें टनल विजन (सीमित दृष्टि) होता है। यह बाएं और दाएं हो रही हर चीज़ को मिस कर देता है।
  • वाइड सर्च (व्यापक खोज): एक फ्लडलाइट (विशाल प्रकाश) की तरह। यह एक साथ पूरे कमरे को रोशन कर देता है, लेकिन यह इतना उज्ज्वल और बिखरा हुआ होता है कि आप विवरण नहीं देख पाते। इससे सूचना का अतिभार (Information Overload) हो जाता है।
  • सुपर रिसर्च (लक्ष्य): यह एक "सुपर टॉर्चलाइट" है। इसे एक ही समय में लेजर बीम और फ्लडलाइट दोनों होना चाहिए। इसे 100+ अलग-अलग कोणों (चौड़ाई) की खोज करनी होगी और साथ ही प्रत्येक कोण में 100+ परतों तक गहराई (गहराई) में उतरना होगा ताकि एक ऐसी समस्या को हल किया जा सके जिसके लिए 1,000+ वेब पेजों को पढ़ने की आवश्यकता हो।

2. चुनौती: "300 विशेषज्ञ प्रश्न"

क्या AI इस कार्य को संभाल सकता है, यह परीक्षण करने के लिए, शोधकर्ताओं ने केवल यह नहीं पूछा, "सुपर बाउल किसने जीता?" बल्कि उन्होंने ऐसे प्रश्न पूछे:

"हम कैंसर कोशिकाओं पर प्रतिरक्षा प्रणाली (immune system) के हमले और अनजाने में ऑटोइम्यून बीमारी को ट्रिगर करने के बीच संतुलन कैसे बनाएं?"

ये प्रश्न हैं:

  • अत्यंत कठिन: इनके लिए विरोधाभासी साक्ष्यों का संश्लेषण करने की आवश्यकता होती है।
  • अत्यंत लंबे: इनके लिए 100+ खोज चरणों की आवश्यकता होती है (जैसे एक जासूस द्वारा 100 अलग-अलग सुरागों का पीछा करना)।
  • अत्यंत जटिल: इनके लिए सटीक उद्धरणों (citations) के साथ 50 पन्नों की रिपोर्ट लिखने की आवश्यकता होती है।

3. समाधान: "ग्राफ-एंकोर्ड ऑडिट" (Graph-Anchored Audit)

आप 50 पन्नों की AI रिपोर्ट को कैसे ग्रेड करेंगे? आप दूसरे AI से केवल यह नहीं पूछ सकते, "क्या यह अच्छा है?" क्योंकि AI अक्सर झूठ बोलते हैं या एक-दूसरे से सहमत होते हैं (यह "हाँ में हाँ मिलाने वाला" या "Yes-Man" समस्या है)।

इसके बजाय, लेखकों ने एक सत्य मानचित्र (Truth Map) (एक रिसर्च ग्राफ) बनाया:

  1. स्वर्ण मानक (The Gold Standard): मानव विशेषज्ञ और AI एजेंट मिलकर उत्तर के तथ्यों, तर्क और संबंधों का एक आदर्श "मानचित्र" बनाने के लिए मिलकर काम करते हैं।
  2. ऑडिट: जब एक AI रिपोर्ट लिखता है, तो सिस्टम उसे इस मानचित्र पर प्रोजेक्ट करता है।
    • क्या इसने सही तथ्य खोजे? (कवरेज)
    • क्या तथ्य वास्तव में निष्कर्ष की ओर ले जाते हैं? (तार्किक निरंतरता)
    • क्या इसने केवल एक स्रोत का उपयोग किया, या इसने कई की जाँच की? (साइटेशन स्वास्थ्य)
    • क्या यह पक्षपाती है, या यह तर्क के दोनों पक्षों को दर्शाता है? (वस्तुनिष्ठता)

इसे एक फोरेंसिक ऑडिट की तरह समझें। रिपोर्ट को केवल पढ़ने के बजाय, सिस्टम प्रत्येक दावे की जाँच एक सत्यापित डेटाबेस के विरुद्ध करता है ताकि यह देखा जा सके कि AI कल्पना कर रहा है या मनगढ़ंत बातें बना रहा है।

4. परिणाम: AI की "सीमा" (The AI Ceiling)

शोधकर्ताओं ने दुनिया के 12 सबसे स्मार्ट AI मॉडल्स का परीक्षण किया (Gemini, Claude और OpenAI के o3 सहित)।

चौंकाने वाला परिणाम: सर्वश्रेष्ठ AI का स्कोर भी लगभग 100 में से केवल 28 था।

  • इसका क्या अर्थ है: वर्तमान AI एक प्रतिभाशाली इंटर्न की तरह है जो एक किताब जल्दी पढ़ सकता है लेकिन जब उसे 1,000 अलग-अलग किताबों के आधार पर एक थीसिस लिखने के लिए कहा जाता है, तो वह खो जाता है। वे अक्सर:
    • "टनल विजन" में फंस जाते हैं (बड़ी तस्वीर को मिस कर देते हैं)।
    • "सूचना के अतिभार" का शिकार होते हैं (तथ्य एकत्र करते हैं लेकिन उन्हें जोड़ नहीं पाते)।
    • बहुत कम स्रोतों पर निर्भर रहते हैं (साइटेशन स्वास्थ्य संबंधी मुद्दे)।
    • आत्मविश्वास के साथ झूठ बोलते हैं जब वे वास्तव में केवल अनुमान लगा रहे होते हैं।

5. यह क्यों मायने रखता है?

आप सोच सकते हैं, "मुझे AI द्वारा 50 पन्नों का वैज्ञानिक शोध पत्र लिखने की आवश्यकता नहीं है।"

लेकिन लेखक तर्क देते हैं कि सुपर रिसर्च एक स्ट्रेस टेस्ट (तनाव परीक्षण) है।

  • यदि कोई AI "सुपर जटिल" प्रश्न को नहीं संभाल सकता, तो वह किसी भी जटिल, वास्तविक दुनिया के कार्य में विफल हो जाएगा जिसके लिए दीर्घकालिक योजना, तथ्यों की जाँच और पूर्वाग्रह से बचने की आवश्यकता होती है।
  • इस परीक्षण को पास करना यह सिद्ध करता है कि AI एक वास्तविक "रीजनिंग इंजन" (तर्क करने वाला इंजन) बनने के योग्य है, न कि केवल एक फैंसी ऑटो-कम्प्लीट।

मुख्य निष्कर्ष (The Takeaway)

सुपर रिसर्च AI के लिए एक नया "ओलंपिक्स" है। यह इस बारे में नहीं है कि कौन सबसे तेज़ उत्तर दे सकता है; यह इस बारे में है कि कौन सबसे गहराई से सोच सकता है, सबसे व्यापक रूप से खोज सकता है, और बिना भटके या गलतियाँ किए सबसे तार्किक तर्क बना सकता है। अभी, AI एथलीट अभी प्रशिक्षण चरण में हैं, लेकिन यह नया बेंचमार्क हमें स्पष्ट रूप से दिखाता है कि दुनिया की सबसे कठिन समस्याओं को हल करने में वास्तविक भागीदार बनने के लिए उन्हें कहाँ सुधार करने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →