← नवीनतम पेपर
💬 NLP

DeepSearchQA: Bridging the Comprehensiveness Gap for Deep Research Agents

यह शोध पत्र DeepSearchQA को प्रस्तुत करता है, जो 17 क्षेत्रों में फैला हुआ 900-प्रॉम्प्ट वाला एक बेंचमार्क है जिसे जटिल, बहु-चरणीय सूचना-खोज कार्यों पर डीप रिसर्च एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी व्यवस्थित सूचना संकलन, एंटिटी रेजोल्यूशन और स्टॉपिंग क्राइटेरिया (विराम मानदंडों) में रिकॉल और प्रिसिजन के बीच संतुलन बनाने में संघर्ष करते हैं।

मूल लेखक: Nikita Gupta, Riju Chatterjee, Lukas Haas, Connie Tao, Andrew Wang, Chang Liu, Hidekazu Oiwa, Elena Gribovskaya, Jan Ackermann, John Blitzer, Sasha Goldshtein, Dipanjan Das

प्रकाशित 2026-01-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nikita Gupta, Riju Chatterjee, Lukas Haas, Connie Tao, Andrew Wang, Chang Liu, Hidekazu Oiwa, Elena Gribovskaya, Jan Ackermann, John Blitzer, Sasha Goldshtein, Dipanjan Das

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप मुझे जानकारी खोजने के लिए एक रिसर्च असिस्टेंट (अनुसंधान सहायक) के रूप में काम पर रख रहे हैं। अतीत में, हमने इन सहायकों का परीक्षण ज्यादातर सरल प्रश्नों के साथ किया था जैसे, "फ्रांस की राजधानी क्या है?" यदि उन्हें उत्तर मिल गया, तो वे पास हो गए। यदि वे गलत हुए, तो वे फेल हो गए। यह एक बहुविकल्पीय प्रश्न (multiple-choice quiz) की तरह था: ग्रेडिंग करना आसान था, लेकिन इससे हमें यह पता नहीं चलता था कि क्या सहायक एक वास्तविक, जटिल शोध परियोजना को संभाल सकता है।

पेपर "DeepSearchQA" एक नया, बहुत कठिन टेस्ट पेश करता है जो यह देखने के लिए डिज़ाइन किया गया है कि क्या AI एजेंट वास्तव में शोधकर्ता की तरह कार्य कर सकते हैं, न कि केवल ट्रिविया बॉट्स की तरह।

यहाँ बताया गया है कि उन्होंने क्या किया और उन्हें क्या मिला, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "घास के ढेर में सुई" बनाम "पूरा घास का ढेर"

पुराने टेस्ट्स में AI को घास के ढेर में एक विशिष्ट सुई खोजने के लिए कहा जाता था (जैसे, "फ्रांस की राजधानी क्या है?")।

  • समस्या: वास्तविक जीवन ऐसा नहीं है। कभी-कभी आपको घास के ढेर में हर एक सुई के बारे में जानने की आवश्यकता होती है, या घास के सभी अलग-अलग प्रकारों को सूचीबद्ध करने की आवश्यकता होती है।
  • नई चुनौती: DeepSearchQA ऐसे प्रश्न पूछता है जैसे, "उन सभी वीडियो गेम कंसोल की सूची बनाएं जिन्होंने 100 मिलियन से अधिक यूनिट बेचीं, जो पोर्टेबल नहीं थे, जिनमें 32-बिट CPU था, और जिनकी मूल कंपनी की संपत्ति 2010 में 1.7 ट्रिलियन डॉलर से अधिक थी।"
  • लक्ष्य: AI केवल एक उत्तर का अनुमान नहीं लगा सकता। इसे एक पूर्ण, सटीक सूची बनानी होगी। यदि यह एक भी आइटम छोड़ देता है, तो यह अधूरा है। यदि यह एक भी फर्जी आइटम जोड़ देता है, तो यह गलत है।

2. तीन कठिन कौशल जिनका परीक्षण किया गया

इस नए टेस्ट को पास करने के लिए, एक AI एजेंट को तीन कठिन कौशलों में महारत हासिल करनी होगी जिन्हें पुराने टेस्ट अनदेखा कर देते थे:

  • कौशल 1: लाइब्रेरियन (व्यवस्थित संकलन - Systematic Collation)
    कल्पना कीजिए कि आपको एक रिपोर्ट लिखनी है, लेकिन जानकारी 50 अलग-अलग वेबसाइटों पर बिखरी हुई है, और किसी के पास भी पूरी कहानी नहीं है। AI को उन सभी पर जाना होगा, उन्हें पढ़ना होगा, और टुकड़ों को एक मास्टर लिस्ट में जोड़ने के लिए एक साथ लाना होगा। यह केवल पहली वेबसाइट पर निर्भर होकर काम नहीं चला सकता जो उसे मिली।
  • कौशल 2: जासूस (एंटिटी रेज़ोल्यूशन - Entity Resolution)
    कल्पना कीजिए कि आप "Apple" की तलाश कर रहे हैं। एक वेबसाइट कहती है "Apple Inc.", दूसरी कहती है "Apple Computer", और तीसरी कहती है "वह कंपनी जिसकी स्थापना स्टीव जॉब्स ने की थी।" एक इंसान जानता है कि ये सब एक ही चीज़ हैं। एक AI अक्सर भ्रमित हो जाता है और उन्हें तीन अलग-अलग कंपनियों के रूप में सूचीबद्ध करता है। यह टेस्ट यह जाँचता है कि क्या AI यह समझ पाता है कि वे एक ही हैं और डुप्लिकेट को हटा देता है।
  • कौशल 3: स्टॉप साइन (रुकने के बारे में तर्क - Reasoning about Stopping)
    यह सबसे कठिन हिस्सा है। एक सामान्य खोज में, आप उत्तर मिलने पर रुक जाते हैं। लेकिन एक "डीप रिसर्च" कार्य में, कोई फिनिश लाइन नहीं होती। AI को यह जानना होता है कि खोज कब रोकनी है
    • बहुत जल्दी: यह सभी उत्तर खोजने से पहले ही रुक जाता है (अल्प-प्राप्ति/Under-retrieval)।
    • बहुत देर से: यह खोज जारी रखता है और सूची भरने के लिए उत्तर बनाना शुरू कर देता है (अति-प्राप्ति/Over-retrieval/Hedging)। यह उस शेफ की तरह है जो सूप में तब तक सामग्री मिलाता रहता है जब तक कि उसका स्वाद खराब न हो जाए, सिर्फ इसलिए ताकि वह यह सुनिश्चित कर सके कि उसने कुछ छोड़ा नहीं है।

3. टेस्ट: 900 वास्तविक दुनिया के परिदृश्य

शोधकर्ताओं ने DeepSearchQA नामक एक बेंचमार्क बनाया जिसमें 17 विभिन्न क्षेत्रों (जैसे स्वास्थ्य, वित्त, इतिहास और गेमिंग) में 900 कठिन प्रश्न शामिल हैं।

  • नियम: उत्तर स्थिर तथ्यों (जैसे 2020 की जनगणना डेटा) पर आधारित हैं ताकि टेस्ट चलते समय वे बदल न सकें।
  • ग्रेडिंग: उन्हें इस बात से फर्क नहीं पड़ता कि AI ने उत्तर कैसे पाया (उसने जो रास्ता अपनाया)। उन्हें केवल अंतिम सूची की परवाह है। क्या उसने सूची को 100% सही प्राप्त किया?
    • परफेक्ट (Perfect): सूची बिल्कुल सही है।
    • आंशिक (Partial): उसने कुछ सही पाए लेकिन कुछ छोड़ दिए।
    • भ्रम/हैलुसिनेशन (Hallucination): उसने सही आइटम तो पाए लेकिन पूरी तरह दिखने के लिए फर्जी आइटम भी जोड़ दिए।

4. उन्हें क्या मिला: "लास्ट माइल" (अंतिम मील) की समस्या

उन्होंने उपलब्ध सबसे स्मार्ट AI मॉडल्स (जैसे Google का Gemini Deep Research और OpenAI का GPT-5 Pro) का परीक्षण किया। यहाँ क्या हुआ:

  • अच्छी खबर: सर्वश्रेष्ठ AI एजेंट इस काम में बहुत अच्छे होते जा रहे हैं। शीर्ष मॉडल्स ने लगभग 66% सूचियों को पूरी तरह से सही पाया। यह पुराने मॉडल्स की तुलना में एक बड़ी छलांग है।
  • बुरी खबर: यहाँ तक कि सर्वश्रेष्ठ मॉडल्स भी "लास्ट माइल" के साथ संघर्ष करते हैं।
    • अंतराल (The Gap): एक AI 90% सही उत्तर ढूंढ सकता है (उच्च रिकॉल), लेकिन वह रुकने में विफल रहता है, और सूची में 5 गलत उत्तर जोड़ देता है। यह स्कोर खराब कर देता है।
    • "हेजिंग" का जाल (The Hedging Trap): जब AI सुनिश्चित नहीं होता कि वह समाप्त कर चुका है, तो वह सुरक्षित रहने के लिए वह सब कुछ सूचीबद्ध करने की कोशिश करता है जो वह सोच सकता है, जिसमें वे चीजें भी शामिल हैं जिनके बारे में वह निश्चित नहीं है। यह एक छात्र की तरह है जो केवल आंशिक क्रेडिट पाने के लिए परीक्षा में अनुमान लगाता है, लेकिन इस मामले में, यह उनके ग्रेड को कम कर देता है।
  • "स्टेप-फंक्शन" गिरावट (The Step-Function Drop): यदि आप एक छोटा, सस्ता AI मॉडल उपयोग करते हैं, तो प्रदर्शन केवल थोड़ा कम नहीं होता; बल्कि वह गिर जाता है। इन जटिल कार्यों के लिए योजना बनाने के लिए एक निश्चित स्तर के "ब्रेन पावर" की आवश्यकता होती है। एक निश्चित सीमा से नीचे, AI तुरंत भटक जाता है और कुछ भी नहीं ढूंढ पाता।

5. निष्कर्ष

यह पेपर तर्क देता है कि हम एक मोड़ पर हैं। हमने AI से "उत्तर क्या है?" पूछने से आगे बढ़कर "क्या आप पूरे विषय में महारत हासिल कर सकते हैं?" तक का सफर तय कर लिया है।

वर्तमान AI मॉडल सुई खोजने में सक्षम हैं, लेकिन वे अभी भी यह सीख रहे हैं कि बिना रास्ता भटके या गलत चीजें बनाए बिना पूरे घास के ढेर का मानचित्र कैसे बनाया जाए। DeepSearchQA शोधकर्ताओं को इस विशिष्ट समस्या को ठीक करने में मदद करने के लिए एक उपकरण है: AI को यह सिखाना कि कब खोजना बंद करना है और कैसे बिना लापरवाही के पूरी तरह से सटीक होना है।

संक्षेप में: हम AI को एक ट्रिविया चैंपियन बनने के बजाय एक पेशेवर शोधकर्ता बनने के लिए सिखा रहे हैं जो बिना गलती किए एक जटिल, बहु-चरणीय जांच को संभाल सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →