DeepSearchQA: Bridging the Comprehensiveness Gap for Deep Research Agents
यह शोध पत्र DeepSearchQA को प्रस्तुत करता है, जो 17 क्षेत्रों में फैला हुआ 900-प्रॉम्प्ट वाला एक बेंचमार्क है जिसे जटिल, बहु-चरणीय सूचना-खोज कार्यों पर डीप रिसर्च एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी व्यवस्थित सूचना संकलन, एंटिटी रेजोल्यूशन और स्टॉपिंग क्राइटेरिया (विराम मानदंडों) में रिकॉल और प्रिसिजन के बीच संतुलन बनाने में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप मुझे जानकारी खोजने के लिए एक रिसर्च असिस्टेंट (अनुसंधान सहायक) के रूप में काम पर रख रहे हैं। अतीत में, हमने इन सहायकों का परीक्षण ज्यादातर सरल प्रश्नों के साथ किया था जैसे, "फ्रांस की राजधानी क्या है?" यदि उन्हें उत्तर मिल गया, तो वे पास हो गए। यदि वे गलत हुए, तो वे फेल हो गए। यह एक बहुविकल्पीय प्रश्न (multiple-choice quiz) की तरह था: ग्रेडिंग करना आसान था, लेकिन इससे हमें यह पता नहीं चलता था कि क्या सहायक एक वास्तविक, जटिल शोध परियोजना को संभाल सकता है।
पेपर "DeepSearchQA" एक नया, बहुत कठिन टेस्ट पेश करता है जो यह देखने के लिए डिज़ाइन किया गया है कि क्या AI एजेंट वास्तव में शोधकर्ता की तरह कार्य कर सकते हैं, न कि केवल ट्रिविया बॉट्स की तरह।
यहाँ बताया गया है कि उन्होंने क्या किया और उन्हें क्या मिला, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: "घास के ढेर में सुई" बनाम "पूरा घास का ढेर"
पुराने टेस्ट्स में AI को घास के ढेर में एक विशिष्ट सुई खोजने के लिए कहा जाता था (जैसे, "फ्रांस की राजधानी क्या है?")।
- समस्या: वास्तविक जीवन ऐसा नहीं है। कभी-कभी आपको घास के ढेर में हर एक सुई के बारे में जानने की आवश्यकता होती है, या घास के सभी अलग-अलग प्रकारों को सूचीबद्ध करने की आवश्यकता होती है।
- नई चुनौती: DeepSearchQA ऐसे प्रश्न पूछता है जैसे, "उन सभी वीडियो गेम कंसोल की सूची बनाएं जिन्होंने 100 मिलियन से अधिक यूनिट बेचीं, जो पोर्टेबल नहीं थे, जिनमें 32-बिट CPU था, और जिनकी मूल कंपनी की संपत्ति 2010 में 1.7 ट्रिलियन डॉलर से अधिक थी।"
- लक्ष्य: AI केवल एक उत्तर का अनुमान नहीं लगा सकता। इसे एक पूर्ण, सटीक सूची बनानी होगी। यदि यह एक भी आइटम छोड़ देता है, तो यह अधूरा है। यदि यह एक भी फर्जी आइटम जोड़ देता है, तो यह गलत है।
2. तीन कठिन कौशल जिनका परीक्षण किया गया
इस नए टेस्ट को पास करने के लिए, एक AI एजेंट को तीन कठिन कौशलों में महारत हासिल करनी होगी जिन्हें पुराने टेस्ट अनदेखा कर देते थे:
- कौशल 1: लाइब्रेरियन (व्यवस्थित संकलन - Systematic Collation)
कल्पना कीजिए कि आपको एक रिपोर्ट लिखनी है, लेकिन जानकारी 50 अलग-अलग वेबसाइटों पर बिखरी हुई है, और किसी के पास भी पूरी कहानी नहीं है। AI को उन सभी पर जाना होगा, उन्हें पढ़ना होगा, और टुकड़ों को एक मास्टर लिस्ट में जोड़ने के लिए एक साथ लाना होगा। यह केवल पहली वेबसाइट पर निर्भर होकर काम नहीं चला सकता जो उसे मिली। - कौशल 2: जासूस (एंटिटी रेज़ोल्यूशन - Entity Resolution)
कल्पना कीजिए कि आप "Apple" की तलाश कर रहे हैं। एक वेबसाइट कहती है "Apple Inc.", दूसरी कहती है "Apple Computer", और तीसरी कहती है "वह कंपनी जिसकी स्थापना स्टीव जॉब्स ने की थी।" एक इंसान जानता है कि ये सब एक ही चीज़ हैं। एक AI अक्सर भ्रमित हो जाता है और उन्हें तीन अलग-अलग कंपनियों के रूप में सूचीबद्ध करता है। यह टेस्ट यह जाँचता है कि क्या AI यह समझ पाता है कि वे एक ही हैं और डुप्लिकेट को हटा देता है। - कौशल 3: स्टॉप साइन (रुकने के बारे में तर्क - Reasoning about Stopping)
यह सबसे कठिन हिस्सा है। एक सामान्य खोज में, आप उत्तर मिलने पर रुक जाते हैं। लेकिन एक "डीप रिसर्च" कार्य में, कोई फिनिश लाइन नहीं होती। AI को यह जानना होता है कि खोज कब रोकनी है।- बहुत जल्दी: यह सभी उत्तर खोजने से पहले ही रुक जाता है (अल्प-प्राप्ति/Under-retrieval)।
- बहुत देर से: यह खोज जारी रखता है और सूची भरने के लिए उत्तर बनाना शुरू कर देता है (अति-प्राप्ति/Over-retrieval/Hedging)। यह उस शेफ की तरह है जो सूप में तब तक सामग्री मिलाता रहता है जब तक कि उसका स्वाद खराब न हो जाए, सिर्फ इसलिए ताकि वह यह सुनिश्चित कर सके कि उसने कुछ छोड़ा नहीं है।
3. टेस्ट: 900 वास्तविक दुनिया के परिदृश्य
शोधकर्ताओं ने DeepSearchQA नामक एक बेंचमार्क बनाया जिसमें 17 विभिन्न क्षेत्रों (जैसे स्वास्थ्य, वित्त, इतिहास और गेमिंग) में 900 कठिन प्रश्न शामिल हैं।
- नियम: उत्तर स्थिर तथ्यों (जैसे 2020 की जनगणना डेटा) पर आधारित हैं ताकि टेस्ट चलते समय वे बदल न सकें।
- ग्रेडिंग: उन्हें इस बात से फर्क नहीं पड़ता कि AI ने उत्तर कैसे पाया (उसने जो रास्ता अपनाया)। उन्हें केवल अंतिम सूची की परवाह है। क्या उसने सूची को 100% सही प्राप्त किया?
- परफेक्ट (Perfect): सूची बिल्कुल सही है।
- आंशिक (Partial): उसने कुछ सही पाए लेकिन कुछ छोड़ दिए।
- भ्रम/हैलुसिनेशन (Hallucination): उसने सही आइटम तो पाए लेकिन पूरी तरह दिखने के लिए फर्जी आइटम भी जोड़ दिए।
4. उन्हें क्या मिला: "लास्ट माइल" (अंतिम मील) की समस्या
उन्होंने उपलब्ध सबसे स्मार्ट AI मॉडल्स (जैसे Google का Gemini Deep Research और OpenAI का GPT-5 Pro) का परीक्षण किया। यहाँ क्या हुआ:
- अच्छी खबर: सर्वश्रेष्ठ AI एजेंट इस काम में बहुत अच्छे होते जा रहे हैं। शीर्ष मॉडल्स ने लगभग 66% सूचियों को पूरी तरह से सही पाया। यह पुराने मॉडल्स की तुलना में एक बड़ी छलांग है।
- बुरी खबर: यहाँ तक कि सर्वश्रेष्ठ मॉडल्स भी "लास्ट माइल" के साथ संघर्ष करते हैं।
- अंतराल (The Gap): एक AI 90% सही उत्तर ढूंढ सकता है (उच्च रिकॉल), लेकिन वह रुकने में विफल रहता है, और सूची में 5 गलत उत्तर जोड़ देता है। यह स्कोर खराब कर देता है।
- "हेजिंग" का जाल (The Hedging Trap): जब AI सुनिश्चित नहीं होता कि वह समाप्त कर चुका है, तो वह सुरक्षित रहने के लिए वह सब कुछ सूचीबद्ध करने की कोशिश करता है जो वह सोच सकता है, जिसमें वे चीजें भी शामिल हैं जिनके बारे में वह निश्चित नहीं है। यह एक छात्र की तरह है जो केवल आंशिक क्रेडिट पाने के लिए परीक्षा में अनुमान लगाता है, लेकिन इस मामले में, यह उनके ग्रेड को कम कर देता है।
- "स्टेप-फंक्शन" गिरावट (The Step-Function Drop): यदि आप एक छोटा, सस्ता AI मॉडल उपयोग करते हैं, तो प्रदर्शन केवल थोड़ा कम नहीं होता; बल्कि वह गिर जाता है। इन जटिल कार्यों के लिए योजना बनाने के लिए एक निश्चित स्तर के "ब्रेन पावर" की आवश्यकता होती है। एक निश्चित सीमा से नीचे, AI तुरंत भटक जाता है और कुछ भी नहीं ढूंढ पाता।
5. निष्कर्ष
यह पेपर तर्क देता है कि हम एक मोड़ पर हैं। हमने AI से "उत्तर क्या है?" पूछने से आगे बढ़कर "क्या आप पूरे विषय में महारत हासिल कर सकते हैं?" तक का सफर तय कर लिया है।
वर्तमान AI मॉडल सुई खोजने में सक्षम हैं, लेकिन वे अभी भी यह सीख रहे हैं कि बिना रास्ता भटके या गलत चीजें बनाए बिना पूरे घास के ढेर का मानचित्र कैसे बनाया जाए। DeepSearchQA शोधकर्ताओं को इस विशिष्ट समस्या को ठीक करने में मदद करने के लिए एक उपकरण है: AI को यह सिखाना कि कब खोजना बंद करना है और कैसे बिना लापरवाही के पूरी तरह से सटीक होना है।
संक्षेप में: हम AI को एक ट्रिविया चैंपियन बनने के बजाय एक पेशेवर शोधकर्ता बनने के लिए सिखा रहे हैं जो बिना गलती किए एक जटिल, बहु-चरणीय जांच को संभाल सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।