← नवीनतम पेपर
🤖 AI

From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution

यह शोध पत्र एक सत्यापन योग्य गहन अनुसंधान बेंचमार्क प्रस्तुत करता है जिसमें 31 विषयों पर 500 स्वचालित रूप से उत्पन्न कार्य शामिल हैं, जिसे एक पुनरावृत्ति एक्सप्लोरर-फॉर्मलाइज़र-चैलेंजर पाइपलाइन के माध्यम से निर्मित किया गया है जो सरल प्रश्नों को जटिल प्रश्नों में परिवर्तित करता है जिन्हें सूक्ष्म, मानव-संरेखित मूल्यांकन के लिए ट्रेस करने योग्य चेकपॉइंट्स वाले निर्देशित अचक्रीय ग्राफ़ (डायरेक्टेड एसाइक्लिक ग्राफ) के रूप में दर्शाया गया है।

मूल लेखक: Can Wang, Haoran Chen, Haowen Gao, Hao Ding, Zhaoyang Liu, Zhiying Tu

प्रकाशित 2026-08-04
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Can Wang, Haoran Chen, Haowen Gao, Hao Ding, Zhaoyang Liu, Zhiying Tu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: सरल QA से गहन अनुसंधान तक

समस्या विवरण

गहन अनुसंधान (deep research) कार्यों के लिए AI एजेंटों को केवल सरल तथ्य प्राप्ति (fact retrieval) से आगे बढ़कर डोमेन ज्ञान को एकीकृत करने, बहु-चरणीय तर्क (multi-step reasoning) करने और उच्च गुणवत्ता वाले, खुले-अंत वाले उत्तर देने की आवश्यकता होती है। हालाँकि, इन कार्यों के लिए विश्वसनीय बेंचमार्क बनाना चुनौतीपूर्ण है। मौजूदा बेंचमार्क अक्सर महंगे विशेषज्ञ लेखन या पूर्व-मौजूदा मानवीय सामग्रियों पर निर्भर करते हैं, जो स्केलेबिलिटी को सीमित करते हैं। इसके विपरीत, पूरी तरह से स्वचालित निर्माण विधियाँ निरंतर, पता लगाने योग्य सत्यापन (traceable verification) सुनिश्चित करने में संघर्ष करती हैं और अक्सर सूक्ष्म मूल्यांकन के लिए आवश्यक कार्य-विशिष्ट ज्ञान की कमी होती है। वर्तमान स्वचालित दृष्टिकोण या तो मॉडलों की सापेक्ष तुलना करते हैं (रिपोर्ट समानता के आधार पर रैंकिंग) या ऐसे मूल्यांकन मानदंड (rubrics) उत्पन्न करते हैं जिनमें गारंटीकृत विश्वसनीयता और पेशेवर गुणवत्ता का अभाव होता है। मुख्य चुनौती यह है कि बिना किसी मैन्युअल विशेषज्ञ लेखन पर निर्भर हुए, बिना किसी मानवीय विशेषज्ञ के पेशेवर रूप से गहरे अनुसंधान कार्यों का एक विविध संग्रह कैसे बनाया जाए।

कार्यप्रणाली

यह शोध पत्र एक पुनरावृत्ति एक्सप्लोरर-फॉर्मलाइज़र-चैलेंजर लूप (Explorer–Formalizer–Challenger loop) पर केंद्रित एक पूर्णतः स्वचालित बेंचमार्क निर्माण पाइपलाइन पेश करता है। यह पाइपलाइन सरल प्रश्नों को जटिल गहन अनुसंधान कार्यों में क्रमिक रूप से परिवर्तित करती है।

1. कार्य प्रतिनिधित्व (Task Representation)

एक कार्य का मुख्य संरचनात्मक प्रतिनिधित्व एक डायरेक्टेड एसाइक्लिक ग्राफ (DAG) है।

  • नोड्स (Nodes): परमाणु अनुसंधान चरणों (atomic research steps) का प्रतिनिधित्व करते हैं, जिन्हें या तो साक्ष्य-आधारित (traceable तथ्यों को प्राप्त करना) या विश्लेषणात्मक (अनुमान या तुलना करना) के रूप में वर्गीकृत किया गया है।
  • एजेस (Edges): चरणों के बीच तार्किक निर्भरता का प्रतिनिधित्व करते हैं।
  • चेकपॉइंट्स (Checkpoints): प्रत्येक नोड में पर्यावरण के साथ एजेंट की बातचीत से प्राप्त सत्यापन योग्य चेकपॉइंट्स शामिल होते हैं।
    यह संरचना सुनिश्चित करती है कि समाधान प्रक्रिया स्पष्ट, विघटनीय (decomposable) और पता लगाने योग्य है।

2. निर्माण पाइपलाइन

पाइपलाइन एक सरल क्वेरी q1q_1 को गहन अनुसंधान कार्य qTq_T में विकसित करने के लिए तीन भूमिकाओं के माध्यम से पुनरावृत्ति करती है:

  • एक्सप्लोरर (Explorer): उपकरणों (जैसे खोज, वेब स्क्रैपिंग) का उपयोग करके एक खुले वातावरण में वर्तमान क्वेरी को हल करता है। यह खोजी गई जानकारी, साक्ष्य और विश्लेषण का एक प्रक्षेपवक्र (trajectory) उत्पन्न करता है। यह चरण ऐसी 'लॉन्ग-टेल' और विरल (sparse) जानकारी को उजागर करने के लिए डिज़ाइन किया गया है जो केवल तभी खोज योग्य होती है जब खोज के इरादों (search intents) को परिष्कृत किया जाता है।
  • फॉर्मलाइज़र (Formalizer): एक्सप्लोरर के प्रक्षेपवक्रम को अपडेट करने के लिए टास्क DAG (GG) को पार्स करता है और एक संगत सेट योग्य रूब्रिक्स (RR) को व्युत्पन्न करता है।
    • यह प्रक्षेपवक्रम को एक DAG में व्यवस्थित करता है, यह सुनिश्चित करते हुए कि ग्राफ क्वेरी का उत्तर देने के लिए पर्याप्त है लेकिन न्यूनतम भी है (अप्रासंगिक नोड्स को हटाना और अर्थपूर्ण रूप से समान नोड्स को मिलाना)।
    • यह विशिष्ट साक्ष्यों पर आधारित प्रत्येक नोड के लिए पॉइंटवाइज रूब्रिक्स उत्पन्न करता है।
    • यह DAG संरचना के आधार पर नोड्स को भार (weights) आवंटित करता है (पत्तियों से जड़ों की ओर भार का प्रसार) ताकि विभिन्न अनुसंधान चरणों के सापेक्ष महत्व को दर्शाया जा सके।
  • चैलेंजर (Challenger): प्रक्षेपवक्रम में उन खोजी गई लेकिन अप्रयुक्त सुरागों (unused clues) की पहचान करता है जो कार्य से तार्किक रूप से जुड़े हुए हैं। यह इन "अप्रयुक्त" दिशाओं का उपयोग अगले दौर के लिए एक कठिन क्वेरी (qt+1q_{t+1}) उत्पन्न करने के लिए करता है, जो प्रभावी रूप से कार्य के दायरे (चौड़ाई) या तर्क की गहराई को बढ़ाता है। महत्वपूर्ण रूप से, यह नए क्वेरी को समाधान पथ का खुलासा करने से रोकने के लिए विशिष्ट चेकपॉइंट्स को मास्क (mask) कर देता है।

रोकने का मानदंड (Stopping Criterion): विकास तब रुक जाता है जब दो लगातार राउंड के लिए DAG संरचना (नोड्स और एजेस) अपरिवर्तित रहती है, जो यह दर्शाता है कि कार्य अपने संतृप्ति बिंदु (saturation point) पर पहुँच गया है जहाँ कोई और प्रासंगिक ज्ञान एकीकृत नहीं किया जा सकता है।

3. क्वेरी डिज़ाइन

अंतिम अभिसरित (converged) कार्य से, पूरक क्षमताओं का परीक्षण करने के लिए तीन अलग-अलग क्वेरी रूप उत्पन्न किए जाते हैं:

  • संकेतों के साथ क्वेरी (qThq^h_T): विश्लेषण आयामों और बाधाओं वाला पूर्ण, जटिल प्रश्न। यह समृद्ध सुरागों के तहत सूचना प्रसंस्करण का परीक्षण करता है।
  • संकेतों के बिना क्वेरी (qToq^o_T): जटिल क्वेरी से व्युत्पन्न एक संक्षिप्त, रोजमर्रा का प्रश्न, जिसमें बाधाओं को हटा दिया गया है। यह छिपी हुई बाधाओं के तहत अपघटन (decomposition) और योजना बनाने का परीक्षण करता है।
  • निर्धारित-विषय क्वेरी (qTaq^a_T): एक घोषणात्मक अनुसंधान शीर्षक। यह स्पष्ट प्रश्न ढांचे के बिना एक दिशात्मक विषय के तहत तर्क निर्माण का परीक्षण करता है।

मुख्य योगदान

  1. एक सत्यापन योग्य बेंचमार्क: लेखकों ने 500 गहन अनुसंधान कार्यों का एक बेंचमार्क बनाया जो 31 विषयों और 10 प्रमुख श्रेणियों में फैला हुआ है। प्रत्येक कार्य को तीन उल्लेखित क्वेरी रूपों और तथ्य-आधारित पॉइंटवाइज रूब्रिक्स के साथ जोड़ा गया है।
  2. पूर्णतः स्वचालित निर्माण पाइपलाइन: उन्होंने एक नवीन पाइपलाइन पेश की जो सरल प्रश्नों को परमाणु चरणों के DAG में पुनरावृत्ति के माध्यम से विस्तारित करती है। यह दृष्टिकोण सक्षम बनाता है कि क्वेरी, कार्य संरचना और रूब्रिक्स, बिना किसी मैन्युअल लेखक या पूर्व-लिखित विशेषज्ञ सामग्री के, एक साथ विकसित हों।
  3. सूक्ष्म-स्तरीय मूल्यांकन (Fine-Grained Evaluation): यह बेंचमार्क प्रदर्शित करता है कि इसके रूब्रिक्स स्थिर, मानव-संरेखित और सूक्ष्म-स्तरीय मूल्यांकन को सक्षम करते हैं, जो बाइनरी निर्णयों या सापेक्ष रैंकिंग की तुलना में मॉडल प्रदर्शन को अधिक प्रभावी ढंग से अलग करते हैं।

परिणाम

प्रयोग 10 लोकप्रिय मॉडलों (GPT-5.6, Claude Sonnet 5, DeepSeek-V4-Pro और विभिन्न Qwen संस्करणों सहित) पर दो सेटिंग्स के तहत किए गए: एजेंट मोड (उपकरणों के साथ) और मॉडल मोड (केवल आंतरिक ज्ञान)।

  • भेदभाव (Discrimination): बेंचमार्क विभिन्न क्षमताओं वाले मॉडलों के बीच स्पष्ट अंतर करता है। मजबूत मॉडल (जैसे GPT-5.6 Terra) सभी क्वेरी प्रकारों में कमजोर मॉडलों की तुलना में लगातार बेहतर प्रदर्शन करते हैं।
  • क्षमता प्रवणता (Capability Gradient): स्कोर एक निरंतर प्रसार दिखाते हैं न कि क्लस्टरिंग, जो इंगित करता है कि रूब्रिक्स सूक्ष्म-स्तरीय ग्रेड संतुष्टि प्रदान करते हैं।
  • उपकरणों का प्रभाव: सभी मॉडलों और क्वेरी प्रकारों में उपकरणों को हटाने से प्रदर्शन में महत्वपूर्ण गिरावट (औसत 0.14 की कमी) आई, जो पुष्टि करता है कि कार्य ऐसी 'लॉन्ग-टेल' जानकारी को एनकोड करते हैं जो प्री-ट्रेनिंग डेटा में मौजूद नहीं है।
  • क्वेरी प्रकार संवेदनशीलता: मॉडलों ने क्वेरी प्रकारों के अनुसार अलग-अलग ताकत दिखाई। उदाहरण के लिए, कमजोर संकेत (qToq^o_T) ने विश्लेषणात्मक तर्क की ओर प्रदर्शन अंतराल को स्थानांतरित कर दिया, जिससे पता चला कि छोटे मॉडल व्यापक लक्ष्यों को तोड़ने और साक्ष्य को एकीकृत करने में अधिक संघर्ष करते हैं।
  • मानव संरेखण (Human Alignment): 100 नमूनाकृत कार्यों की मानव समीक्षाओं ने उच्च गुणवत्ता (कोई "खराब" रेटिंग नहीं) और समीक्षकों के बीच उच्च सहमति दिखाई। इसके अलावा, LLM द्वारा स्वचालित निर्णय मानव रेटिंग के साथ उच्च सहसंबंध (Pearson r0.90r \approx 0.90) दिखाया, जो उत्पन्न रूब्रिक्स की विश्वसनीयता को प्रमाणित करता है।

महत्व

यह पेपर दावा करता है कि इसका प्राथमिक महत्व गहन अनुसंधान बेंचमार्क की आवश्यकता और बिना मानव विशेषज्ञों के उन्हें विश्वसनीय रूप से बनाने की कठिनाई के बीच के अंतर को संबोधित करने में निहित है। यह प्रदर्शित करके कि एक पुनरावृत्ति, एजेंट-संचालित प्रक्रिया ट्रेस करने योग्य, सत्यापन योग्य रूब्रिक्स के साथ कार्य उत्पन्न कर सकती है, यह कार्य अगली पीढ़ी के AI एजेंटों के मूल्यांकन के लिए एक स्केलेबल मार्ग प्रदान करता है। बेंचमार्क गहन अनुसंधान क्षमताओं का आकलन करने के लिए एक स्थिर, सूक्ष्म-स्तरीय मीट्रिक प्रदान करता है, जो वर्तमान मॉडलों की विशिष्ट कमजोरियों (जैसे स्पष्ट मार्गदर्शन के बिना छिपे हुए लक्ष्यों को खोजने या साक्ष्य को एकीकृत करने में असमर्थता) को उजागर करता है जिन्हें मौजूदा बेंचमार्क नहीं पकड़ पाते हैं। लेखक निर्माण लागत (पाइपलाइन के लिए फ्रंटियर मॉडल्स का उपयोग करके) को समुदाय के लिए एक विश्वसनीय संसाधन बनाने के लिए एक आवश्यक निवेश के रूप में देखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →