← नवीनतम पेपर
💬 NLP

WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models

यह शोध पत्र WebAggregator को प्रस्तुत करता है, जो एक डेटा सिंथेसिस पाइपलाइन है जो एक क्यूरेटेड 10K SFT डेटासेट के माध्यम से डीप रिसर्च एजेंटों को रिट्रीवल-हैवी (सूचना प्राप्ति-प्रधान) से कंपोजिशन-फोकस्ड (संयोजन-केंद्रित) रीजनिंग की ओर स्थानांतरित करती है, जिससे एक 32B मॉडल बेंचमार्क पर शीर्ष-स्तरीय सिस्टम्स को पछाड़ने में सक्षम होता है और यह प्रदर्शित करता है कि अगली पीढ़ी के रिसर्च एजेंटों के लिए रिट्रीवल के बजाय कंपोजिशनल रीजनिंग ही प्राथमिक बाधा है।

मूल लेखक: Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong

प्रकाशित 2026-04-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ WebAggregator पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।

बड़ी समस्या: "गूगलर" बनाम "डिटेक्टिव" (जासूस)

कल्पना कीजिए कि आप एक रिसर्च असिस्टेंट रख रहे हैं।

  • पुराना तरीका (वर्तमान AI एजेंट्स): आप उनसे पूछते हैं, "2024 का पुरस्कार किसने जीता?" वे तुरंत एक ब्राउज़र खोलते हैं, गूगल पर सवाल टाइप करते हैं, एक लिस्ट ढूंढते हैं, और ऊपर दिए गए नाम की ओर इशारा करते हैं। यह सूचना खोजना (Information Seeking) है। यह तेज़ है, लेकिन यह एक तोते की तरह है जो वही दोहराता है जो उसने सुना है। यदि उत्तर के लिए किसी पहेली को सुलझाने के लिए तीन अलग-अलग वेबसाइटों से तीन अलग-अलग तथ्यों को जोड़ने की आवश्यकता है, तो तोता भ्रमित हो जाता है।
  • नया लक्ष्य (गहन शोध/Deep Research): आप पूछते हैं, "20 लाख वर्ग किलोमीटर से बड़े सभी देशों में से, 2010 और 2020 के बीच किस देश की अर्थव्यवस्था सबसे अधिक अस्थिर रही?" इसका उत्तर देने के लिए, एजेंट केवल उत्तर को "ढूंढ" नहीं सकता। उसे यह करना होगा:
    1. बड़े देशों की एक सूची ढूंढना।
    2. प्रत्येक के लिए आर्थिक डेटा ढूंढना।
    3. "अस्थिरता" (volatility) की गणना करने के लिए जटिल गणित करना।
    4. परिणामों की तुलना करना।
      यह कंपोजिशनल रीजनिंग (Compositional Reasoning) है। यह एक जासूस की तरह है जो एक रहस्य को सुलझाने के लिए सुरागों को जोड़ता है, न कि केवल एक हेडलाइन पढ़ने की तरह।

पेपर का तर्क है कि वर्तमान AI एजेंट्स "गूगलर" बनने में तो माहिर हैं लेकिन "डिटेक्टिव" बनने में बहुत खराब हैं। वे सही लिंक खोजने पर बहुत अधिक निर्भर करते हैं और जो उन्होंने पाया है उस पर गहराई से सोचने पर बहुत कम।

समाधान: WebAggregator (एक "ट्रेनिंग जिम")

इसे ठीक करने के लिए, शोधकर्ताओं ने WebAggregator नामक एक सिस्टम बनाया। इसे एक नया AI न समझें, बल्कि एक विशेष प्रशिक्षण शिविर (training camp) समझें जिसे एक "गूगलर" को "डिटेक्टिव" में बदलने के लिए डिज़ाइन किया गया है।

यह सिस्टम दो मुख्य चरणों में काम करता है, जैसे कि दो लोगों की टीम एक कठिन परीक्षा तैयार कर रही हो:

  1. प्रोएक्टिव एक्सप्लोरर (द स्कैवेंजर - कूड़ा बीनने वाला):
    कल्पना कीजिए कि एक रोबोट को एक विशाल पुस्तकालय में एक अकेली किताब के साथ भेजा जाता है। उसका काम उस किताब को खोलना, दूसरी किताब का संदर्भ ढूंढना, उस किताब तक जाना, एक फोटो ढूंढना, एक फाइल डाउनलोड करना और एक छिपे हुए बटन पर क्लिक करना है। वह वेब के कोने-कोने से बिखरी हुई, अव्यवस्थित जानकारी का एक बड़ा ढेर इकट्ठा करता है।

    • पेपर में: यह एजेंट वास्तविक वेबसाइटों पर जाता है, फाइलें डाउनलोड करता है और कच्चे डेटा को इकट्ठा करने के लिए जटिल पेजों पर नेविगेट करता है।
  2. कंपोजिशनल लॉजिक प्रपोजर (द पज़ल मास्टर - पहेली का उस्ताद):
    एक बार जब स्कैवेंजर के पास डेटा का ढेर जमा हो जाता है, तो पज़ल मास्टर उस पर नज़र डालता है और कहता है, "ठीक है, इस बिखराव के आधार पर, आइए एक ऐसा सवाल बनाते हैं जिसे केवल एक पेज देखकर हल नहीं किया जा सके।"

    • वे एक सख्त नियमों के सेट (12 प्रकार के तर्क) का उपयोग करते हैं ताकि सवाल के लिए गणित, फ़िल्टरिंग, तुलना और समय-यात्रा (टेम्पोरल रीजनिंग) की आवश्यकता हो।
    • उदाहरण: "चीन का GDP क्या है?" पूछने के बजाय, वे पूछते हैं, "पिछले दशक में शहरीकरण दर की तुलना में चीन की GDP वृद्धि के मानक विचलन (standard deviation) की गणना करें।"

परिणाम: एक नया डेटासेट और एक स्मार्ट AI

टीम ने इस सिस्टम का उपयोग करके लगभग 10,000 अत्यंत कठिन प्रश्नों का एक डेटासेट WebAggregatorQA बनाने के लिए किया। फिर उन्होंने इन प्रश्नों का उपयोग एक नए AI मॉडल (जिसे WebAggregator कहा जाता है) को प्रशिक्षित करने के लिए किया।

जब उन्होंने इस नए मॉडल का परीक्षण किया, तो निम्नलिखित हुआ:

  • "रिट्रीवल ट्रैप" (खोज का जाल): शोधकर्ताओं ने शीर्ष स्तर के AI मॉडल्स (जैसे GPT-4.1 और Claude-3.7) का इन कठिन सवालों पर परीक्षण किया। यहाँ तक कि जब उन्होंने मॉडल्स को समस्या को हल करने के लिए आवश्यक सभी सही वेबसाइट और दस्तावेज़ भी दिए, तब भी मॉडल्स विफल रहे।

    • उपमा: यह एक छात्र को एक ऐसी पाठ्यपुस्तक देने जैसा है जिसमें सटीक उत्तर हाइलाइट किया गया है, लेकिन फिर भी वे गणित की समस्या हल नहीं कर पाते क्योंकि उन्हें गणना करना नहीं आता।
    • निष्कर्ष: बाधा जानकारी ढूंढना नहीं है; बल्कि उसके साथ तर्क (reasoning) करना है।
  • परिवर्तन: जब उन्होंने अपने मॉडल्स को WebAggregator डेटासेट पर प्रशिक्षित किया, तो एजेंटों के व्यवहार में बदलाव आया:

    • पहले: वे पागलों की तरह बटन क्लिक करते थे और लिंक खोलते थे (उच्च टूल उपयोग, कम सोच)।
    • बाद में: उन्होंने कम बटन क्लिक किए लेकिन बिंदुओं को जोड़ने के लिए अधिक समय "सोचने" (आंतरिक तर्क) में बिताया।
    • प्रदर्शन: नए WebAggregator-32B मॉडल ने इन कठिन तर्क कार्यों पर मौजूदा सर्वश्रेष्ठ मॉडल्स को पछाड़ दिया, जिससे साबित हुआ कि "डिटेक्टिव वर्क" पर प्रशिक्षण देने से AI अधिक स्मार्ट बनता है।

निष्कर्ष (Takeaway)

पेपर निष्कर्ष निकालता है कि AI को वास्तव में "डीप रिसर्च" एजेंट बनने के लिए, जो वैज्ञानिक खोज करने में सक्षम हो, हमें इस बात पर ध्यान केंद्रित करना बंद करना होगा कि वह वेब को कितनी अच्छी तरह खोज सकता है। इसके बजाय, हमें इस बात पर ध्यान देना होगा कि वह एक तार्किक निष्कर्ष बनाने के लिए बिखरी हुई सूचनाओं को कितनी अच्छी तरह एक साथ जोड़ (stitch together) सकता है।

संक्षेप में: पेपर ने एक ऐसा जिम बनाया जहाँ AI एजेंट्स वास्तविक वेब डेटा का उपयोग करके जटिल पहेलियों को हल करने का अभ्यास करते हैं। परिणाम एक ऐसा एजेंट है जो एक घबराया हुआ वेब-सर्फर होने के बजाय एक विचारशील, तार्किक शोधकर्ता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →