← नवीनतम पेपर
💬 NLP

A Benchmark for Deep Information Synthesis

यह शोध पत्र DEEPSYNTH को प्रस्तुत करता है, जो 7 डोमेन में 120 वास्तविक दुनिया के कार्यों वाला एक चुनौतीपूर्ण नया बेंचमार्क है, जो सूचना को संश्लेषित करने और अंतर्दृष्टि निकालने की LLM-आधारित एजेंटों की क्षमता का मूल्यांकन करता है, जो तर्क और मतिभ्रम (hallucination) नियंत्रण में महत्वपूर्ण वर्तमान सीमाओं को प्रकट करता है।

मूल लेखक: Debjit Paul, Daniel Murphy, Milan Gritta, Ronald Cardenas, Victor Prokhorov, Lena Sophia Bolliger, Aysim Toker, Roy Miles, Andreea-Maria Oncescu, Jasivan Alex Sivakumar, Philipp Borchert, Ismail Elezi
प्रकाशित 2026-02-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Debjit Paul, Daniel Murphy, Milan Gritta, Ronald Cardenas, Victor Prokhorov, Lena Sophia Bolliger, Aysim Toker, Roy Miles, Andreea-Maria Oncescu, Jasivan Alex Sivakumar, Philipp Borchert, Ismail Elezi, Meiru Zhang, Ka Yiu Lee, Guchun Zhang, Jun Wang, Gerasimos Lampouras

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए रिसर्च असिस्टेंट (अनुसंधान सहायक) को काम पर रख रहे हैं ताकि वह एक विशाल, जटिल अंतरराष्ट्रीय यात्रा की योजना बनाने में आपकी मदद कर सके। आप नहीं चाहते कि वह सिर्फ गूगल पर "पेरिस के बेहतरीन होटल" खोजे। आप चाहते हैं कि वह:

  1. टोक्यो में उड़ानों की कीमतें, बर्लिन में मुद्रा विनिमय दरें और ब्राजील में वीज़ा कानूनों की जांच करे।
  2. पर्यटन प्रवृत्तियों पर तीन अलग-अलग सरकारी रिपोर्टों को पढ़े।
  3. एयरलाइन देरी के एक स्प्रेडशीट को हड़ताल के बारे में एक समाचार लेख के साथ क्रॉस-रेफरेंस (मिलान) करे।
  4. अंत में, एक सटीक यात्रा कार्यक्रम (इतिनेरी) लिखे जो यह समझा सके कि आपको देश Y के बजाय देश X क्यों जाना चाहिए, और इसके पीछे ठोस डेटा हो।

यह बिल्कुल वही है जिसके बारे में DEEPSYNTH पेपर है। यह एक नया "परीक्षा" (exam) है जिसे यह परीक्षण करने के लिए बनाया गया है कि AI एजेंट (स्मार्ट कंप्यूटर प्रोग्राम) इस तरह के भारी काम को करने में कितने अच्छे हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके पेपर का विवरण दिया गया है:

1. समस्या: "गूगल सर्च" का जाल

अभी, अधिकांश AI परीक्षण किसी छात्र से पूछने जैसे हैं, "अमेरिका का पहला राष्ट्रपति कौन था?" AI अपने ट्रेनिंग डेटा से उत्तर को बस याद कर लेता है। यह एक साधारण तथ्य पुनर्प्राप्ति (fact retrieval) है।

लेकिन वास्तविक जीवन ऐसा नहीं है। वास्तविक जीवन अव्यवस्थित होता है। यह पूछने जैसा है, "कौन से गैर-ASEAN देशों ने 2023 तक सिंगापुर में अपने पर्यटन को पुनः प्राप्त किया, और क्या यह मुख्य रूप से व्यावसायिक या अवकाश यात्री थे?"

  • चुनौती: AI इसे केवल "याद" नहीं कर सकता। इसे बाहर जाना होगा, डेटा खोजना होगा, 67 अलग-अलग देशों से डेटा लेना होगा, तालिकाओं (tables) को पढ़ना होगा, संख्याओं की तुलना करनी होगी और गणित करना होगा।
  • वर्तमान स्थिति: पेपर कहता है कि वर्तमान AI उन छात्रों की तरह हैं जो डिक्शनरी रटने में तो माहिर हैं लेकिन थीसिस लिखने में बहुत खराब हैं। जब उन्हें विभिन्न स्रोतों के बीच कड़ियों को जोड़ना होता है, तो वे खो जाते हैं।

2. समाधान: "DEEPSYNTH" परीक्षा

लेखकों ने एक नया बेंचमार्क (एक परीक्षण) बनाया है जिसे DEEPSYNTH कहा जाता है।

  • सामग्री: इसमें 120 बहुत कठिन प्रश्न हैं।
  • कठिनाई: केवल एक प्रश्न का उत्तर देने के लिए, AI को औसतन 4.2 अलग-अलग वेबसाइटों पर जाना होगा, 15 दस्तावेजों तक पढ़ना होगा, और जटिल गणित या तर्क करना होगा।
  • "गोल्ड स्टैंडर्ड": मनुष्यों (विशेषज्ञों) ने ये प्रश्न बनाए हैं। उन्होंने केवल एक प्रश्न नहीं पूछा; उन्होंने पहले डेटा खोजा, उसका विश्लेषण किया, उत्तर निकाला, और फिर प्रश्न लिखा। यह सुनिश्चित करता है कि उत्तर ऐसा न हो जिसे AI इंटरनेट से बस याद कर लेता।

उपमा: एक कुकिंग कॉन्टेस्ट (खाना पकाने की प्रतियोगिता) की कल्पना करें।

  • पुराने परीक्षण: "पानी का क्वथनांक (boiling point) क्या है?" (आसान, याद किया हुआ)।
  • DEEPSYNTH: "यहाँ 10 अलग-अलग देशों के 10 अलग-अलग व्यंजन (recipes) हैं, आपके स्थानीय बाजार में उपलब्ध सामग्री की एक सूची है, और एक बजट है। पोषण और लागत को संतुलित करते हुए एक मेनू तैयार करें, और अपने विकल्पों के लिए स्पष्टीकरण दें।"

3. परिणाम: AI संघर्ष करता है

लेखकों ने इस परीक्षा पर उपलब्ध सबसे स्मार्ट AI मॉडल (जैसे GPT-5, DeepSeek, और विशेष "रिसर्च एजेंट") का परीक्षण किया।

  • स्कोर: परिणाम चौंकाने वाले थे। सबसे अच्छा AI केवल 8.97 का F1 स्कोर (100 में से) प्राप्त कर पाया।
  • रियलिटी चेक: सख्त नियमों के तहत (Exact Match), लगभग हर AI का स्कोर 0 था। वे एक भी उत्तर पूरी तरह से सही नहीं दे सके।
  • क्यों?
    • हैलुसिनेशन (Hallucinations): AI चीजें बनाता है। यह कोई आंकड़ा बना सकता है क्योंकि उसे "लगता" है कि वह सही सुनाई देगा।
    • नेविगेशन त्रुटियां: यह गलत लिंक पर क्लिक करता है या किसी वेबसाइट पर फंस जाता है।
    • "अफ्रीका" गैप: AI अफ्रीकी देशों के बारे में उत्तर देने में बहुत खराब था। यह सुझाव देता है कि AI पक्षपाती है क्योंकि इसे मुख्य रूप से अमेरिका, यूरोप और एशिया के डेटा पर प्रशिक्षित किया गया है।

उपमा: यह एक बुद्धिमान लाइब्रेरियन को 10,000 किताबों वाली लाइब्रेरी के नक्शे देने जैसा है। लाइब्रेरियन जानता है कि कैसे पढ़ा जाता है, लेकिन जब उससे "अफ्रीका" सेक्शन की किसी किताब में छिपे विशिष्ट तथ्य को खोजने के लिए कहा जाता है, तो या तो वह सेक्शन ढूंढ नहीं पाता, या वह उत्तर का अनुमान लगा लेता है क्योंकि उसने पहले कभी वह सेक्शन नहीं देखा है।

4. "डीप रिसर्च" एजेंट

पेपर ने "एजेंटों" का भी परीक्षण किया—AI जिन्हें वेब ब्राउज़र और कोड कैलकुलेटर जैसे टूल्स का उपयोग करने के लिए प्रोग्राम किया गया है।

  • परिणाम: यहाँ तक कि इन "सुपर-एजेंटों" ने भी 120 में से केवल 3 कार्यों को पूरी तरह से हल किया।
  • सबक: AI को केवल एक वेब ब्राउज़र देने से वह गहरा शोध करने के लिए पर्याप्त स्मार्ट नहीं हो जाता। जब उसे चरणों की एक लंबी श्रृंखला (जैसे, "साइट A पर जाएं, फ़ाइल डाउनलोड करें, उसे खोलें, संख्या खोजें, साइट B पर जाएं, तुलना करें...") की योजना बनानी होती है, तो वह अभी भी भ्रमित हो जाता है।

5. यह क्यों महत्वपूर्ण है

पेपर निष्कर्ष निकालता है कि हम एक दीवार से टकरा रहे हैं। हम केवल AI को बड़ा बनाकर "स्मार्टर" नहीं बना सकते; हमें इसे जानकारी को सिंथेसाइज़ (संश्लेषित) करना सिखाना होगा।

  • सिंथेसिस (Synthesis) कच्चे, अव्यवस्थित डेटा के ढेर को एक स्पष्ट, उपयोगी अंतर्दृष्टि (insight) में बदलने की क्षमता है।
  • वर्तमान में, AI एक बहुत तेज़ फोटोकॉपी मशीन की तरह है। यह तथ्यों को कॉपी कर सकता है, लेकिन यह अभी तक वह कहानी नहीं लिख सकता जो उन्हें जोड़ती है।

सारांश

DEEPSYNTH AI उद्योग के लिए एक रियलिटी चेक है। यह दिखाता है कि जबकि AI बातचीत करने और लिखने में बेहतर हो रहा है, यह अभी भी उस तरह का गहरा, बहु-चरणीय शोध करने में बहुत खराब है जो मनुष्य रोज़ाना करते हैं। AI वर्तमान में एक "सुपर-फास्ट फैक्ट-चेकर" है जिसे जटिल वास्तविक दुनिया की समस्याओं के साथ भरोसेमंद बनने के लिए एक "सच्चा शोधकर्ता" बनने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →