A Benchmark for Deep Information Synthesis
यह शोध पत्र DEEPSYNTH को प्रस्तुत करता है, जो 7 डोमेन में 120 वास्तविक दुनिया के कार्यों वाला एक चुनौतीपूर्ण नया बेंचमार्क है, जो सूचना को संश्लेषित करने और अंतर्दृष्टि निकालने की LLM-आधारित एजेंटों की क्षमता का मूल्यांकन करता है, जो तर्क और मतिभ्रम (hallucination) नियंत्रण में महत्वपूर्ण वर्तमान सीमाओं को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक नए रिसर्च असिस्टेंट (अनुसंधान सहायक) को काम पर रख रहे हैं ताकि वह एक विशाल, जटिल अंतरराष्ट्रीय यात्रा की योजना बनाने में आपकी मदद कर सके। आप नहीं चाहते कि वह सिर्फ गूगल पर "पेरिस के बेहतरीन होटल" खोजे। आप चाहते हैं कि वह:
- टोक्यो में उड़ानों की कीमतें, बर्लिन में मुद्रा विनिमय दरें और ब्राजील में वीज़ा कानूनों की जांच करे।
- पर्यटन प्रवृत्तियों पर तीन अलग-अलग सरकारी रिपोर्टों को पढ़े।
- एयरलाइन देरी के एक स्प्रेडशीट को हड़ताल के बारे में एक समाचार लेख के साथ क्रॉस-रेफरेंस (मिलान) करे।
- अंत में, एक सटीक यात्रा कार्यक्रम (इतिनेरी) लिखे जो यह समझा सके कि आपको देश Y के बजाय देश X क्यों जाना चाहिए, और इसके पीछे ठोस डेटा हो।
यह बिल्कुल वही है जिसके बारे में DEEPSYNTH पेपर है। यह एक नया "परीक्षा" (exam) है जिसे यह परीक्षण करने के लिए बनाया गया है कि AI एजेंट (स्मार्ट कंप्यूटर प्रोग्राम) इस तरह के भारी काम को करने में कितने अच्छे हैं।
यहाँ सरल उपमाओं (analogies) का उपयोग करके पेपर का विवरण दिया गया है:
1. समस्या: "गूगल सर्च" का जाल
अभी, अधिकांश AI परीक्षण किसी छात्र से पूछने जैसे हैं, "अमेरिका का पहला राष्ट्रपति कौन था?" AI अपने ट्रेनिंग डेटा से उत्तर को बस याद कर लेता है। यह एक साधारण तथ्य पुनर्प्राप्ति (fact retrieval) है।
लेकिन वास्तविक जीवन ऐसा नहीं है। वास्तविक जीवन अव्यवस्थित होता है। यह पूछने जैसा है, "कौन से गैर-ASEAN देशों ने 2023 तक सिंगापुर में अपने पर्यटन को पुनः प्राप्त किया, और क्या यह मुख्य रूप से व्यावसायिक या अवकाश यात्री थे?"
- चुनौती: AI इसे केवल "याद" नहीं कर सकता। इसे बाहर जाना होगा, डेटा खोजना होगा, 67 अलग-अलग देशों से डेटा लेना होगा, तालिकाओं (tables) को पढ़ना होगा, संख्याओं की तुलना करनी होगी और गणित करना होगा।
- वर्तमान स्थिति: पेपर कहता है कि वर्तमान AI उन छात्रों की तरह हैं जो डिक्शनरी रटने में तो माहिर हैं लेकिन थीसिस लिखने में बहुत खराब हैं। जब उन्हें विभिन्न स्रोतों के बीच कड़ियों को जोड़ना होता है, तो वे खो जाते हैं।
2. समाधान: "DEEPSYNTH" परीक्षा
लेखकों ने एक नया बेंचमार्क (एक परीक्षण) बनाया है जिसे DEEPSYNTH कहा जाता है।
- सामग्री: इसमें 120 बहुत कठिन प्रश्न हैं।
- कठिनाई: केवल एक प्रश्न का उत्तर देने के लिए, AI को औसतन 4.2 अलग-अलग वेबसाइटों पर जाना होगा, 15 दस्तावेजों तक पढ़ना होगा, और जटिल गणित या तर्क करना होगा।
- "गोल्ड स्टैंडर्ड": मनुष्यों (विशेषज्ञों) ने ये प्रश्न बनाए हैं। उन्होंने केवल एक प्रश्न नहीं पूछा; उन्होंने पहले डेटा खोजा, उसका विश्लेषण किया, उत्तर निकाला, और फिर प्रश्न लिखा। यह सुनिश्चित करता है कि उत्तर ऐसा न हो जिसे AI इंटरनेट से बस याद कर लेता।
उपमा: एक कुकिंग कॉन्टेस्ट (खाना पकाने की प्रतियोगिता) की कल्पना करें।
- पुराने परीक्षण: "पानी का क्वथनांक (boiling point) क्या है?" (आसान, याद किया हुआ)।
- DEEPSYNTH: "यहाँ 10 अलग-अलग देशों के 10 अलग-अलग व्यंजन (recipes) हैं, आपके स्थानीय बाजार में उपलब्ध सामग्री की एक सूची है, और एक बजट है। पोषण और लागत को संतुलित करते हुए एक मेनू तैयार करें, और अपने विकल्पों के लिए स्पष्टीकरण दें।"
3. परिणाम: AI संघर्ष करता है
लेखकों ने इस परीक्षा पर उपलब्ध सबसे स्मार्ट AI मॉडल (जैसे GPT-5, DeepSeek, और विशेष "रिसर्च एजेंट") का परीक्षण किया।
- स्कोर: परिणाम चौंकाने वाले थे। सबसे अच्छा AI केवल 8.97 का F1 स्कोर (100 में से) प्राप्त कर पाया।
- रियलिटी चेक: सख्त नियमों के तहत (Exact Match), लगभग हर AI का स्कोर 0 था। वे एक भी उत्तर पूरी तरह से सही नहीं दे सके।
- क्यों?
- हैलुसिनेशन (Hallucinations): AI चीजें बनाता है। यह कोई आंकड़ा बना सकता है क्योंकि उसे "लगता" है कि वह सही सुनाई देगा।
- नेविगेशन त्रुटियां: यह गलत लिंक पर क्लिक करता है या किसी वेबसाइट पर फंस जाता है।
- "अफ्रीका" गैप: AI अफ्रीकी देशों के बारे में उत्तर देने में बहुत खराब था। यह सुझाव देता है कि AI पक्षपाती है क्योंकि इसे मुख्य रूप से अमेरिका, यूरोप और एशिया के डेटा पर प्रशिक्षित किया गया है।
उपमा: यह एक बुद्धिमान लाइब्रेरियन को 10,000 किताबों वाली लाइब्रेरी के नक्शे देने जैसा है। लाइब्रेरियन जानता है कि कैसे पढ़ा जाता है, लेकिन जब उससे "अफ्रीका" सेक्शन की किसी किताब में छिपे विशिष्ट तथ्य को खोजने के लिए कहा जाता है, तो या तो वह सेक्शन ढूंढ नहीं पाता, या वह उत्तर का अनुमान लगा लेता है क्योंकि उसने पहले कभी वह सेक्शन नहीं देखा है।
4. "डीप रिसर्च" एजेंट
पेपर ने "एजेंटों" का भी परीक्षण किया—AI जिन्हें वेब ब्राउज़र और कोड कैलकुलेटर जैसे टूल्स का उपयोग करने के लिए प्रोग्राम किया गया है।
- परिणाम: यहाँ तक कि इन "सुपर-एजेंटों" ने भी 120 में से केवल 3 कार्यों को पूरी तरह से हल किया।
- सबक: AI को केवल एक वेब ब्राउज़र देने से वह गहरा शोध करने के लिए पर्याप्त स्मार्ट नहीं हो जाता। जब उसे चरणों की एक लंबी श्रृंखला (जैसे, "साइट A पर जाएं, फ़ाइल डाउनलोड करें, उसे खोलें, संख्या खोजें, साइट B पर जाएं, तुलना करें...") की योजना बनानी होती है, तो वह अभी भी भ्रमित हो जाता है।
5. यह क्यों महत्वपूर्ण है
पेपर निष्कर्ष निकालता है कि हम एक दीवार से टकरा रहे हैं। हम केवल AI को बड़ा बनाकर "स्मार्टर" नहीं बना सकते; हमें इसे जानकारी को सिंथेसाइज़ (संश्लेषित) करना सिखाना होगा।
- सिंथेसिस (Synthesis) कच्चे, अव्यवस्थित डेटा के ढेर को एक स्पष्ट, उपयोगी अंतर्दृष्टि (insight) में बदलने की क्षमता है।
- वर्तमान में, AI एक बहुत तेज़ फोटोकॉपी मशीन की तरह है। यह तथ्यों को कॉपी कर सकता है, लेकिन यह अभी तक वह कहानी नहीं लिख सकता जो उन्हें जोड़ती है।
सारांश
DEEPSYNTH AI उद्योग के लिए एक रियलिटी चेक है। यह दिखाता है कि जबकि AI बातचीत करने और लिखने में बेहतर हो रहा है, यह अभी भी उस तरह का गहरा, बहु-चरणीय शोध करने में बहुत खराब है जो मनुष्य रोज़ाना करते हैं। AI वर्तमान में एक "सुपर-फास्ट फैक्ट-चेकर" है जिसे जटिल वास्तविक दुनिया की समस्याओं के साथ भरोसेमंद बनने के लिए एक "सच्चा शोधकर्ता" बनने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।