ForeSci: Evaluating LLM Agents for Forward-Looking AI Research Judgment
यह शोध पत्र ForeSci प्रस्तुत करता है, जो एक कालानुक्रमिक रूप से नियंत्रित बेंचमार्क है जिसे ऐतिहासिक साक्ष्यों के आधार पर भविष्योन्मुखी एआई अनुसंधान निर्णयों को लेने की एलएलएम (LLM) एजेंटों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जबकि स्पष्ट साक्ष्य संगठन ट्रेसबिलिटी (traceability) में सुधार करता है, एजेंट अक्सर उद्धृत साक्ष्यों को सही अनुसंधान पूर्वानुमानों के साथ संरेखित करने में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक समय-यात्रा करने वाले स्काउट (scout) हैं जिसे वर्ष 2025 में भेजा गया है। आपका मिशन केवल उस विशिष्ट तिथि तक उपलब्ध तकनीक को देखना है और यह भविष्यवाणी करना है कि 2026 के अंत तक आर्टिफिशियल इंटेलिजेंस (AI) में अगली बड़ी चीज़ क्या होगी। आपको भविष्य में झाँकने से सख्ती से मना किया गया; आप उस जानकारी का उपयोग नहीं कर सकते जो अभी तक प्रकाशित नहीं हुई है।
यह ForeSci का मुख्य आधार है, जो शोधकर्ताओं द्वारा बनाया गया एक नया "परीक्षा" (exam) है ताकि यह परीक्षण किया जा सके कि AI एजेंट (स्मार्ट कंप्यूटर प्रोग्राम) कितनी अच्छी तरह से भविष्योन्मुखी अनुसंधान निर्णय ले सकते हैं।
यहाँ सरल उपमाओं (analogies) का उपयोग करके पेपर का विवरण दिया गया है:
1. समस्या: "क्रिस्टल बॉल" का जाल
आमतौर पर, जब हम AI का परीक्षण करते हैं, तो हम उससे ऐसे प्रश्न पूछते हैं जिनका उत्तर पहले से मौजूद होता है (जैसे, "2024 का विश्व कप किसने जीता?")। लेकिन वास्तविक वैज्ञानिक अनुसंधान यह अनुमान लगाने के बारे में है कि क्या होगा, इससे पहले कि वह हो।
यदि आप एक AI से पूछते हैं, "अगले वर्ष AI में सबसे बड़ी सफलता क्या होगी?" और AI ने चुपके से अपने ट्रेनिंग डेटा में 2026 का कोई पेपर पढ़ लिया है, तो वह वास्तव में भविष्यवाणी नहीं कर रहा है; वह केवल उत्तर को याद करके धोखाधड़ी कर रहा है। यह एक छात्र की तरह है जो परीक्षा दे रहा है लेकिन उसकी जेब में उत्तर कुंजी (answer key) छिपी हुई है।
ForeSci इस समस्या को एक सख्त "समय अवरोध" (time barrier) बनाकर ठीक करता है। यह AI को उन शोध पत्रों की एक लाइब्रेरी देता है जो एक विशिष्ट तिथि पर रुक जाती है (कटऑफ)। उस तिथि के बाद प्रकाशित होने वाला कोई भी पेपर लॉक कर दिया जाता है। AI को अपना निर्णय केवल उस क्षण तक मौजूद किताबों के आधार पर ही लेना होगा।
2. परीक्षा: 500 "क्या होगा अगर?" परिदृश्य
शोधकर्ताओं ने चार तेज़ गति वाले AI क्षेत्रों (जैसे AI एजेंट, टेक्स्ट जनरेशन और इमेज क्रिएशन) में 500 कार्यों का एक टेस्ट बैंक बनाया है। उन्होंने AI से चार विशिष्ट प्रकार के निर्णय लेने के लिए कहा:
- दिशा पूर्वानुमान (Direction Forecasting): "क्षेत्र आगे किस रास्ते पर चलेगा?" (जैसे, क्या AI बेहतर मेमोरी पर ध्यान केंद्रित करेगा या बेहतर सुरक्षा पर?)
- बाधा की खोज (Bottleneck Discovery): "अभी सबसे बड़ी बाधा क्या है, और इसे ठीक करने से क्या अवसर खुलते हैं?" (जैसे, "AI गणित में धीमा है; यदि हम इसे ठीक कर दें, तो हम बेहतर कैलकुलेटर बना सकते हैं;")
- रणनीतिक योजना (Strategic Planning): "यदि आप एक रिसर्च टीम होते, तो आप इनमें से कौन सा प्रोजेक्ट सबसे पहले शुरू करते?"
- वेन्यू पोजिशनिंग (Venue Positioning): "इस नए विचार को कहाँ प्रकाशित किया जाना चाहिए?" (जैसे, क्या यह पेपर गणित पर केंद्रित कॉन्फ्रेंस में जाना चाहिए, या भाषा पर केंद्रित?)
3. परीक्षण विषय: AI "छात्र"
शोधकर्ताओं ने विभिन्न प्रकार के AI "छात्रों" का परीक्षण किया:
- नेटिव LLM (Native LLM): एक मानक स्मार्ट AI जो केवल टेक्स्ट पढ़ता है और अनुमान लगाता है।
- लाइब्रेरियन (हाइब्रिड RAG): एक AI जो उत्तर देने से पहले विशिष्ट तथ्यों के लिए लाइब्रेरी खोजने में अच्छा है।
- रिसर्च एजेंट (Research Agents): अधिक जटिल AI सिस्टम जो मानव शोधकर्ता की तरह चरणों में सोचने की कोशिश करते हैं।
उन्होंने यह देखने के लिए चार अलग-अलग "मस्तिष्क" मॉडल (Qwen, GPT, GLM, और Gemini) पर इनका परीक्षण किया कि क्या मस्तिष्क का आकार या प्रकार मायने रखता है।
4. परिणाम: सुराग खोजने में अच्छे, लेकिन उन्हें जोड़ने में खराब
परिणाम आश्चर्यजनक थे और उन्होंने AI के सोचने के तरीके में एक विशिष्ट दोष को उजागर किया:
- अच्छी खबर: "रिसर्च एजेंट" ट्रेसिबिलिटी (traceability) में बहुत बेहतर थे। यदि आप उनसे पूछते, "आपने वह विचार क्यों चुना?", तो वे उस पुराने पेपर के सटीक वाक्य की ओर इशारा कर सकते थे जो उनके चुनाव का समर्थन करता था। वे अच्छे छात्रों की तरह थे जो अपने स्रोतों का हवाला दे सकते थे।
- बुरी खबर (डिकपलिंग की समस्या): AI अक्सर एविडेंस-डिसीजन डिकपलिंग (Evidence-Decision Decoupling) से ग्रस्त होता था।
- उपमा: कल्पना कीजिए कि एक जासूस को एक आदर्श सुराग (साक्ष्य) मिलता है जो एक संदिग्ध की ओर इशारा करता है, लेकिन फिर जासूस गलत व्यक्ति पर आरोप लगा देता है (निर्णय)।
- AI अतीत के सही तथ्य तो खोज सकता था, लेकिन फिर गलत भविष्यवाणी कर देता था। वह कह सकता था, "साक्ष्य दिखाते हैं कि X एक समस्या है," लेकिन फिर निष्कर्ष निकाल सकता था, "इसलिए, हमें Y को हल करना चाहिए," जो कि तर्कहीन है।
- वे अक्सर आत्मविश्वास के साथ गलत (confidently wrong) होते थे। वे एक बहुत ही प्रभावशाली, अच्छी तरह से उद्धृत तर्क लिख सकते थे जो एक ऐसी दिशा के लिए था जो गलत साबित हुई।
5. निर्णय
पेपर यह निष्कर्ष निकालता है कि जबकि AI सूचना को व्यवस्थित करने और तथ्य खोजने में बेहतर हो रहा है, यह अभी भी रणनीतिक, भविष्योन्मुखी निर्णयों को लेने में संघर्ष कर रहा है।
- "एक ही आकार सबके लिए उपयुक्त नहीं" (No One-Size-Fits-All): कोई भी एक आदर्श AI विधि नहीं है। कभी-कभी एक साधारण खोज सबसे अच्छा काम करती है; कभी-कभी एक जटिल प्लानिंग एजेंट सबसे अच्छा काम करता है। यह पूरी तरह से पूछे गए प्रश्न के प्रकार पर निर्भर करता है।
- "आत्मविश्वास के साथ गलत" होने का जोखिम: पहचाना गया सबसे बड़ा खतरा यह है कि AI बहुत प्रभावशाली लग सकता है और वास्तविक साक्ष्य उद्धृत कर सकता है, फिर भी एक भयानक रणनीतिक निर्णय ले सकता है। यह एक वकील की तरह है जो सही कानूनों का हवाला देता है लेकिन गलत फैसले के लिए तर्क देता है।
सारांश
ForeSci एक समय-यात्रा परीक्षण है जो AI को भविष्य में झाँककर नकल करने से रोककर उसे रोकता है। इसने पाया कि हालांकि AI एजेंट ऐतिहासिक साक्ष्य खोजने और उद्धृत करने में माहिर हैं, वे फिर भी भविष्य की भविष्यवाणी करने के लिए उन बिंदुओं को सही ढंग से जोड़ने में विफल रहते हैं। वे अतीत के बारे में एक आदर्श निबंध लिख सकते हैं, लेकिन फिर भी कल के परिणाम का गलत अनुमान लगा सकते हैं। यह बेंचमार्क शोधकर्ताओं को यह देखने में मदद करता है कि उनके AI "स्काउट्स" वास्तव में कहाँ और क्यों भटक रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।