← नवीनतम पेपर
🤖 AI

LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?

LLM-WikiRace बेंचमार्क उन्हें विकिपीडिया हाइपरलिंक्स के माध्यम से नेविगेट करने का कार्य देकर बड़े भाषा मॉडलों की योजना बनाने और तर्क करने की क्षमताओं का मूल्यांकन करता है, जिससे यह पता चलता है कि जबकि फ्रंटियर मॉडल आसान स्तरों पर सुपरह्यूमन प्रदर्शन प्राप्त करते हैं, वे लंबी अवधि की योजना बनाने और विफलता से उबरने की सीमाओं के कारण कठिन कठिनाइयों के साथ अभी भी काफी संघर्ष करते हैं।

मूल लेखक: Juliusz Ziomek, William Bankes, Lorenz Wolf, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Juliusz Ziomek, William Bankes, Lorenz Wolf, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "विकिपीडिया रैबिट होल" (Wikipedia Rabbit Hole) नामक एक खेल खेल रहे हैं। आप केले (Bananas) के पेज से शुरू करते हैं और आपका लक्ष्य केवल लेखों के भीतर दिए गए नीले हाइपरलिंक पर क्लिक करके फेरारी (Ferraris) के पेज तक पहुँचना है। आप मैप का उपयोग नहीं कर सकते, आप पूरे इंटरनेट को नहीं देख सकते, और आपके पास क्लिक करने के लिए सीमित संख्या में स्टेप्स (कदम) हैं। यदि आप बहुत अधिक बार गलत लिंक पर क्लिक करते हैं, तो आप एक लूप (चक्कर) में फंस जाते हैं या स्टेप्स खत्म होने पर हार जाते हैं।

यह LLM-WikiRace का मूल आधार है, जो शोधकर्ताओं द्वारा बनाया गया एक नया परीक्षण है यह देखने के लिए कि आर्टिफिशियल इंटेलिजेंस (AI) वास्तव में कितनी स्मार्ट है।

यहाँ शोध पत्र के निष्कर्षों का विवरण दिया गया, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. परीक्षण: बिना नक्शे की एक भूलभुलैया

अधिकांश AI परीक्षण कंप्यूटर को गणित के सवाल हल करने या कोड लिखने के लिए कहते हैं। यह परीक्षण अलग है। यह AI को मानव ज्ञान (विकिपीडिया) से बनी एक विशाल, अदृश्य भूलभुलैया में नेविगेट करने के लिए कहता है।

  • सेटअप: AI वर्तमान पेज, लक्ष्य पेज और अगले क्लिक के लिए 50 संभावित लिंक की एक सूची देखता है।
  • चुनौती: AI को यह अनुमान लगाना होता है कि कौन सा लिंक उसे लक्ष्य के करीब ले जाएगा। वह "सबसे छोटा रास्ता" (जैसे GPS) नहीं देख सकता; उसे यह समझने के लिए कि दुनिया कैसे काम करती है, अपनी आंतरिक स्मृति का उपयोग करना होगा।

2. परिणाम: चलने में अच्छे, दौड़ने में बुरे

शोधकर्ताओं ने कई प्रसिद्ध AI मॉडल्स (जैसे Gemini, GPT-5, और Claude) का परीक्षण किया।

  • आसान स्तर (Easy Level): जब लक्ष्य पास होता है (केवल 3 या 4 क्लिक दूर), तो शीर्ष AI विशेषज्ञ हाइकर्स (पर्वतारोहियों) की तरह होते हैं। वे लगभग 90% से 96% बार सफल होते हैं। वे अपने विषय को अच्छी तरह जानते हैं।
  • कठिन स्तर (Hard Level): जब लक्ष्य दूर होता है (7 या 8 क्लिक दूर), तो AI रास्ता भटक जाते हैं। सबसे स्मार्ट मॉडल (Gemini 3.1) भी इन खेलों में केवल 29% बार सफल होता है।
  • निष्कर्ष: पेपर का दावा है कि हालांकि इन AI के पास उनके "दिमाग" में तथ्यों का एक विशाल पुस्तकालय है, लेकिन वे उस पुस्तकालय का उपयोग लंबी अवधि की योजना बनाने के लिए करने में संघर्ष करते हैं। वे चीजें क्या हैं, यह जानने में माहिर हैं, लेकिन A से B तक पहुँचने के लिए कैसे जाना है, यह तय करने में कमजोर हैं।

3. "प्लानिंग गैप" (Planning Gap): जानना बनाम करना

शोधकर्ताओं ने एक दिलचस्प चीज़ खोजी जिसे "प्लानिंग गैप" कहा जाता है।

  • कल्पना कीजिए कि दो छात्र एक परीक्षा दे रहे हैं। दोनों इतिहास के तथ्य बिल्कुल समान रूप से जानते हैं (विश्व ज्ञान/World Knowledge)।
  • छात्र A (एक मानक AI) केवल तथ्यों को याद करता है।
  • छात्र B (एक "रीज़निंग" AI) को समस्याओं को चरण-दर-चरण सोचने के लिए प्रशिक्षित किया गया है।
  • परिणाम: छात्र B, छात्र A की तुलना में 20% अधिक स्कोर करता है, भले ही वे समान तथ्य जानते हों।
  • सबक: केवल ज्ञान होना पर्याप्त नहीं है। आपको उस ज्ञान को एक जीतने वाली रणनीति में बदलने के लिए एक विशेष "रीज़निंग इंजन" की आवश्यकता होती है।

4. घातक दोष: लूप में फंस जाना

सबसे आश्चर्यजनक खोज यह थी कि AI कैसे विफल होते हैं।

  • लूप (The Loop): जब कोई AI गलती करता है, तो वह यह कहने के बजाय कि, "ठीक है, वह रास्ता काम नहीं आया, चलो कोई दूसरा तरीका आजमाते हैं," अक्सर उन्हीं लिंक्स को बार-बार क्लिक करता रहता है।
  • उपमा: यह जंगल में चक्कर काट रहे व्यक्ति की तरह है। उसे एहसास होता है, "ओह नहीं, मैं यहाँ पहले भी आ चुका हूँ," लेकिन मुड़ने के बजाय, वह उसी घेरे में चलता रहता है जब तक कि उसके पास समय समाप्त नहीं हो जाता।
  • डेटा: सबसे कठिन खेलों में, शीर्ष मॉडल्स 86% समय लूप में फंस गए। एक बार फंस जाने के बाद, वे लगभग कभी बाहर नहीं निकल पाए। वे "रीप्लानिंग" (पुनः योजना बनाने) में खराब हैं।

5. प्रशिक्षण मदद करता है, लेकिन थोड़ा ही

शोधकर्ताओं ने एक छोटे AI मॉडल को अभ्यास राउंड (fine-tuning) देकर इस खेल खेलने के लिए "सिखाने" की कोशिश की।

  • परिणाम: मॉडल आसान खेलों के लिए बहुत बेहतर हो गया (सफलता दर 22% से बढ़कर 67% हो गई)।
  • सीमा: हालाँकि, इस प्रशिक्षण ने कठिन खेलों में मदद करने के लिए कुछ भी नहीं किया। सबसे कठिन स्तर पर इसकी सफलता दर 0% रही।
  • निष्कर्ष: आप केवल साधारण अभ्यास से AI को इन कठिन समस्याओं को हल करना नहीं "सिखा" सकते; लंबी अवधि की योजना बनाने की अंतर्निहित क्षमता गायब है।

सारांश

LLM-WikiRace एक सरल लेकिन क्रूर परीक्षण है। यह दिखाता है कि भले ही आज के सुपर-स्मार्ट AI के पास उनके सिर में एक विशाल विश्वकोश (encyclopedia) है, फिर भी वे लंबी यात्रा के दौरान इसे नेविगेट करने में बहुत खराब हैं। वे निकास ढूंढ सकते हैं यदि वह दरवाजे के ठीक बगल में है, लेकिन यदि उन्हें भूलभुलैया से गुजरना पड़ता है, तो वे भ्रमित हो जाते हैं, अपनी गलतियों को दोहराते हैं और हार मान लेते हैं।

पेपर यह निष्कर्ष निकालता है कि AI के लिए जटिल कार्यों में महारत हासिल करने के लिए, उसे केवल अधिक तथ्य जानने में ही नहीं, बल्कि आगे की योजना बनाने और चीजें गलत होने पर अपना विचार बदलने में बहुत बेहतर होने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →