Evaluating LLMs on Large-Scale Graph Property Estimation via Random Walks
यह शोध पत्र EstGraph प्रस्तुत करता है, जो एक बड़े पैमाने का बेंचमार्क डेटासेट और चार अनुमान कार्य (estimation tasks) है, जो संदर्भ लंबाई की सीमाओं के भीतर विशाल ग्राफ के गुणों को अनुमान लगाने के लिए लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने हेतु रैंडम वॉक सैंपलिंग का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, फैले हुए शहर के लेआउट को समझने की कोशिश कर रहे हैं जिसमें लाखों इमारतें और सड़कें हैं। आप एक विशेषज्ञ जासूस (AI) हैं, लेकिन आपका एक बहुत सख्त नियम है: आप केवल एक छोटी सी नोटबुक रख सकते हैं। आप पूरे शहर का नक्शा नहीं लिख सकते क्योंकि वह बहुत बड़ा है और उसमें फिट नहीं होगा।
यही वह मुख्य समस्या है जिसे यह शोध पत्र संबोधित करता है: एक AI एक विशाल नेटवर्क (जैसे कि सोशल मीडिया प्लेटफॉर्म या इंटरनेट) को कैसे समझ सकता है जब वह एक साथ पूरी चीज़ को देख नहीं सकता?
यहाँ शोधकर्ताओं ने क्या किया है, इसका एक सरल विवरण दिया गया है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है।
समस्या: "फिट होने के लिए बहुत बड़ा" होने की दुविधा
पहले, शोधकर्ताओं ने AI का परीक्षण छोटे, खिलौने जैसे ग्राफों पर किया था (जैसे कि केवल 20 घरों वाला एक मोहल्ला)। AI वहां बहुत अच्छा प्रदर्शन करता था। लेकिन वास्तविक दुनिया के नेटवर्क एक पूरे देश की तरह होते हैं। यदि आप AI को एक देश के हर एक कनेक्शन की सूची देने की कोशिश करते हैं, तो उसके पास "मेमोरी स्पेस" (कॉन्टेक्स्ट लेंथ) खत्म हो जाता है और वह उन चीजों के बारे में अनुमान लगाने या ऐसी चीजें बताने लगता है जो वहां हैं ही नहीं (hallucinations)।
यह शोध पत्र तर्क देता है कि हमें AI को खिलौने वाले मोहल्लों पर टेस्ट करना बंद करना चाहिए और वास्तविक, विशाल शहरों पर टेस्ट करना शुरू करना चाहिए जहाँ हम एक बार में केवल कुछ ही सड़कों को देख सकते हैं।
समाधान: "रैंडम वॉकर" (Random Walker) रणनीति
चूंकि AI पूरे शहर को नहीं देख सकता, इसलिए शोधकर्ताओं ने उसे एक नया टूल दिया: रैंडम वॉक्स (Random Walks)।
कल्पना कीजिए कि एक आंखों पर पट्टी बंधे पर्यटक को शहर में भेज दिया गया है। पर्यटक एक यादृच्छिक (random) इमारत से शुरू करता है, एक यादृच्छिक सड़क चुनता है, अगली इमारत तक जाता है, एक और यादृच्छिक सड़क चुनता है, और चलता रहता है। उसके पास कोई नक्शा नहीं है; वह बस घूम रहा है।
शोधकर्ताओं ने AI को पूरा शहर दिखाने के लिए नहीं कहा। इसके बजाय, उन्होंने AI को ग्राफ के माध्यम से कई छोटी, रैंडम वॉक पर भेजा। फिर उन्होंने AI को इन वॉक का एक "रिपोर्ट कार्ड" दिया। रिपोर्ट कार्ड में शामिल था:
- पर्यटक ने कितने अद्वितीय (unique) भवनों का दौरा किया।
- पर्यटक कितनी बार एक ही इमारत से दोबारा टकराया (collisions)।
- उनके द्वारा देखे गए भवनों से कितनी सड़कें (edges) जुड़ी हुई थीं।
- उनके द्वारा देखे गए भवनों की "लोकप्रियता" (degree)।
AI का काम इन बिखरी हुई रिपोर्टों को देखना और बड़ी तस्वीर का अनुमान लगाना था।
चार चुनौतियाँ (कार्य)
शोधकर्ताओं ने AI के जासूसी कौशल का परीक्षण करने के लिए चार विशिष्ट खेल तैयार किए:
शहर के आकार का अनुमान लगाना:
- कार्य: "हमारे पर्यटक कितनी बार एक ही इमारत से टकराया, इसके आधार पर, इस शहर में कुल कितनी इमारतें हैं?"
- उपमा: यह "बर्थडे पैराडॉक्स" की तरह है। यदि आप एक छोटे समूह में दो लोगों को एक ही जन्मदिन वाले पाते हैं, तो समूह छोटा है। यदि आपको साझा जन्मदिन मिलने से पहले कई लोगों से मिलना पड़ता है, तो समूह बहुत बड़ा है। AI ने इस तर्क का उपयोग करके कुल नोड्स (इमारतों) का अनुमान लगाया।
मोहल्लों (समुदायों) की गिनती करना:
- कार्य: "इस शहर में कितने अलग-अलग मोहल्ले या क्लिक्स (cliques) मौजूद हैं?"
- उपमा: एक वास्तविक शहर में, लोग अपने पड़ोसियों के साथ रहना पसंद करते हैं। यदि एक पर्यटक एक विशिष्ट क्षेत्र में बार-बार लोगों के एक ही समूह से टकराता है, तो AI अनुमान लगा सकता है, "आह, यह निश्चित रूप से एक घनिष्ठ मोहल्ला है।" AI को इन अलग-अलग समूहों की संख्या गिननी थी।
शहर का "वाइब" (संरचना) पहचानना:
- कार्य: "क्या यह शहर एक रैंडम गड़बड़ी है, एक सटीक ग्रिड है, या एक हब-एंड-स्पोक सिस्टम है?"
- उपमा:
- ग्रिड: शतरंज की बिसात की तरह जहाँ हर ब्लॉक एक जैसा दिखता है।
- रैंडम: बिना किसी पैटर्न के एक अस्त-व्यस्त निर्माण स्थल की तरह।
- स्केल-फ्री (BA): एक ऐसे शहर की तरह जिसमें कुछ विशाल डाउनटाउन हब (अत्यधिक लोकप्रिय नोड्स) और हजारों छोटी गलियां हैं।
AI को अपने द्वारा देखे गए भवनों की "लोकप्रियता" को देखना था और तय करना था कि वह किस प्रकार का शहर है।
VIPs को खोजना (प्रभावशाली नोड्स):
- कार्य: "इस नेटवर्क में सबसे महत्वपूर्ण लोग कौन हैं?"
- उपमा: कुछ लोग इसलिए प्रसिद्ध होते हैं क्योंकि वे अन्य प्रसिद्ध लोगों से जुड़े होते हैं (PageRank)। AI को यह अनुमान लगाना था कि हब कौन से थे, केवल यह देखकर कि रैंडम वॉकर सबसे अधिक बार किन लोगों से मिला।
उन्हें क्या पता चला?
शोधकर्ताओं ने 100 नोड्स से लेकर 2.3 मिलियन नोड्स तक के ग्राफ पर कई शीर्ष-स्तरीय AI मॉडल (जैसे o3, Gemini, और Sonnet) का परीक्षण किया।
- अच्छी खबर: AI मॉडल शहर के आकार का अनुमान लगाने और नेटवर्क के "वाइब" (संरचना) को पहचानने में आश्चर्यजनक रूप से अच्छे थे, भले ही उन्होंने पूरा नक्शा नहीं देखा था। कुछ मॉडल मनुष्यों द्वारा उपयोग किए जाने वाले पारंपरिक गणितीय सूत्रों के लगभग समान सटीक थे।
- बुरी खबर: AI को सटीक "VIPs" खोजने या मोहल्लों की सटीक संख्या गिनने में थोड़ा अधिक संघर्ष करना पड़ा, विशेष रूप से बहुत जटिल और अव्यवस्थित ग्राफ में।
- मुख्य अंतर्दृष्टि: AI को पूरे नक्शे की आवश्यकता नहीं थी। उसे केवल रैंडम वॉक से प्राप्त सही सांख्यिकी (statistics) की आवश्यकता थी। वॉक डेटा को सारांशित करके (जैसे, "हमने 500 अद्वितीय नोड्स देखे, और उनमें से 50 को दो बार देखा गया"), वे इस जानकारी को AI की छोटी नोटबुक में फिट कर सके।
निष्कर्ष
यह शोध पत्र EstGraph नामक एक नया बेंचमार्क पेश करता है। यह दिखाता है कि यदि आप AI को पूरी विश्वकोश (encyclopedia) को याद करने के लिए मजबूर करने के बजाय, उसे डेटा के माध्यम से कुछ अच्छी तरह से चुने गए "रैंडम वॉक" देते हैं, तो AI बड़े, वास्तविक दुनिया के नेटवर्क के आकार, आकार और संरचना के बारे में आश्चर्यजनक रूप से स्मार्ट अनुमान लगा सकता है।
यह एक जासूस को पूरे देश में अपराध सुलझाने के लिए सिखाने जैसा है—उसे हर एक फोटो दिखाने के बजाय, कुछ यादृच्छिक गवाहों का साक्षात्कार करने देकर और उनसे शहर के आकार और गिरोहों के स्थान का अनुमान लगाने के लिए कहकर।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।