← नवीनतम पेपर
🔬 physics

Lost in Aggregation: A Multi-Scale Diagnostic Benchmark for LLM Spatial Navigation

यह शोध पत्र "लॉस्ट इन एग्रीगेशन" (Lost in Aggregation) प्रस्तुत करता है, जो एक बहु-स्तरीय नैदानिक बेंचमार्क है जो यह प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स स्थानिक नेविगेशन में स्थानीय धारणा या वैश्विक दिशा की कमी के कारण नहीं, बल्कि इसलिए विफल होते हैं क्योंकि उन्हें इन व्यक्तिगत रूप से सक्षम कौशलों को सुसंगत दीर्घकालिक योजनाओं में संकलित करने में संघर्ष करना पड़ता है, विशेष रूप से जंक्शन विकल्पों के समय।

मूल लेखक: Yuhan jiang, Peng Luo, Liqiu Meng

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhan jiang, Peng Luo, Liqiu Meng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, विद्वान रोबोट से एक विशाल, जटिल भूलभुलैया (maze) के माध्यम से आपका मार्गदर्शन करने के लिए कह रहे हैं। आप उसे नक्शा देते हैं, और वह आपको शुरू से अंत तक पहुँचने के लिए चरण-दर-चरण निर्देश देने की कोशिश करता है।

"लॉस्ट इन एग्रीगेशन" (Lost in Aggregation) नामक शोध पत्र एक सरल लेकिन गहरा प्रश्न पूछता है: जब ये रोबोट विफल होते हैं, तो वे वास्तव में कहाँ खो जाते हैं?

क्या वे भूल जाते हैं कि दीवार कैसी दिखती है? क्या वे सड़क के मोड़ (fork) पर भ्रमित हो जाते हैं? या क्या वे भूल जाते हैं कि फिनिश लाइन किस दिशा में है?

शोधकर्ताओं ने इसका उत्तर खोजने के लिए एक विशेष परीक्षण (एक "डायग्नोस्टिक बेंचमार्क") बनाया। यहाँ उनकी खोज की कहानी है, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. खो जाने के तीन स्तर

लेखकों ने "नेविगेशन" को तीन अलग-अलग मानसिक कार्यों में विभाजित किया है, जैसे केक की परतें हों:

  • सूक्ष्म परत (स्थानीय दृष्टि - Local Vision): "क्या मैं दीवार से टकराए बिना आगे बढ़ सकता हूँ?" यह तत्काल परिवेश को देखने के बारे में है।
  • मध्यम परत (जंक्शन लॉजिक - Junction Logic): "सड़क के इस मोड़ पर, कौन सा रास्ता लक्ष्य की ओर ले जाता है, और कौन सा रास्ता बंद गली (dead end) है?" यह चौराहों पर निर्णय लेने के बारे में है।
  • स्थूल परत (वैश्विक दिशा-सूचक - Global Compass): "क्या मैं सामान्य रूप से फिनिश लाइन की ओर बढ़ रहा हूँ, भले ही मुझे चक्कर लगाने पड़ें?" यह बड़े स्तर पर दिशा का बोध बनाए रखने के बारे में है।

2. बड़ा आश्चर्य: रोबोट अंधा नहीं है

शोधकर्ताओं को उम्मीद थी कि रोबोट (Large Language Models) इसलिए विफल होंगे क्योंकि वे भूलभुलैया को "देख" नहीं सकते या लक्ष्य को याद नहीं रख सकते।

लेकिन ऐसा नहीं हुआ।

  • वे सूक्ष्म विवरण देख सकते हैं: यदि आप रोबत से पूछते हैं, "क्या मैं इस स्थान से उत्तर की ओर चल सकता हूँ?" तो वह बड़े भूलभुलैया में भी अधिकांश समय सही उत्तर देता है।
  • वे दिशा का ज्ञान रख सकते हैं: यदि आप पूछते हैं, "क्या लक्ष्य सामान्य रूप से पूर्व की ओर है?" तो वह बड़े भूलभुलैया में भी सही उत्तर देता है।
  • वे बंद गलियों को पहचान सकते हैं: यदि आप पूछते हैं, "क्या यह रास्ता एक डेड एंड है?" तो वे आमतौर पर सही होते हैं।

तो, यदि वे ये सब जानते हैं, तो वे भूलभुलैया में क्यों विफल हो जाते हैं?

3. असली समस्या: "लॉस्ट इन एग्रीगेशन" (एकत्रीकरण में खो जाना)

इस शोध पत्र की मुख्य खोज यह है कि रोबोट किसी एकल कार्य में विफल नहीं हो रहा है। वह इन सभी को एक साथ जोड़ने में विफल हो रहा है जब एक लंबी यात्रा की बात आती है।

इसे एक रिले रेस की तरह समझें।

  • रोबोट पहले 10 मीटर के लिए एक बेहतरीन धावक है (उसे दीवारों का पता है)।
  • वह अगले 10 मीटर के लिए एक बेहतरीन धावक है (उसे मोड़ों का पता है)।
  • वह अंतिम 10 मीटर के लिए भी एक बेहतरीन धावक है (उसे दिशा का पता है)।

लेकिन जब आप उसे बिना रुके पूरा मैराथन (पूरी भूलभुलैया) दौड़ने के लिए कहते हैं, तो वह लड़खड़ा जाता है और गिर जाता है। वह अपने स्थानीय कदमों को अपनी वैश्विक योजना के साथ जोड़ने का सूत्र खो देता है। भूलभुलैया जितनी लंबी होती है, "यहाँ बाईं ओर मुड़ने" और "इससे मुझे लक्ष्य तक पहुँचने में मदद मिलेगी" के बीच का संबंध भूलने की संभावना उतनी ही अधिक होती है।

शोधकर्ता इसे "एग्रीगेशन फेलियर" (Aggregation Failure) कहते हैं। रोबट के पास सभी सही उपकरण हैं, लेकिन जब योजना बहुत लंबी हो जाती है, तो वह जुड़ाव खो देता है।

4. इनपुट: टेक्स्ट बनाम चित्र

शोधकर्ताओं ने यह भी परीक्षण किया कि रोबोट को भूलभुलैया कैसे दी जाए।

  • चित्र (Pictures): रोबोट को भूलभलैया का चित्र दिखाना सबसे खराब तरीका था। यह ऐसा था जैसे किसी धुंधले नैपकिन पर बने नक्शे को पढ़ने की कोशिश करना।
  • निर्देशांक (Coordinates - Text): रोबोट को संख्याओं और अक्षरों की एक सूची देना (जैसे "रो 3, कॉलम 5") सबसे अच्छा काम करता है। यह रोबोट को एक स्पष्ट, टाइप किया हुआ निर्देश मैनुअल देने जैसा है।

5. समाधान: "हाइब्रिड" टीम

चूंकि रोबोट पूरी मैराथन दौड़ने में बुरा है लेकिन विशिष्ट निर्णय लेने में अच्छा है, इसलिए शोधकर्ताओं ने एक नई रणनीति आजमाई: डेलीगेशन (प्रतिनिधि बनाना)।

उन्होंने एक टीम बनाई:

  • एल्गोरिदम (रोबोट के पैर): एक सरल, साधारण कंप्यूटर प्रोग्राम जो सीधे गलियारों में चलता है और यदि वह किसी बंद गली (dead end) से टकराता है, तो भौतिक रूप से वापस मुड़ जाता है। वह कभी थकता या भ्रमित नहीं होता।
  • LLM (रोबोट का मस्तिष्क): स्मार्ट AI से केवल चौराहों (intersections) पर निर्णय लेने के लिए कहा जाता है।

परिणाम:
जब उन्होंने रोबोट को एक ऐसा "नक्शा" दिया जिसमें स्पष्ट रूप से लिखा था, "आप एक जंक्शन पर हैं, एक रास्ता चुनें," और चलने और डेड एंड से वापस लौटने का काम एक साधारण कंप्यूटर को सौंप दिया, तो रोबोट की सफलता दर जबरदस्त रूप से बढ़ गई।

  • मदद के बिना: रोबोट मध्यम आकार की भूलभुलैया में लगभग हर बार विफल हो जाता था।
  • मदद के साथ: उसने उन्हें लगभग पूरी तरह से हल कर लिया।

हालाँकि, एक सीमा है। इस मदद के साथ भी, एक बार जब भूलभलैया बहुत बड़ी (30x30) हो गई, तो रोबोट फिर से विफल होने लगा। "धागा" इतना लंबा था कि उसे पकड़ पाना मुश्किल हो गया, मदद के बावजूद।

सारांश

यह शोध पत्र निष्कर्ष निकालता है कि वर्तमान AI मॉडल स्थान (space) के बारे में "मूर्ख" नहीं हैं। वे जानते हैं कि दीवार क्या है, वे जानते हैं कि उत्तर दिशा क्या है, और वे जानते हैं कि डेड एंड को कैसे पहचानना है।

वे बस तब अभिभूत (overwhelmed) हो जाते हैं जब उन्हें एक लंबे समय तक एक साथ इतने सारे तथ्यों को अपने दिमाग में रखना पड़ता है।

इसे ठीक करने के लिए, हमें AI को हर चीज़ में स्मार्ट बनाने की कोशिश नहीं करनी चाहिए। इसके बजाय, हमें हाइब्रिड टीमें बनानी चाहिए: एक साधारण कंप्यूटर को चलने और डेड एंड संभालने दें, और AI को एक "जंक्शन मैनेजर" के रूप में कार्य करने दें जो केवल चौराहों पर बड़े निर्णय लेता है। यह मध्यम आकार की समस्याओं के लिए बहुत अच्छा काम करता है, लेकिन सबसे बड़ी भूलभुलैया के लिए, यह टीम भी अंततः रास्ता भटक जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →