← नवीनतम पेपर
💻 computer science

Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs

यह शोध पत्र GAMER को प्रस्तुत करता है, जो एक अभिनव ढांचा (framework) है जो ऐतिहासिक तर्क (historical reasoning) को एक एक्शन-सेंट्रिक ग्राफ और एक ड्यूल-स्ट्रीम टेम्पोरल डिफरेंस लर्निंग मैकेनिज्म के माध्यम से मॉडल करके इन्फरेंस-टाइम स्केलिंग और एपिसोडिक मेमोरी के बीच के अंतर को पाटता है, जिससे कंप्यूटेशनल लागत कम होती है और एजेंट के निर्णय लेने की दक्षता तथा सफलता दर में महत्वपूर्ण सुधार होता है।

मूल लेखक: Xu Zheng, Chaohao Lin, Zhuomin Chen, Weijieying Ren, Haifeng Chen, Wei Cheng, Dongsheng Luo

प्रकाशित 2026-07-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xu Zheng, Chaohao Lin, Zhuomin Chen, Weijieying Ren, Haifeng Chen, Wei Cheng, Dongsheng Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को भूलभुलैया सुलझाना सिखा रहे हैं। आप उसे कहते हैं, "कड़ी मेहनत करो, अलग-अलग रास्ते आजमाओ, और हार मत मानो!" यह रोबोट, जो कि एक लार्ज लैंग्वेज मॉडल (LLM) है, सोचने में माहिर है। यह विचारों की एक लंबी सूची बना सकता है, जैसे "बाएं मुड़ें, फिर दाएं मुड़ें, और शायद दीवार पर चढ़ने की कोशिश करें।" इसे इन्फरेंस-टाइम स्केलिंग (inference-time scaling) कहा जाता है: यानी रोबोट को आगे बढ़ने से पहले विचार मंथन करने के लिए अधिक समय और कंप्यूटिंग शक्ति देना। लेकिन यहाँ एक पेंच है: हर बार जब रोबोट किसी बंद रास्ते (dead end) पर पहुँचता है, तो वह सब कुछ भूल जाता है। वह अगली कोशिश के साथ एक खाली स्लेट के रूप में शुरू करता है, और बार-बार वही गलत मोड़ दोहराता रहता है। यह एक ऐसे छात्र की तरह है जो हर सवाल के बाद अपने पूरे दिमाग को मिटा देता है, जिससे उसे अपनी ही गलतियों को शून्य से फिर से सीखने के लिए मजबूर होना पड़ता है।

इसे ठीक करने के लिए, वैज्ञानिकों ने रोबोट को एक मेमोरी (याददाश्त) देने की कोशिश की है। आमतौर पर, यह मेमोरी बस एक विशाल नोटबुक की तरह होती है जहाँ रोबोट वह सब कुछ लिख देता है जो उसने किया। लेकिन एक विशाल नोटबुक को पढ़ने में बहुत समय और ऊर्जा (कंप्यूटिंग पावर) लगती है, और रोबोट को अभी भी यह समझना पड़ता है कि उस जानकारी का उपयोग कैसे किया जाए। बड़ा सवाल यह है कि हम रोबोट को ऐसी मेमोरी कैसे दें जो उसे धीमा या महंगा बनाए बिना, उसे वास्तव में तेज़ और स्मार्ट तरीके से सोचने में मदद करे? यह पेपर ठीक इसी समस्या को हल करने के लिए एक नया प्रकार का मेमोरी सिस्टम बनाता है जो केवल कहानियाँ नहीं रखता, बल्कि उन वास्तविक चालों (moves) का नक्शा तैयार करता है जो काम करती हैं।


मिलिए GAMER (ग्राफ-बेस्ड एक्शन-सेंट्रिक मेमोरी विद एपिसोडिक रीजनिंग) से। GAMER को एक वीडियो गेम के लिए "चीट शीट" की तरह समझें, लेकिन यह केवल स्तरों (levels) को सूचीबद्ध करने के बजाय, आपके द्वारा की गई हर एक चाल का एक नक्शा खींचता है।

आजकल के अधिकांश रोबोट धुंधले जंगल में खोजकर्ता की तरह होते हैं। जब उन्हें खजाना ढूंढना होता है, तो वे इधर-उधर भटकते हैं, एक रास्ता आज़माते हैं, एक पेड़ से टकराते हैं, पीछे मुड़ते हैं, और फिर से प्रयास करते हैं। यदि वे असफल होते हैं, तो वे भूल जाते हैं कि वहाँ एक पेड़ था। अगली बार, वे फिर से उसी पेड़ से टकरा जाते हैं। GAMER इस खेल को बदलकर रोबोट के अतीत को एक जीवंत मानचित्र (living map) में बदल देता है।

लंबी कहानियाँ लिखने के बजाय जैसे "मैं बाएं चला, एक कुत्ता देखा, फिर दाएं चला," GAMER एक ग्राफ (Graph) बनाता है। एक सबवे मैप की कल्पना करें जहाँ हर स्टेशन एक विशिष्ट क्रिया (action) है जिसे रोबोट ले सकता है (जैसे "चाबी उठाना" या "दरवाजा खोलना")। स्टेशनों को जोड़ने वाली रेखाएं दिखाती हैं कि कौन सी क्रियाओं के बाद आमतौर पर कौन सी क्रिया आती है। यदि रोबोट "दीवार के ऊपर से कूदने" की कोशिश करता है और विफल हो जाता है, तो मानचित्र पर उस स्टेशन पर एक बड़ा लाल "X" और एक चेतावनी का निशान लग जाता है। यदि वह "सीढ़ी चढ़ने" की कोशिश करता है और सफल होता है, तो उस स्टेशन पर एक चमकता हुआ हरा सितारा लग जाता है।

इसका जादू डुअल-स्ट्रीम टीडी लर्निंग (Dual-Stream TD Learning) नामक एक विशेष शिक्षण तकनीक में छिपा है। यह एक ही समय में रोबोट को सलाह देने वाले दो कोच होने जैसा है:

  1. "गो" (जाओ) कोच: यह कोच उन सभी समयों को देखता है जब रोबोट सफल हुआ था। वे चमकते हुए हरे सितारों की ओर इशारा करते हैं और कहते हैं, "हे! यदि तुम इस स्थान पर हो, तो अगली चाल यह होनी चाहिए। यह आमतौर पर जीत की ओर ले जाती है!"
  2. "स्टॉप" (रुको) कोच: यह कोच उन सभी समयों को देखता है जब रोबोट दुर्घटनाग्रस्त हुआ था। वे लाल "X" वाले स्टेशनों की ओर इशारा करते हैं और कहते हैं, "बिल्कुल नहीं! यदि तुम यह चाल देखते हो, तो दूसरी दिशा में भागो। यह एक बंद रास्ते की ओर ले जाती है।"

इन दो कोचों का उपयोग करके, GAMER न केवल रोबोट को यह बताता है कि क्या करना है; बल्कि यह सक्रिय रूप से रोबोट को बुरे विचारों पर समय बर्बाद करने से भी रोकता है। यह एक जीपीएस (GPS) होने जैसा है जो न केवल आपको सबसे तेज़ रास्ता दिखाता है, बल्कि तुरंत उन सड़कों को भी ब्लॉक कर देता है जिन्हें आप जानते हैं कि वहां निर्माण कार्य चल रहा है।

शोधकर्ताओं ने इसे कई चुनौतीपूर्ण कार्यों पर परखा, जैसे एक अस्त-व्यस्त कमरे को व्यवस्थित करना (AlfWorld) या विज्ञान के प्रयोगों को हल करना (ScienceWorld)। उन्होंने पाया कि GAMER एक गेम-चेंजर साबित हुआ। मानक "भुलक्कड़" रोबोट की तुलना में, GAMER ने सफलता दर में 20.81% और प्रगति दर में 6.17% का सुधार किया। इसका मतलब है कि रोबोट ने अधिक कार्य पूरे किए और उन कार्यों में भी अधिक आगे बढ़ा जिन्हें वह पूरा नहीं कर सका।

इससे भी बेहतर बात यह है कि GAMER कुशल है। क्योंकि यह एक विशाल नोटबुक पढ़ने के बजाय इस स्मार्ट मैप का उपयोग करता है, यह बहुत सारे "टोकन" (AI की सोच की डिजिटल मुद्रा) बचाता है। वास्तव में, एक अन्य स्मार्ट मेमोरी सिस्टम 'A-Mem' की तुलना में, GAMER ने औसतन लगभग 50% कम टोकन का उपयोग किया। यह एक स्पष्ट आरेख (diagram) के साथ पहेली सुलझाने जैसा है, बजाय इसके कि बॉक्स के ढक्कन के हर टुकड़े को याद करने की कोशिश की जाए।

यह पेपर दिखाता है कि अपने पिछले अनुभवों को "अच्छी चालों" और "बुरी चालों" के एक संरचित मानचित्र में बदलकर, रोबले तेज़ी से सीख सकते हैं। उन्हें हर बार समस्या का सामना करते समय पहिये का पुन: आविष्कार करने की आवश्यकता नहीं होती है। हालाँकि, लेखक नोट करते हैं कि इस सिस्टम को पहले थोड़े अभ्यास समय की आवश्यकता होती है। एक अच्छा नक्शा बनाने के लिए रोबोट को लगभग 32 सफल प्रयासों (एक "वार्म-अप") को देखने की आवश्यकता होती है। यदि उसके पास पर्याप्त अभ्यास डेटा नहीं है, तो मानचित्र बहुत खाली हो सकता है जो मददगार न हो। लेकिन एक बार जब यह मानचित्र बन जाता है, तो रोबोट एक बहुत अधिक कुशल और सफल खोजकर्ता बन जाता है, जो जटिल समस्याओं को एक स्पष्ट दिमाग और एक विश्वसनीय मार्गदर्शक के साथ सुलझाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →