← नवीनतम पेपर
🤖 AI

Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning

यह शोध पत्र ∞\infty-THOR प्रस्तुत करता है, जो एक व्यापक ढांचा है जिसमें एक स्केलेबल लॉन्ग-होराइजन ट्राजेक्टरी जनरेटर, एक नवीन "Needle(s) in the Embodied Haystack" बेंचमार्क, और एम्बोडीड एआई एजेंटों में लॉन्ग-कॉन्टेक्स्ट रीजनिंग और प्लानिंग को आगे बढ़ाने के लिए कॉन्टेक्स्ट पैरेललिज्म जैसे आर्किटेक्चरल अनुकूलन शामिल हैं।

मूल लेखक: Bosung Kim, Prithviraj Ammanabrolu

प्रकाशित 2026-02-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bosung Kim, Prithviraj Ammanabrolu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट बटलर (नौकर) को घर की सफाई करना सिखाने की कोशिश कर रहे हैं। लेकिन यह सिर्फ एक मोजा उठाने के बारे में नहीं है; यह एक जटिल, कई दिनों के मिशन के बारे में है।

समस्या: "घास के ढेर में सुई" (Needle in a Haystack) बहुत बड़ी है
आमतौर पर, जब हम AI का परीक्षण करते हैं, तो हम उससे सरल प्रश्न पूछते हैं जैसे, "लाल कप कहाँ है?" AI कमरे को देखता है और उत्तर देता है। लेकिन वास्तविक दुनिया में, एक कार्य ऐसा हो सकता है:

  1. सुबह 9:00 बजे, आपने काउंटर पर एक टमाटर देखा।
  2. सुबह 10:00 बजे, आपने एक कुर्सी हटाई।
  3. सुबह 11:00 बजे, आपने फ्रिज खोला।
  4. दोपहर 2:00 बजे, बॉस कहते हैं, "उस टमाटर को काउंटर पर रख दो।"

इसे करने के लिए, रोबोट को सुबह 9:00 बजे देखे गए टमाटर और 11:00 बजे के काउंटर को याद रखना होगा, भले ही इस बीच उसने सैकड़ों अन्य काम किए हों। वर्तमान AI मॉडल बहुत कम ध्यान देने वाले छात्रों की तरह हैं; वे भूल जाते हैं कि 5 मिनट पहले क्या हुआ था, 5 घंटे पहले क्या हुआ था, यह तो दूर की बात है। वे समय के "घास के ढेर" (haystack) में खो जाते हैं।

समाधान: ∞-THOR (अनंत टाइम मशीन)
इस शोध पत्र के लेखकों ने एक नया प्रशिक्षण मैदान बनाया है जिसे ∞-THOR कहा जाता है। इसे एक वीडियो गेम सिम्युलेटर के रूप में सोचें जो रोबots को अभ्यास करने के लिए अंतहीन, अत्यंत लंबी कहानियाँ बना सकता है।

यहाँ उन्होंने इसे कैसे विभाजित किया है:

1. प्रशिक्षण का मैदान (The Environment)

उन्होंने एक डिजिटल दुनिया बनाई जहाँ रोबोट बिना थके सैकड़ों चरणों (steps) तक अभ्यास कर सकते हैं।

  • उपमा: एक वीडियो गेम लेवल की कल्पना करें जो समाप्त नहीं होता। आप घूम सकते हैं, चीजें उठा सकते हैं, और फर्नीचर हिला सकते हैं।
  • ट्विस्ट: दिन के अंत में, गेम उन्हें एक अंतिम मिशन देता है जो केवल तभी समझ में आता है जब वे उस चीज़ को याद रखें जो उन्होंने दिन की शुरुआत में देखी थी। यह रोबोट को लंबे समय तक यादों को संजोकर रखने के लिए मजबूर करता है।

2. परीक्षण: "एम्बोडीड हेस्टैक में सुइयाँ" (Needles in the Embodied Haystack)

उन्होंने एक नया परीक्षण बनाया जिसे NiEH कहा जाता है।

  • पुराना तरीका: "यहाँ एक किताब है। बिल्ली के बारे में वाक्य ढूँढें।" (यह केवल पढ़ना है)।
  • नया तरीका (NiEH): "यहाँ एक वीडियो है जिसमें मैं 10 घंटे तक एक घर में घूम रहा हूँ। मैंने एक फूलदान हटाया, एक दराज खोली और एक चम्मच गिराया। अब, मुझे बताएं: फूलदान को दराज में रखने से पहले वह कहाँ था, और मैंने चम्मच को कितनी बार हिलाया?"
  • यह कठिन क्यों है: रोबोट को समय के साथ बिखरे हुए विशिष्ट सुरागों (सुइयों) को खोजने के लिए हजारों विजुअल फ्रेम्स (घास के ढेर) के माध्यम से छानना होगा। यह रेगिस्तान में रेत के एक विशिष्ट कण को खोजने जैसा है, लेकिन आपको वह कण याद रखना होगा जिसे आपने तीन दिन पहले देखा था।

3. मस्तिष्क का अपग्रेड (Architecture)

उन्होंने रोबोट के मस्तिष्क को इस विशाल मात्रा में जानकारी संभालने में मदद करने के लिए दो अलग-अलग तरीके आजमाए:

  • विधि A: "पूरी फिल्म" वाला दृष्टिकोण (Interleaved): वे रोबोट को शुरू से अंत तक क्या हुआ, उसका पूरा इतिहास फ्रेम-दर-फ्रेम दिखाते हैं, जैसे पूरी फिल्म देखना।
    • लाभ: यह सब कुछ देख पाता है।
    • हानि: रोबोट का मस्तिष्क (कंप्यूटर) भारी हो जाता है और मेमोरी खत्म हो जाती है क्योंकि फिल्म बहुत लंबी होती है।
  • विधि B: "फ्लैशकार्ड" वाला दृष्टिकोण (Memory-Augmented): पूरी फिल्म दिखाने के बजाय, रोबोट महत्वपूर्ण क्षणों का सारांश या कुछ प्रमुख तस्वीरें रखता है।
    • लाभ: यह मेमोरी के मामले में हल्का है।
    • हानि: यदि सारांश सटीक नहीं है, तो यह विवरण चूक सकता है।
  • विजेता: आश्चर्यजनक रूप से, "पूरी फिल्म" वाला दृष्टिकोण बेहतर काम कर गया यदि उन्होंने रोबोट को इसे संभालने के लिए एक बड़ा मस्तिष्क (अधिक मेमोरी) दिया।

4. जादुई ट्रिक्स (Training Techniques)

रोबोट के मस्तिष्क को इस पूरे डेटा में फिट करने के लिए, उन्होंने कुछ चतुर इंजीनियरिंग ट्रिक्स का उपयोग किया:

  • कॉन्टेक्स्ट एक्सटेंशन (Context Extension): कल्पना कीजिए कि एक स्केल है जो आमतौर पर 12 इंच तक मापता है। उन्होंने उस स्केल को इतना खींच दिया कि वह 100 इंच तक माप सके, जिससे रोबोट को और आगे तक गिनना सिखाया गया।
  • कॉन्टेक्स्ट पैरेललिज्म (Context Parallelism): एक व्यक्ति द्वारा 1,000 पन्नों की किताब पढ़ने के बजाय, उन्होंने किताब को 16 लोगों में विभाजित किया, मिलकर पढ़ा, और फिर अपने नोट्स को मिला दिया। यह कंप्यूटर को क्रैश हुए बिना भारी मात्रा में डेटा प्रोसेस करने में मदद करता है।

5. वास्तविक दुनिया का परीक्षण (Sim-to-Real)

सबसे रोमांचक हिस्सा? उन्होंने वीडियो गेम (सिमुलेशन) में रोबोट को प्रशिक्षित किया और फिर वास्तविक दुनिया की छवियों (जैसे वास्तविक कमरों की तस्वीरें) पर इसका परीक्षण किया।

  • परिणाम: अपनी लंबी, नकली कहानियों पर अभ्यास करके, रोबोट वास्तविक दुनिया की तस्वीरों को समझने में 11% बेहतर हो गया। यह एक पायलट की तरह है जो फ्लाइट सिम्युलेटर पर अभ्यास करता है और फिर एक वास्तविक विमान को पूरी तरह से लैंड करता है।

निचोड़ (The Bottom Line)

यह शोध पत्र उन रोबोट बनाने का एक ब्लूप्रिंट है जो केवल यह नहीं देखते कि अभी क्या हो रहा है, बल्कि वे उन चीजों की योजना बना सकते हैं और याद रख सकते हैं जो बहुत समय पहले हुई थीं।

सरल शब्दों में: उन्होंने रोबोट के लिए "लॉन्ग-टर्म मेमोरी" का अभ्यास करने के लिए एक जिम बनाया है, जिसमें उन्हें एक बहुत लंबे, जटिल "साइमन सेज़" (Simon Says) खेल को खेलना है जहाँ निर्देश गेमप्ले के घंटों के दौरान बिखरे हुए हैं। उन्होंने पाया कि यदि आप रोबोट को पर्याप्त मेमोरी और सही प्रशिक्षण देते हैं, तो वह वास्तव में एक बहुत लंबे दिन के शुरुआत और अंत के बीच के संबंध को जोड़ना सीख सकता है।

यह उन रोबोट बनाने की दिशा में एक बड़ा कदम है जो वास्तव में हमारे साथ रह सकें, जो धैर्य और स्मृति की आवश्यकता वाले जटिल कार्यों में मदद कर सकें, न कि केवल तात्कालिक प्रतिक्रियाओं में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →