← नवीनतम पेपर
💻 computer science

Context Matters! Relaxing Goals with LLMs for Feasible 3D Scene Planning

यह शोधपत्र ContextMatters को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो पर्यावरणीय संदर्भ के आधार पर लक्ष्यों को गतिशील रूप से शिथिल करने के लिए लार्ज लैंग्वेज मॉडल्स को क्लासिकल प्लानिंग के साथ जोड़ता है, जिससे 3D सीन प्लानिंग की सफलता दर में उल्लेखनीय सुधार होता है और सफल वास्तविक-दुनिया रोबोट तैनाती सक्षम होती है।

मूल लेखक: Emanuele Musumeci, Michele Brienza, Francesco Argenziano, Abdel Hakim Drid, Vincenzo Suriani, Daniele Nardi, Domenico D. Bloisi

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Emanuele Musumeci, Michele Brienza, Francesco Argenziano, Abdel Hakim Drid, Vincenzo Suriani, Daniele Nardi, Domenico D. Bloisi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त रसोई में एक रोबोट शेफ हैं। आपके मानव बॉस ने आपको एक बहुत ही विशिष्ट आदेश दिया है: "मेरे लिए ताज़ा, गर्म कॉफी का एक कप और बेकरी से एक चॉकलेट क्रोइसेंट (croissant) लेकर आओ।"

आप बेकरी की ओर दौड़ते हैं, लेकिन वहां पहुँचकर आपको दो समस्याओं का सामना करना पड़ता है:

  1. कॉफी मशीन खराब है (कॉफी नहीं है)।
  2. बेकरी में क्रोइसेंट खत्म हो गए हैं (चॉकलेट वाले भी नहीं हैं)।

यहाँ अलग-अलग प्रकार के "दिमाग" इस आपदा को कैसे संभालेंगे:

  • "शुद्ध तर्क" वाला दिमाग (क्लासिकल प्लानिंग - Classical Planning): यह दिमाग एक सख्त नियम मानने वाले मुनीम की तरह है। यह सूची की जाँच करता है, "कॉफी" और "क्रोइसेंट" देखता है, महसूस करता है कि वे गायब हैं, और तुरंत रुक जाता है। यह कहता है, "त्रुटि (Error): कार्य असंभव है। मैं आगे नहीं बढ़ सकता।" यह योजना बदलने से इनकार कर देता है, भले ही इसका मतलब खाली हाथ वापस जाना ही क्यों न हो।
  • "शुद्ध कल्पना" वाला दिमाग (केवल LLM): यह दिमाग एक ख्याली दुनिया में रहने वाले कलाकार की तरह है। यह खराब मशीन और खाली शेल्फ को अनदेखा कर देता है। यह आत्मविश्वास से आपसे कहता है, "मैं बेकरी जाऊँगा, कॉफी और क्रोइसेंट लाऊँगा और आपको दे दूँगा!" यह अपने दिमाग में एक सुंदर योजना बनाता है, लेकिन जब यह वास्तविक दुनिया में इसे लागू करने की कोशिश करता है, तो यह क्रैश हो जाता है क्योंकि वे वस्तुएं वास्तव में मौजूद ही नहीं हैं।
  • "संदर्भ मायने रखता है" वाला दिमाग (इस पेपर का समाधान): यह एक स्मार्ट, अनुकूलन योग्य दिमाग है। यह खराब मशीन और खाली शेल्फ को देखता है, लेकिन हार मानने या झूठ बोलने के बजाय, यह सोचता है: "ठीक है, बॉस को एक गर्म पेय और एक मीठा व्यंजन चाहिए। चूंकि कॉफी खत्म हो गई है, शायद चाय काम कर जाए। चूंकि क्रोइसेंट खत्म हो गए हैं, शायद मफिन ठीक रहेगा। चलिए देखते हैं कि क्या हमारे पास चाय और मफिन उपलब्ध हैं।"

मुख्य विचार: "संदर्भ मायने रखता है" (Context Matters)

यह पेपर ContextMatters नामक एक प्रणाली पेश करता है। यह रोबनों को लचीले समस्या समाधानकर्ता (flexible problem solvers) बनाने का एक तरीका है, न कि केवल सख्त नियम मानने वाले या सपने देखने वाले।

इसे एक GPS नेविगेशन ऐप की तरह समझें जो रास्ता बंद होने पर और भी स्मार्ट हो जाता है।

  • पुराना GPS: "आप फंस गए हैं। रास्ता बंद है। अब आप खो गए हैं।"
  • ContextMatters GPS: "रास्ता बंद है। कोई बात नहीं! मुझे पार्क के रास्ते से एक डायवर्जन (detour) दिख रहा है। यह थोड़ा लंबा है, लेकिन यह आपको उसी गंतव्य तक पहुँचा देगा। या, यदि पार्क भी बंद है, तो हम मूल स्थान के बजाय पास के किसी कॉफी शॉप पर जा सकते हैं। आइए आपके सफर का सबसे अच्छा संभव संस्करण खोजें।"

यह कैसे काम करता है (दो-चरणीय प्रक्रिया)

यह प्रणाली टूटी हुई योजनाओं को ठीक करने के लिए "दो-आयामी" दृष्टिकोण का उपयोग करती है:

  1. "क्या" (शिथिलता/Relaxation): यदि आप सटीक वस्तु नहीं पा सकते, तो क्या आप कुछ समान प्राप्त कर सकते हैं?

    • मूल लक्ष्य: "मेरे लिए एक लाल सेब लाओ।"
    • शिथिल लक्ष्य (Relaxed Goal): "मेरे लिए कोई भी सेब लाओ।" (शायद लाल वाले खत्म हो गए हैं, लेकिन हरे वाले वहाँ हैं)।
    • और भी अधिक शिथिल: "मेरे लिए कोई भी फल लाओ।"
  2. "कहाँ" (स्थानांतरण/Shifting): यदि वस्तु रसोई में नहीं है, तो क्या वह पेंट्री में है?

    • मूल लक्ष्य: "ऊपरी दराज से कांटा (fork) निकालो।"
    • स्थानांतरित लक्ष्य (Shifted Goal): "कटोरों वाली दराज (silverware drawer) से कांटा निकालो।" (शायद ऊपरी दराज लॉक है, लेकिन नीचे वाली खुली है)।

रोबोट एक लार्ज लैंग्वेज मॉडल (LLM) (जो "सामान्य ज्ञान" वाला हिस्सा है) का उपयोग करके इन नए, लचीले लक्ष्यों का सुझाव देता है। फिर, वह एक क्लासिकल प्लानर (जो "तर्क" वाला हिस्सा है) का उपयोग यह दोबारा जाँचने के लिए करता है: "रुको, क्या हमारे पास पेंट्री में वास्तव में एक हरा सेब है? हाँ? बहुत बढ़िया! चलिए इसे प्राप्त करने की योजना बनाते हैं।"

यह एक बड़ी बात क्यों है

वास्तविक दुनिया में, चीजें शायद ही कभी योजना के अनुसार होती हैं। रोबोट अक्सर इसलिए विफल होते हैं क्योंकि वे बहुत कठोर होते हैं। यदि किसी रोबोट को "नीला कप उठाने" के लिए कहा जाता है और नीला कप टूट गया है, तो एक सामान्य रोबोट बस गोल-गोल घूमता रहेगा या टकरा जाएगा।

ContextMatters रोबोट को यह कहने की अनुमति देता है: "नीला कप टूट गया है। मैं पास में एक लाल कप देख रहा हूँ। उपयोगकर्ता शायद बस एक कप चाहता है। मैं इसके बजाय लाल कप उठा लूँगा।"

परिणाम

शोधकर्ताओं ने इसे एक वास्तविक रोबोट (एक TIAGo रोबोट आर्म) और कंप्यूटर सिमुलेशन पर परखा।

  • परिणाम: उनकी प्रणाली वर्तमान सर्वोत्तम तरीकों की तुलना में 52% अधिक सफल रही।
  • वास्तविक दुनिया का परीक्षण: उन्होंने रोबोट से "मेज पर 4 स्नैक्स लाओ" कहा। रोबोट को केवल 3 स्नैक्स मिले। विफल होने के बजाय, उसने एक स्नैक को सोडा कैन (चूंकि दोनों ही "बच्चों के लिए जलपान" हैं) के साथ बदलने के लिए अपने सामान्य ज्ञान का उपयोग किया और सफलतापूर्वक कार्य पूरा किया।

निष्कर्ष

यह पेपर हमें सिखाता है कि रोबोटों के वास्तव में हमारे बीच रहने और काम करने के लिए, उन्हें पूर्ण योजनाकार बनना बंद करना होगा और व्यावहारिक समस्या समाधानकर्ता (pragmatic problem solvers) बनना होगा। उन्हें यह समझने की आवश्यकता है कि संदर्भ मायने रखता है—कभी-कभी पूर्ण समाधान मौजूद नहीं होता है, लेकिन एक "पर्याप्त अच्छा" समाधान जो वास्तव में काम करता है, उस पूर्ण योजना से कहीं बेहतर है जो विफल हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →