← नवीनतम पेपर
🤖 AI

Adaptive Domain Modeling with Language Models: A Multi-Agent Approach to Task Planning

यह शोध पत्र TAPAS को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो जटिल कार्य नियोजन (टास्क प्लानिंग) के लिए डोमेन मॉडल को स्वचालित रूप से उत्पन्न करने और अनुकूलित करने के लिए लार्ज लैंग्वेज मॉडल्स को सिम्बोलिक प्लानिंग के साथ जोड़ता है, जिसमें मैन्युअल एनवायरनमेंट डेफिनिशन की आवश्यकता नहीं होती है, और बेंचमार्क एवं सिम्युलेटेड रियल-वर्ल्ड एनवायरनमेंट्स दोनों में मजबूत प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Harisankar Babu, Philipp Schillinger, Tamim Asfour

प्रकाशित 2026-08-10
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Harisankar Babu, Philipp Schillinger, Tamim Asfour

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को रात का खाना बनाना सिखाने की कोशिश कर रहे हैं। पुराने दिनों में, वैज्ञानिकों को हर एक संभावित परिदृश्य के लिए एक विशाल, कठोर निर्देश पुस्तिका लिखनी पड़ती थी: "यदि बर्तन लाल है, तो X करें। यदि बर्तन नीला है, तो Y करें।" यदि रोबोट को एक हरा बर्तन मिलता, या कोई ऐसा कार्य मिलता जो उसने पहले नहीं देखा था, तो वह रुक जाता क्योंकि निर्देश पुस्तिका में उसका विवरण नहीं होता था। यह सिंबॉलिक प्लानिंग (symbolic planning) की दुनिया है, जहाँ कंप्यूटर सख्त, पूर्व-लिखित नियमों का पालन करते हैं। यह शक्तिशाली है, लेकिन यह एक ऐसे GPS की तरह है जो केवल 1990 के मानचित्र पर खींची गई सड़कों को जानता है; यदि कोई नई सड़क खुलती है, तो GPS रास्ता भटक जाता है।

दूसरी ओर, अब हमारे पास लार्ज लैंग्वेज मॉडल्स (LLMs) हैं, जो सुपर-स्मार्ट AI दिमाग हैं जो चैट कर सकते हैं, कहानियाँ लिख सकते हैं और मानव भाषा को समझ सकते हैं। वे अविश्वसनीय रूप से लचीले हैं और वे अनुमान लगा सकते हैं कि आपका क्या मतलब है, भले ही आप अजीब तरह से बोलें। हालाँकि, वे थोड़े बहुत प्रतिभाशाली लेकिन बिखरे हुए कलाकार की तरह भी हो सकते हैं: वे एक ऐसी योजना बना सकते हैं जो सुनने में तो बहुत अच्छी लगती है लेकिन वास्तव में एक रोबोट के लिए करना भौतिक रूप से असंभव है, या वे भौतिकी के नियमों को पूरी तरह से भूल सकते हैं।

बड़ा सवाल वैज्ञानिकों के लिए यह है: हम पुराने नियम-पालन करने वाले रोबोटों की सख्त विश्वसनीयता को नए AI के लचीले, रचनात्मक दिमाग के साथ कैसे जोड़ सकते हैं? हमें एक ऐसा सिस्टम चाहिए जो "सबसे बड़े ब्लॉक को नीचे रखकर एक टावर बनाएं" जैसे अव्यवस्थित, वास्तविक दुनिया के अनुरोध को समझ सके, और फिर यह पता लगा सके कि इसे कैसे बनाया जाए, भले ही रोबोट ने पहले कभी "सबसे बड़ा ब्लॉक" न देखा हो। यहीं पर वह पेपर आता है जिसे आप पढ़ने जा रहे हैं, जो रोबोट को मौके पर सीखने का एक नया तरीका प्रदान करता है।


TAPAS से मिलिए: रचनात्मक वास्तुकारों की रोबोट टीम

TAPAS (टास्क-बेस्ड अडैप्टेशन एंड प्लानिंग यूजिंग एजेंट्स) से मिलिए। TAPAS को केवल एक एकल रोबोट मस्तिष्क के रूप में नहीं, बल्कि एक कंप्यूटर के भीतर काम करने वाली एक छोटी, अत्यधिक संगठित निर्माण टीम के रूप में सोचें। एक व्यक्ति द्वारा सब कुछ करने के बजाय, TAPAS काम को तीन विशिष्ट "एजेंट्स" (छोटे AI कार्यकर्ता) के बीच विभाजित करता है, जिनमें से प्रत्येक की एक विशिष्ट भूमिका है, जो एक योजना बनाने के लिए एक-दूसरे से बात करते हैं।

यह टीम कैसे काम करती है, इसके लिए एक सरल उपमा देखें: कल्पना कीजिए कि आप ब्लॉकों से एक टावर बनाना चाहते हैं, लेकिन आप टीम को बताते हैं, "मैं नीले वाले के ऊपर लाल ब्लॉक चाहता हूँ।"

1. डोमेन जनरेटर (नियम पुस्तिका लेखक)
सबसे पहले, डोमेन जनरेटर आपके अनुरोध को सुनता है। पुराने दिनों में, यदि रोबोट को अपनी नियम पुस्तिका में "लाल" या "नीला" का अर्थ नहीं पता होता था, तो वह बस कहता, "त्रुटि! मुझे यह शब्द नहीं पता!" और रुक जाता। लेकिन TAPAS अलग है। यदि डोमेन जनरेटर को एहसास होता है कि, "हे, हमारी वर्तमान नियम पुस्तिका में रंगों का वर्णन करने का कोई तरीका नहीं है," तो वह घबराता नहीं है। वह कहता है, "ठीक है, हमें अपनी नियम पुस्तिका में एक 'रंग' का नियम जोड़ना होगा।" वह वास्तव में इस नए विचार को शामिल करने के लिए रोबोट की आंतरिक निर्देश पुस्तिका को मौके पर ही फिर से लिख देता है।

2. इनिशियल स्टेट जनरेटर (दृश्य सेट करने वाला)
इसके बाद, इनिशियल स्टेट जनरेटर कमरे को देखता है। वह मेज पर रखे ब्लॉकों को देखता है। यदि नियम पुस्तिका को अभी-अभी "रंग" को शामिल करने के लिए अपडेट किया गया है, तो यह एजेंट पूछता है, "रुको, प्रत्येक ब्लॉक का रंग क्या है?" यदि आपने इसे नहीं बताया है, तो यह आपसे (या सिमुलेशन से) इस जानकारी के लिए पूछ सकता है। यह दृश्य को स्थापित करता है, यह सुनिश्चित करता है कि रोबोट को पता हो कि प्रत्येक ब्लॉक कहाँ है और उसका रंग क्या है, जो नए नियमों से मेल खाता हो।

3. गोल स्टेट जनरेटर (लक्ष्य निर्धारित करने वाला)
अंत में, गोल स्टेट जनरेटर आपकी इच्छा को देखता है: "नीले के ऊपर लाल।" यह नई नियम पुस्तिका और दृश्य की जाँच करता है। वह कहता है, "समझ गया। लक्ष्य उन्हें इस तरह से स्टैक करना है कि लाल वाला ऊपर हो।"

"टूल-कॉलिंग" का जादू
सबसे दिलचस्प बात यह है कि वे कैसे बात करते हैं। वे केवल अनुमान नहीं लगाते; वे "टूल्स" का उपयोग करते हैं। यदि गोल जनरेटर किसी समस्या को देखता है (जैसे, "हम आकार के आधार पर ब्लॉक नहीं रख सकते क्योंकि हमारे पास अभी तक 'आकार' का नियम नहीं है"), तो वह missing_fluent नामक टूल निकालता है और डोमेन जनरेटर से कहता है, "हे, हमें आकार के लिए एक नियम चाहिए!" डोमेन जनरेटर फिर नियम पुस्तिका को अपडेट करता है, और पूरी टीम नए, बेहतर निर्देशों के साथ फिर से शुरू करती है। यह दोस्तों के एक समूह की तरह है जो लेगो सेट बना रहे हैं, जहाँ यदि उन्हें एहसास होता है कि उनके पास एक विशिष्ट हिस्सा गायब है, तो एक दोस्त दुकान पर जाकर उसे खरीद लाता है, और फिर वे सभी मिलकर आगे निर्माण करते हैं।

"क्या" से "कैसे" तक: निष्पादन टीम

एक बार योजना बन जाने के बाद, TAPAS को वास्तव में रोबोट को चलाना होता है। यह कठिन है क्योंकि योजना कह सकती है "ब्लॉक A को ब्लॉक B पर रखें," लेकिन रोबोट के भौतिक हाथ को केवल "ग्रिपर को X, Y, Z निर्देशांकों पर ले जाएं" का पता हो सकता है।

TAPAS इस अंतर को पाटने के लिए एक प्लान एक्सेक्यूटर (Plan Executor) का उपयोग करता है। यह एक अनुवादक की तरह कार्य करता है।

  • अनुवादक: यह उच्च-स्तरीय योजना को लेता है और उसे सरल, प्राकृतिक भाषा के निर्देशों में बदल देता है जैसे "अपने हाथ को बाईं ओर ले जाएं" या "लाल ब्लॉक को पकड़ें।"
  • ReAct एजेंट: यह रोबलेट का "तर्क और कार्य" (Reason and Act) मस्तिष्क है। यह निर्देश को देखता है, जाँच करता है कि रोबोट के पास वास्तव में कौन से उपकरण (कौशल) हैं, और सबसे अच्छा विकल्प चुनता है। यदि रोबोट एक ब्लॉक को पकड़ने की कोशिश करता है और चूक जाता है, तो वैलिडेटर एजेंट (पर्यवेक्षक) कहता है, "ओह, यह काम नहीं किया। फिर से प्रयास करें, लेकिन शायद अपने हाथ को धीरे चलाएं।"

उन्होंने क्या पाया?

लेखकों ने दो मुख्य तरीकों से TAPAS का परीक्षण किया: क्लासिक लॉजिक पहेलियों पर और VirtualHome नामक एक सिम्युलेटेड 3D घर में।

1. लॉजिक पहेलियाँ (बेंचमार्क्स)
उन्होंने सात अलग-अलग नियोजन चुनौतियों पर TAPAS का परीक्षण किया, जैसे प्रसिद्ध "ब्लॉकवर्ल्ड" (ब्लॉक स्टैकिंग) और "बार्मैन" (ड्रिंक्स मिक्स करना)।

  • परिणाम: TAPAS अविश्वसनीय रूप से अच्छा था। एक शीर्ष-स्तरीय AI मॉडल (GPT-4o) का उपयोग करते हुए, इसने "बार्मैन" की 97% समस्याओं को और "ब्लॉकवर्ल्ड" की 100% समस्याओं को हल किया।
  • तुलना: यह अन्य AI मॉडलों का उपयोग करने या बिना किसी संरचित योजना के AI को सब कुछ करने के लिए मजबूर करने की तुलना में बहुत बेहतर था। उदाहरण के लिए, "ब्लॉकवर्ल्ड" परीक्षण में, TAPAS ने 100% समस्याओं को हल किया, जबकि अन्य विधियां काफी संघर्ष करती रहीं।

2. "नए नियम" परीक्षण (अनुकूलन क्षमता)
यहीं पर TAPAS वास्तव में चमकता है। शोधकर्ताओं ने रोबोट को ऐसे कार्य दिए जो उसने पहले कभी नहीं देखे थे, जैसे "ब्लॉकों को इस तरह से स्टैक करें कि सबसे बड़ा नीचे हो" या "ब्लॉकों को हिलाएं, लेकिन सुनिश्चित करें कि रोबोट की बैटरी खत्म न हो जाए।"

  • परिणाम: TAPAS ने सफलतापूर्वक यह पता लगाया कि उसे अपनी नियम पुस्तिका में "आकार" या "बैटरी" के नियम जोड़ने की आवश्यकता है। इसने यह काम स्वचालित रूप से किया।
    • "आकार" कार्य के लिए, इसने नियमों को अपडेट किया कि "आप एक ब्लॉक को केवल एक बड़े ब्लॉक के ऊपर रख सकते हैं।" इसने इन नई, कठिन समस्याओं में से 90% को हल किया।
    • "बैटरी" कार्य के लिए, इसने ऊर्जा खपत के बारे में नियम जोड़े। इसने "ग्रिपर्स" (रोबोट हाथ) की बैटरी संबंधी 100% समस्याओं को हल किया।
  • पकड़: यह पूर्ण नहीं था। "फ्लोरटाइल" (टाइल्स की सफाई) परीक्षण में, बैटरी बाधाओं के साथ, इसने केवल 70% समस्याओं को हल किया। पेपर सुझाव देता है कि ऐसा इसलिए हुआ क्योंकि AI कभी-कभी जानकारी मांगने के बजाय शुरुआती बैटरी स्तर का अनुमान लगा लेता था, जिससे पता चलता है कि सिस्टम को अभी भी धारणाएं बनाने में सावधान रहने की आवश्यकता है।

3. VirtualHome सिमुलेशन
अंत में, उन्होंने TAPAS को एक घर के 3D सिमुलेशन में रखा। कार्य था: "फ्रिज से एक पाई निकालें और उसे मेज पर रखें," और "साल्मन को गर्म करें और उसे मेज पर रखें।"

  • परिणाम: TAPAS ने सफलतापूर्वक एक योजना बनाई, उसे कार्यों में अनुवादित किया, और एक वर्चुअल रोबोट को फ्रिज खोलने, भोजन पकड़ने, माइक्रोवेव का उपयोग करने और वस्तुओं को मेज पर रखने के लिए निर्देशित किया।
  • मेमोरी ट्रिक: उन्होंने यह भी परीक्षण किया कि क्या TAPAS गलतियों से सीख सकता है। उन्होंने सिस्टम को बताया, "अगली बार जब आप फ्रिज का उपयोग करें, तो सुनिश्चित करें कि आप उसे बंद कर दें, भले ही मैं ऐसा कहने के लिए न कहूँ।" बाद में, जब रोब का सामना एक समान कार्य से हुआ, तो उसने इस नियम को याद रखा और अपने आप फ्रिज बंद कर दिया। इसने दिखाया कि TAPAS "प्रोसीजरल मेमोरी" (प्रक्रियात्मक स्मृति) को स्टोर कर सकता है ताकि वह समय के साथ बेहतर हो सके।

यह क्यों महत्वपूर्ण है (और यह क्या नहीं है)

पेपर सुझाव देता है कि TAPAS एक मजबूत कदम है क्योंकि यह दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ता है: भाषा समझने वाले AI की रचनात्मकता और सख्त नियोजन नियमों की विश्वसनीयता। यह केवल एक स्क्रिप्ट का पालन नहीं करता है; यह स्थिति बदलने पर स्क्रिप्ट को फिर से लिख सकता है।

हालाँकि, लेखक सावधानी बरतते हुए नोट करते हैं कि यह एक सिमुलेशन है। उन्होंने इसे एक कंप्यूटर दुनिया (VirtualHome) और मानक तर्क पहेलियों में परखा है, न कि एक वास्तविक रसोई में एक वास्तविक रोबोट पर। हालांकि परिणाम आशाजनक हैं, पेपर स्वीकार करता है कि वास्तविक दुनिया में तैनाती में अभी भी चुनौतियां हैं, जैसे AI को "भ्रमित" (hallucinating - तथ्य गढ़ना) होने से रोकना या उन त्रुटियों को संभालना जिन्हें स्वचालित रूप से ठीक करना बहुत जटिल हो।

संक्षेप में, TAPAS एक ऐसे रोबोट की तरह है जो केवल मानचित्र का पालन नहीं करता है; यह एक नया मानचित्र बना सकता है जब उसे रास्ता बंद मिले, यदि वह रास्ता भटक जाए तो दिशा-निर्देश मांग सकता है, और अगली बार के लिए शॉर्टकट याद रख सकता है। यह अभी तक एक पूर्ण रोबोट नहीं है, लेकिन यह एक बहुत ही स्मार्ट रोबोट है जो मौके पर सोचने का तरीका सीख रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →