← नवीनतम पेपर
🤖 AI

GroundAct: Can LLM Agents Ground Actions in Environmental States?

यह शोधपत्र GroundAct प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है यह प्रदर्शित करता है कि जब निर्देश व्यवहार्यता विवरणों को छोड़ देते हैं, तो LLM एजेंट पर्यावरणीय अवस्थाओं में कार्यों को ग्राउंड करने में संघर्ष करते हैं, जिससे यह उजागर होता है कि इस बहुआयामी चुनौती को केवल स्केलिंग के माध्यम से हल नहीं किया जा सकता है और इसके लिए विशेषता (attribute), टूल और समन्वय (coordination) तर्क में विशिष्ट क्षमताओं की आवश्यकता होती है।

मूल लेखक: Zixuan Wang, Dingming Li, Hongxing Li, Yanrui Miao, Shuo Chen, Yuchen Yan, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zixuan Wang, Dingming Li, Hongxing Li, Yanrui Miao, Shuo Chen, Yuchen Yan, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने घर की सफाई में मदद करने के लिए एक बहुत ही स्मार्ट रोबोट असिस्टेंट को काम पर रख रहे हैं। आप उसे एक सरल कमांड देते हैं: "वर्कबेंच को साफ करो।"

एक इंसान तुरंत स्थिति को देख लेगा और तीन चीजें समझ जाएगा:

  1. वह कॉफी मग इतना हल्का है कि उसे उठाया जा सकता है।
  2. केबल का वह 50 किलो का स्पूल (spool) इतना भारी है कि एक व्यक्ति के लिए उठाना संभव नहीं है; आपको मदद के लिए एक दोस्त की जरूरत होगी।
  3. कॉफी के उस दाग को पोंछने के लिए एक कपड़े की जरूरत है; आप उसे सिर्फ अपने हाथों से नहीं साफ कर सकते।

GroundAct नामक शोध पत्र तर्क देता है कि वर्तमान AI मॉडल (LLMs) तब तो बेहतरीन होते हैं जब निर्देश स्पष्ट हों, लेकिन वे अक्सर तब विफल हो जाते हैं जब उन्हें भौतिक दुनिया के नियमों को खुद समझना पड़ता है। वे शायद भारी केबल को अकेले उठाने की कोशिश करेंगे, असफल होंगे, और फिर बस कह देंगे, "ठीक है, मेरा काम हो गया," बिना यह समझे कि उन्हें किसी औजार या साथी की आवश्यकता थी।

लेखक इस लुप्त कौशल को "एक्शन ग्राउंडिंग" (Action Grounding) कहते हैं। यह पर्यावरण को देखने, छिपे हुए प्रतिबंधों (जैसे वजन, तापमान, या उपकरण की आवश्यकता) को समझने और यह तय करने की क्षमता है कि वास्तव में क्या करना संभव है।

"ग्राउंडिंग" के तीन प्रकार

शोधकर्ताओं ने इसे एक वीडियो गेम के रूपक (analogy) का उपयोग करके तीन विशिष्ट कौशलों में विभाजित किया है:

  1. एट्रीब्यूट रीजनिंग (तुलना करने का कौशल - Attribute Reasoning):

    • परिदृश्य: "सबसे भारी बॉक्स उठाओ।"
    • AI की चुनौती: AI केवल "भारी" लेबल वाले बॉक्स को नहीं ढूंढ सकता। उसे सभी बॉक्स देखने होंगे, उनके वजन की तुलना करनी होगी (जो कि संख्याएं हैं, न कि केवल "भारी" या "हल्का"), और विजेता खोजने के लिए गणित करना होगा।
    • रूपक: यह भीड़ में सबसे लंबे व्यक्ति को खोजने जैसा है। आप केवल "लंबे" का साइन देखकर नहीं ढूंढ सकते; आपको हर किसी को एक-दूसरे के विरुद्ध मापना होगा।
  2. टूल रीजनिंग (अनलॉक करने का कौशल - Tool Reasoning):

    • परिदृश्य: "दाग साफ करो।"
    • AI की चुनौती: AI के पास "साफ करने" का बटन लेकर शुरू नहीं होता। उसे यह महसूस करना होगा, "मैं खाली हाथों से साफ नहीं कर सकता। मुझे पहले एक कपड़ा ढूंढना होगा।" एक बार जब वह कपड़ा पकड़ लेता है, तो वह सफाई करने की क्षमता को "अनलॉक" कर देता है। यदि वह कपड़ा गिरा देता है, तो वह यह क्षमता भी खो देता है।
    • रूपक: एक वीडियो गेम के बारे में सोचें जहाँ आप तब तक दरवाजा नहीं खोल सकते जब तक आपको चाबी न मिल जाए। AI को यह महसूस करना होगा कि दरवाजा बंद है, चाबी ढूंढनी होगी, और फिर यह जानना होगा कि चाबी अब दरवाजा खोलने की अनुमति देती है।
  3. कोऑर्डिनेशन रीजनिंग (टीमवर्क का कौशल - Coordination Reasoning):

    • परिदृश्य: "पियानो हिलाओ।"
    • AI की चुनौती: निर्देश में "मदद लें" नहीं लिखा है। AI को पियानो के वजन को देखना होगा, यह महसूस करना होगा कि यह एक रोबोट के लिए बहुत भारी है, और स्वेच्छा से दूसरे रोबोट से मदद मांगनी होगी।
    • रूपक: यह सोफे को हिलाने जैसा है। यदि आप अकेले उसे उठाने की कोशिश करते हैं और असफल होते हैं, तो एक समझदार व्यक्ति महसूस करता है, "मुझे एक साथी की जरूरत है," और उसे बुला लेता है। एक कम समझदार व्यक्ति बस हार मानने तक अकेले उसे उठाने की कोशिश करता रहता है।

नया परीक्षण: GroundAct

इन कौशलों का परीक्षण करने के लिए, टीम ने GroundAct नामक एक विशाल परीक्षण सूट बनाया।

  • सेटअप: एक वास्तविक 3D रोबोट बनाने के बजाय (जो धीमा और महंगा है), उन्होंने एक टेक्स्ट-आधारित सिमुलेशन बनाया। एक बहुत विस्तृत टेक्स्ट विवरण की कल्पना करें जो कमरे का वर्णन करता है, जिसमें हर वस्तु, उसका वजन, उसका रंग और उसकी स्थिति सूचीबद्ध है।
  • पैमाना: उन्होंने 1,500 अलग-अलग "कमरे" और 16,000 से अधिक अलग-अलग कार्य बनाए, जो सरल कमांड ("कप यहाँ रखें") से लेकर जटिल पहेलियों ("सबसे भारी मेज साफ करें, लेकिन आपको एक कपड़े और एक साथी की आवश्यकता होगी") तक विस्तृत हैं।
  • ट्विस्ट: निर्देशों में कभी भी AI को वजन की सीमा या उपकरणों की आवश्यकता के बारे में नहीं बताया जाता है। AI को पर्यावरण के विवरण से इसे समझना पड़ता है।

उन्होंने क्या पाया

शोधकर्ताओं ने 15 अलग-अलग AI मॉडल (छोटे से लेकर विशाल सुपर-स्मार्ट मॉडल्स तक) का परीक्षण किया और कुछ आश्चर्यजनक परिणाम पाए:

  • "स्मार्ट" होने का मतलब "ग्राउंडेड" होना नहीं है: एक मॉडल गणित और तर्क (Attribute Reasoning) में अद्भुत हो सकता है, लेकिन यह समझने में बहुत बुरा हो सकता है कि उसे किसी उपकरण या साथी की आवश्यकता है। इसके विपरीत, एक मॉडल टीम वर्क में अच्छा हो सकता है लेकिन वजन की तुलना करने में बुरा। ये अलग-अलग कौशल हैं, न कि केवल "अधिक बुद्धिमत्ता।"
  • सब कुछ जानना बुरा भी हो सकता है: जब उन्होंने AI को कमरे का पूरा नक्शा (कुछ भी छिपाए बिना) "चीट शीट" के रूप में दिया, तो वह टूल्स खोजने में बेहतर हो गया (क्योंकि उसे खोजने की जरूरत नहीं पड़ी)। लेकिन वह टीमवर्क में और भी खराब हो गया! क्यों? क्योंकि हर एक विवरण को देखने से उसका ध्यान इस सरल तथ्य से भटक गया कि "यह वस्तु बहुत भारी है।" वह शोर में खो गया।
  • प्रशिक्षण की सीमाएं हैं: उन्होंने एक छोटे AI मॉडल को उदाहरण दिखाकर "सिखाने" की कोशिश की। मॉडल सीधे आदेशों का पालन करने में बहुत बेहतर हो गया (जैसे "कप उठाओ")। लेकिन यह समझने में कि कब मदद मांगनी है, इसमें बहुत कम सुधार हुआ। उसने यह तो सीख लिया कि क्या करना है, लेकिन यह नहीं सीखा कि अपनी रणनीति कब बदलनी है।

मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि केवल AI मॉडल को बड़ा बनाना या उन्हें अधिक डेटा पर प्रशिक्षित करना उन्हें वास्तव में "एम्बॉडीड" (भौतिक दुनिया के साथ इंटरैक्ट करने में सक्षम) बनाने के लिए पर्याप्त नहीं है।

एक ऐसा रोबोट बनाने के लिए जो वास्तव में आपके बिखरे हुए घर में मदद कर सके, हमें इसे वास्तविकता में अपने कार्यों को ग्राउंड (ground) करना सिखाना होगा। इसे यह सीखना होगा कि दुनिया के नियम (गुरुत्वाकर्षण, वजन, उपकरण की आवश्यकता) हैं जो निर्देश पुस्तिका में नहीं लिखे हैं, बल्कि पर्यावरण के भीतर छिपे हुए हैं। जब तक AI यह नहीं कर पाता, वह एक शानदार वक्ता तो रहेगा लेकिन वास्तव में काम करने में बेहद खराब।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →