← नवीनतम पेपर
💻 computer science

Say the Mission, Execute the Swarm: Agent-Enhanced LLM Reasoning in the Web-of-Drones

यह शोध पत्र एक एजेंट-संवर्धित (agent-enhanced) LLM फ्रेमवर्क प्रस्तावित करता है जो UAV स्वॉर्म्स के प्राकृतिक भाषा नियंत्रण को सक्षम करने के लिए W3C वेब ऑफ थिंग्स मानकों और मॉडल कॉन्टेक्स्ट प्रोटोकॉल का लाभ उठाता है, यह प्रदर्शित करते हुए कि जबकि वर्तमान LLMs बिना ग्राउंडिंग के विश्वसनीय निष्पादन में संघर्ष करते हैं, कार्य-विशिष्ट उपकरण और रनटाइम गार्डरेल्स मजबूती में महत्वपूर्ण सुधार करते हैं।

मूल लेखक: Andrea Iannoli, Lorenzo Gigli, Luca Sciullo, Angelo Trotta, Marco Di Felice

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andrea Iannoli, Lorenzo Gigli, Luca Sciullo, Angelo Trotta, Marco Di Felice

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास ड्रोन का एक झुंड है, और उन्हें ठीक से क्या करना है यह बताने के लिए जटिल कंप्यूटर कोड लिखने के बजाय, आप बस उनसे सामान्य अंग्रेजी में बात करते हैं: "उस खेत को कवर करो," या "आसमान में एक सितारा आकार बनाओ।"

यह शोध पत्र एक ऐसा सिस्टम बनाने के बारे में है जो उस बातचीत को संभव बनाता है, लेकिन एक महत्वपूर्ण मोड़ के साथ: यह सुनिश्चित करता है कि ड्रोन वास्तव में आपकी बात सुनें, समझें और एक-दूसरे से टकराए बिना सुरक्षित रहें।

इसे करने का तरीका यहाँ दिया गया, सरल उपमाओं (analogies) का उपयोग करते हुए:

समस्या: "प्रतिभाशाली लेकिन अनभिज्ञ" पायलट

शोधकर्ताओं ने ड्रोन झुंडों के लिए "मस्तिष्क" के रूप में लार्ज लैंग्वेज मॉडल्स (LLMs)—वही तरह के AI जो चैटबॉट्स को शक्ति देते हैं—का उपयोग करने की कोशिश की।

  • अच्छी खबर: ये AI मानवीय भाषा समझने में बहुत अच्छे हैं। यदि आप कहते हैं "उत्तर की ओर जाओ," तो वे इसे समझ जाते हैं।
  • बुरी खबर: जब आप एक AI को वास्तविक मशीनों को नियंत्रित करने के लिए कहते हैं, तो वह अक्सर भ्रमित हो जाता है। वह कल्पना कर सकता है (चीजें बना सकता है), भूल सकता है कि ड्रोन कहाँ हैं, या ऐसे आदेश दे सकता है जिन्हें ड्रोन नहीं समझ पाते। यह एक विमान उड़ाने के लिए एक प्रतिभाशाली दार्शनिक को काम पर रखने जैसा है; वे उड़ान के सिद्धांत जानते हैं, लेकिन शायद उन्हें यह नहीं पता कि इस विशिष्ट विमान के विशिष्ट बटन कैसे दबाने हैं।

समाधान: "अनुवादक" और "सुरक्षा गार्ड"

इसे ठीक करने के लिए, टीम ने एक तीन-भागों वाला सिस्टम बनाया है जो मानवीय आवाज और ड्रोन की कार्यप्रणाली के बीच एक सेतु (bridge) के रूप में कार्य करता है।

1. सार्वभौमिक अनुवादक (The Web of Things)
कल्पना कीजिए कि हर ड्रोन, सेंसर और बैटरी एक अनूठा गैजेट है जिसका अपना अजीब रिमोट कंट्रोल है। शोधकर्ताओं ने W3C Web of Things (WoT) नामक एक मानक का उपयोग किया।

  • उपमा: AI को DJI ड्रोन, एक Parrot ड्रोन और एक कस्टम-निर्मित ड्रोन के लिए विशिष्ट रिमोट सीखने की आवश्यकता है, इसके बजाय वे सभी एक ही "यूनिफॉर्म" पहनते हैं। AI उन सभी को मानक "चीजों" (Things) के रूप में देखता है जिनमें मानक बटन होते हैं (जैसे "टेक ऑफ," "यहाँ आएं," "बैटरी जांचें")। यह AI को प्रत्येक के लिए कस्टम मैनुअल की आवश्यकता के बिना किसी भी ड्रोन से बात करने की अनुमति देता है।

2. व्याख्या करने वाला (The MCP Gateway)
AI केवल आदेश नहीं चिल्लाता; यह एक मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) का उपयोग करता है।

  • उपमा: इसे अदालत में एक सख्त व्याख्याकार (interpreter) के रूप में सोचें। AI (वकील) एक अनुरोध करता है। व्याख्याकार जांचता है कि क्या अनुरोध वैध है, इसे उस भाषा में अनुवादित करता है जिसे ड्रोन समझते हैं, और फिर सटीक रूप से रिपोर्ट करता है कि क्या हुआ। AI सीधे ड्रोन से बात नहीं करता है; वह हमेशा इस व्याख्याकार के माध्यम से जाता है।

3. सुरक्षा गार्ड (The Agent Core)
यह सबसे महत्वपूर्ण हिस्सा है। AI को "सुरक्षा घेरे" (guardrails) दिए जाते हैं।

  • उपमा: कल्पना कीजिए कि एक उड़ान प्रशिक्षक (flight instructor) AI पायलट के बगल में बैठा है। यदि AI कुछ खतरनाक करने की कोशिश करता है (जैसे दो ड्रोनों को एक ही स्थान पर टकराना) या अंत में उन्हें लैंड करना भूल जाता है, तो प्रशिक्षक तुरंत हस्तक्षेप करता है, कहता है "रुको! यह असुरक्षित है," और AI को अपनी योजना पर फिर से विचार करने के लिए मजबूर करता है। AI इसे ठीक करने के लिए कोड नहीं लिखता है; प्रशिक्षक बस AI की सोचने की प्रक्रिया को वापस सही रास्ते पर धकेलता है।

प्रयोग: परीक्षण के लिए तैयार करना

टीम ने 10 ड्रोनों के साथ एक कंप्यूटर सिमुलेशन में इस सिस्टम का परीक्षण किया। उन्होंने छह अलग-अलग "स्मार्ट" AI (OpenAI, DeepSeek और अन्य के मॉडल सहित) को चार अलग-अलग मिशन करने के लिए कहा:

  1. खेत को कवर करना: तस्वीरें लेने के लिए एक बड़े क्षेत्र के ऊपर उड़ना।
  2. फॉर्मेशन (आकृतियाँ): ड्रोनों को एक सितारा आकार में व्यवस्थित होने के लिए कहना।
  3. स्मार्ट खेती: नमी और तापमान की जांच करने के लिए सेंसरों तक उड़ना, और फिर निर्णय लेना कि क्या फसलों को पानी की आवश्यकता है।

उन्होंने क्या पाया:

  • AI अकेला संघर्ष करता है: जब AI को बिना किसी मदद के (स्वयं) खेत को कवर करने का तरीका सोचना पड़ता था, तो वह अक्सर विफल हो जाता था या अटक जाता था।
  • टूल्स मदद करते हैं: जब शोधकर्ताओं ने AI को एक "प्लानिंग टूल" (एक सहायक जो सबसे अच्छा रास्ता कैलकुलेट करता है) दिया, तो सफलता दर आसमान छू गई। यह AI को पूरे शहर को याद करने के लिए कहने के बजाय उसे GPS मैप देने जैसा है।
  • आकार मायने रखता है (लेकिन केवल दिमाग से नहीं): सबसे बड़े, सबसे शक्तिशाली AI मॉडल हमेशा नहीं जीते। कभी-कभी, बेहतर "गार्डरेल्स" और टूल्स के साथ थोड़ा छोटा मॉडल बेहतर और सुरक्षित प्रदर्शन करता है।
  • लागत बनाम गुणवत्ता: उन्होंने ट्रैक किया कि AI ने कितने "कंप्यूटिंग पावर" (टोकन) का उपयोग किया। उन्होंने पाया कि केवल इसलिए कि एक AI बहुत अधिक बातें करता है (कई टोकन का उपयोग करता है), इसका मतलब यह नहीं है कि वह बेहतर काम करता है। एक बातूनी AI अभी भी मिशन को क्रैश कर सकता है।

मुख्य निष्कर्ष (The Bottom Line)

पेपर यह निष्कर्ष निकालता है कि जबकि AI स्मार्ट हो रहा है, हम इसे ड्रोनों के साथ बेकाबू नहीं छोड़ सकते। इसे वास्तविक दुनिया में काम करने के लिए, हमें एक संरचित प्रणाली की आवश्यकता है:

  1. ड्रोन कैसे बात करते हैं, इसे मानकीकृत करें (ताकि AI भ्रमित न हो)।
  2. AI को योजना बनाने के लिए टूल्स दें (ताकि उसे अनुमान न लगाना पड़े)।
  3. सुरक्षा गार्ड को लूप में रखें (गलतियों को होने से पहले पकड़ने के लिए)।

लक्ष्य मानव पायलटों को AI कोड से बदलना नहीं है, बल्कि एक ऐसा सिस्टम बनाना है जहाँ आप बस मिशन बता सकें, और AI, इन सुरक्षा नेटों और अनुवादकों द्वारा निर्देशित होकर, झुंड का संचालन सुरक्षित और विश्वसनीय रूप से कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →