← नवीनतम पेपर
💻 computer science

IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models

यह शोधपत्र IntentVLM को प्रस्तुत करता है, जो फॉरवर्ड-इनवर्स मॉडलिंग से प्रेरित एक नवीन दो-चरणीय वीडियो-भाषा ढांचा है, जो कार्य को लक्ष्य उम्मीदवार पीढ़ी और संरचित चयन में विभाजित करके ओपन-वोकेबुलरी मानव इरादा पहचान (human intention recognition) में अत्याधुनिक परिणाम प्राप्त करता है, जिससे मतिभ्रम (hallucinations) में उल्लेखनीय कमी आती है और मानव प्रदर्शन के समान स्तर तक पहुँचता है।

मूल लेखक: Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides, Olivier Sigaud, Mohamed Chetouani

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides, Olivier Sigaud, Mohamed Chetouani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रसोई में अपने एक दोस्त को देख रहे हैं। आप देखते हैं कि वे फ्रिज खोलते हैं, दूध का एक कार्टन निकालते हैं, और फिर कॉफी मशीन की ओर बढ़ते हैं।

एक मानक रोबोट केवल यह कह सकता है, "व्यक्ति दूध पकड़े हुए है" या "व्यक्ति कॉफी के पास है।" लेकिन एक वास्तव में सहायक रोबोट को यह समझने की आवश्यकता है कि वे ऐसा क्यों कर रहे हैं। क्या वे कॉफी बना रहे हैं? क्या वे बस यह देख रहे हैं कि दूध वहां है या नहीं? या क्या वे किसी मेहमान के लिए एक कप में दूध डालने वाले हैं?

यह शोध पत्र IntentVLM को पेश करता है, जो रोबोट के लिए बनाया गया एक नया प्रकार का "मस्तिष्क" है जिसे ठीक इसी समस्या को हल करने के लिए डिज़ाइन किया गया है। यह रोबोट को यह समझने में मदद करता है कि इंसान क्या योजना बना रहा है, भले ही रोबोट को संभावित उत्तरों की कोई विशिष्ट सूची न सिखाई गई हो।

यह कैसे काम करता है, इसे सरल उपमाओं का उपयोग करके समझें:

समस्या: "बहुविकल्पीय" जाल (The "Multiple Choice" Trap)

अधिकांश वर्तमान रोबोट एक ऐसे छात्र की तरह हैं जो बहुविकल्पीय परीक्षा दे रहे हैं जहाँ शिक्षक उन्हें चुनने के लिए केवल पाँच विकल्प देता है। यदि उत्तर उस सूची में नहीं है, तो रोबोट अटक जाता है या गलत अनुमान लगा लेता है।

  • पुराना तरीका: रोबोट दूध और कॉफी देखता है और उसे एक निश्चित सूची में से चुनना होता है जैसे: "A) कॉफी बनाना, B) चाय बनाना, C) सफाई करना।" यदि व्यक्ति वास्तव में "हॉट चॉकलेट" बना रहा है, तो रोबोट विफल हो सकता है क्योंकि वह विकल्प सूची में नहीं था।
  • नया तरीका (IntentVLM): रोबोट खुले विचारों वाली अवधारणाओं को समझ सकता है। इसे पहले से लिखी गई सूची की आवश्यकता नहीं है। यह अपने आप "हॉट चॉकलेट बनाना" समझ सकता है।

समाधान: दो-चरणीय जासूसी प्रक्रिया (A Two-Step Detective Process)

लेखकों ने मानव मस्तिष्क के काम करने के तरीके से प्रेरणा ली है। वे इसे "फॉरवर्ड-इनवर्स मॉडलिंग" (Forward-Inverse Modeling) कहते हैं। इसे एक जासूस की तरह दो चरणों में रहस्य सुलझाने के रूप में सोचें:

चरण 1: "क्या होगा अगर?" जनरेटर (फॉरवर्ड मॉडल)
तुरंत उत्तर का अनुमान लगाने के बजाय, रोबोट पहले एक विचार-मंथन सत्र की तरह कार्य करता है। यह वीडियो को देखता है और पूछता है, "इस व्यक्ति के यह करने के पीछे क्या-क्या संभावित कारण हो सकते हैं?"

  • उपमा: कल्पना कीजिए कि एक जासूस संदिग्धों की सूची बना रहा है। "शायद वे कॉफी बना रहे हैं। शायद वे चाय के लिए दूध गर्म कर रहे हैं। शायद वे केवल समाप्ति तिथि (expiration date) की जांच कर रहे हैं।"
  • रोबोट जो कुछ भी देख रहा है उसके आधार पर इन "उम्मीदवार विचारों" की एक संक्षिप्त सूची तैयार करता है।

चरण 2: "सबसे सटीक" निर्णायक (इनवर्स मॉडल)
एक बार जब रोबोट के पास संभावनाओं की एक सूची होती है, तो वह एक सख्त न्यायाधीश की तरह कार्य करता है। वह वीडियो को फिर से देखता है और पूछता है, "इनमें से कौन सा विचार साक्ष्यों के साथ सबसे अच्छी तरह फिट बैठता है?"

  • उपमा: जासूस सुरागों को देखता है (व्यक्ति ने चाय के कप के बजाय मग पकड़ा है) और कहता है, "'चाय बनाना' वाला विचार फिट नहीं बैठता। 'तारीख की जांच करना' फिट नहीं बैठता। 'कॉफी बनाना' पूरी तरह से फिट बैठता है।"
  • रोबोट अपनी ही सूची में से सबसे अच्छा मिलान चुनता है।

यह क्यों विशेष है

  1. यह "भ्रम" (Hallucinations) को कम करता है: कभी-कभी AI चीजें बना लेता है (hallucinations)। पहले संभावनाओं को सूचीबद्ध करने और फिर सबसे अच्छे को चुनने के लिए मजबूर करके, यह रोबोट को केवल जंगली अनुमान लगाने से रोकता है। यह एक छात्र से अंतिम उत्तर देने से पहले अपना काम दिखाने के लिए कहने जैसा है।
  2. यह खुले विचारों वाला है: क्योंकि रोबोट विचारों की अपनी सूची स्वयं बनाता है, इसलिए यह एक छोटी शब्दावली तक सीमित नहीं है। यह उन जटिल, अद्वितीय इरादों को समझ सकता है जो एक इंसान का हो सकते हैं।
  3. यह कुशल है: शोधकर्ताओं ने रोबोट को सिखाने के लिए एक "स्मार्ट शॉर्टकट" (जिसे LoRA कहा जाता है) का उपयोग किया। यह रोबोट को नया कौशल सीखने के लिए एक विशेष नोटबुक देने जैसा है बिना उसके पूरे मस्तिष्क को फिर से लिखे। यह रोबोट को तेज़ रखता है और यह सुनिश्चित करता है कि वह अन्य चीजें (जैसे वस्तुओं को पहचानना) करने की क्षमता न भूल जाए।

परिणाम

टीम ने इस रोबोट मस्तिष्क का परीक्षण दो अलग-अलग चुनौतियों पर किया:

  • IntentQA: एक परीक्षण जहाँ रोबोट को वीडियो में लोग क्या करने की कोशिश कर रहे थे, इसके बारे में सवालों के जवाब देने थे।
  • Inst-IT Bench: यह देखने के लिए एक परीक्षण कि क्या इरादे समझने के बाद भी रोबोट वस्तुओं और दृश्यों को पहचान सकता है।

परिणाम:

  • नए रोबोट ने लगभग 80% सटीकता प्राप्त की, जो कि एक बड़ी छलांग है (पिछले तरीकों की तुलना में लगभग 30% बेहतर)।
  • इसने इन परीक्षणों में इंसानों के समान प्रदर्शन किया।
  • महत्वपूर्ण रूप से, इरादों को समझने के सीखने से रोबोट की वस्तुओं को देखने या दृश्य को समझने की सामान्य क्षमता कम नहीं हुई। इसने अपने सामान्य ज्ञान को बरकरार रखा।

सारांश में

IntentVLM एक ऐसी प्रणाली है जो रोबोट को एक जासूस की तरह सोचना सिखाती है: पहले, किसी क्रिया के सभी संभावित कारणों की कल्पना करें, और फिर, सबसे तार्किक एक को चुनने के लिए साक्ष्यों का उपयोग करें। यह रोबोट को मानवीय लक्ष्यों को लचीले, स्वाभाविक तरीके से समझने की अनुमति देता है, जिससे वे रोजमर्रा के कार्यों के लिए बहुत बेहतर साथी बन जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →