← नवीनतम पेपर
🤖 AI

From Modalities to Propositions: A Language-Centric Framework for Multimodal Intelligence

यह शोध पत्र एक भाषा-केंद्रित ढांचे को प्रस्तुत करता है जो एक वैश्विक अर्थ संबंधी कोडबुक (global semantic codebook) के माध्यम से विविध बहुविध डेटा (multimodal data) को परमाणु प्रस्थापनाओं (atomic propositions) के एक व्याख्या योग्य स्थान में एकीकृत करता है, जिससे स्वायत्त ड्राइविंग जैसे अनुप्रयोगों के लिए उन्नत तर्क, क्रॉस-मोडल रिट्रीवल और जटिल संयोजन सक्षम होता है।

मूल लेखक: Nadine Chang, Maying Shen, Shizhe Diao, Jialiang Wang, Jingde Chen, Thomas Breuel, Pavlo Molchanov, Rafid Mahmood, Jose M. Alvarez

प्रकाशित 2026-07-21
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nadine Chang, Maying Shen, Shizhe Diao, Jialiang Wang, Jingde Chen, Thomas Breuel, Pavlo Molchanov, Rafid Mahmood, Jose M. Alvarez

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझना सिखाने की कोशिश कर रहे हैं। लंबे समय से, वैज्ञानिक इन रोबोटों को लाखों तस्वीरें और वीडियो दिखाकर सिखाते रहे हैं, इस उम्मीद में कि रोबोट अपने आप पैटर्न को "सीख" लेगा। यह एक छात्र को किताबों का पुस्तकालय देने जैसा है, लेकिन उसे कभी शब्द पढ़ने नहीं देने, केवल उससे कवर आर्ट के आधार पर कहानी का अनुमान लगाने के लिए कहना। रोबोट अपने दिमाग में एक विशाल, अदृश्य मानचित्र बनाता है जहाँ समान चीजें एक-दूसरे के करीब होती हैं, लेकिन यह मानचित्र उन इंसानों के लिए भी एक रहस्य है जिन्होंने इसे बनाया है। हम जानते हैं कि यह काम करता है, लेकिन हम यह नहीं जानते कि यह क्यों काम करता है, और यदि रोबोट कोई गलती करता है, तो हम आसानी से यह नहीं देख सकते कि मानचित्र का कौन सा हिस्सा गलत हुआ।

इसे ठीक करने के लिए, शोधकर्ता एक ऐसा तरीका खोज रहे हैं जिससे रोबोट की सोच इंसानों के बात करने के तरीके जैसी हो सके। केवल अस्पष्ट भावनाओं या धुंधली तस्वीरों के बजाय, वे चाहते हैं कि रोबोट स्पष्ट, सरल वाक्यों का उपयोग करे—जैसे "कार लाल है" या "लाइट हरी है।" यह शोध पत्र इस बातचीत में कदम रखता है, और पूछता है: क्या होगा अगर हम रोबोट को रहस्यमय, अदृश्य मानचित्रों के माध्यम से दुनिया को समझने के लिए मजबूर करना छोड़ दें, और इसके बजाय उन्हें सरल तथ्यों का एक साझा शब्दकोश दे दें? लक्ष्य दुनिया की जटिल छवियों और वीडियो को सरल कथनों की एक साफ सूची में बदलना है जिसे कोई भी (या कोई भी मशीन) पढ़, जांच और जोड़ सके।


रहस्यमय मानचित्रों से एक साझा शब्दकोश तक

कल्पना कीजिए कि आप अपने एक दोस्त को एक अस्त-व्यस्त सड़क के दृश्य का वर्णन कर रहे हैं। आप कह सकते हैं, "वाह, देखो वह बड़ा लाल ट्रक गीली फुटपाथ के पास से कितनी तेजी से गुजरा जबकि एक कुत्ता बॉल का पीछा कर रहा है!" वह वाक्य विवरणों से भरा है, लेकिन वह थोड़ा अव्यवस्थित भी है। यदि आप हर उस वीडियो को खोजना चाहते जहाँ एक कुत्ता बॉल का पीछा कर रहा है, तो उस पूरे वाक्य को खोजना कठिन होगा क्योंकि कुत्ता शायद फ्रिसबी का पीछा कर रहा हो, या ट्रक नीला हो सकता है, या फुटपाथ सूखा हो सकता है।

NVIDIA में काम करने वाले इस शोध पत्र के लेखक इन विवरणों को व्यवस्थित करने का एक नया तरीका प्रस्तावित करते हैं। वे इसे Bag of Atomic Propositions (BoAP) कहते हैं। "प्रपोजिशन" (प्रस्तावों) को कहानी के सबसे छोटे, सबसे बुनियादी निर्माण खंडों के रूप में सोचें—सरल, सत्य कथन जैसे "कुत्ता बॉल का पीछा कर रहा है," "ट्रक लाल है," या "फुटपाथ गीला है।"

रोबोट को पूरे अव्यवस्थित वाक्य को अपने मस्तिष्क के एक छिपे हुए, भ्रमित करने वाले हिस्से में रखने देने के बजाय, यह ढांचा हर छवि, वीडियो या टेक्स्ट लॉग को इन सरल तथ्यों के एक "बैग" (थैले) में तोड़ देता है। यह एक जटिल LEGO महल को लेकर उसके सभी ईंटों को अलग-अलग करने जैसा है, जैसे लाल ईंटों को, नीली ईंटों को और पहियों को अलग करना। एक बार जब ईंटों को छाँट लिया जाता है, तो आप आसानी से हर एक लाल ईंट, या हर पहिये को ढूंढ सकते हैं, चाहे वह किसी भी महल से आया हो।

जादुई शब्दकोश (द कोडबुक)

यहाँ पेचीदा हिस्सा यह है: लोग (और रोबोट) एक ही बात को अलग-अलग तरीकों से कहते हैं। एक व्यक्ति कह सकता है "एक कार रुकी हुई है," जबकि दूसरा कह सकता है "वाहन प्रतीक्षा कर रहा है।" कंप्यूटर के लिए, ये पूरी तरह से अलग चीजें दिखती हैं। यदि आप इसे ठीक नहीं करते हैं, तो आपका "तथ्यों का बैग" अव्यवस्थित और डुप्लिकेट्स से भर जाएगा।

इसे हल करने के लिए, टीम ने एक Global Semantic Codebook बनाया है। एक विशाल, मास्टर डिक्शनरी की कल्पना करें जहाँ "कार रुकी हुई है" कहने के हर संभव तरीके को एक एकल, आधिकारिक प्रविष्टि (entry) में मैप किया गया है: "वाहन प्रतीक्षा कर रहा है।"

यह प्रक्रिया इस प्रकार काम करती है:

  1. निष्कर्षण (Extraction): एक अत्यंत बुद्धिमान AI (जिसे मल्टीमॉडल लार्ज लैंग्वेज मॉडल कहा जाता है) एक वीडियो या छवि को देखता है और जो कुछ भी हो रहा है उसका वर्णन करने वाले सरल वाक्यों की एक सूची लिखता है।
  2. सफाई (Cleaning): AI उन "अनावश्यक" विवरणों को हटा देता है जो बड़े चित्र के लिए महत्वपूर्ण नहीं हैं, जैसे कि कार का विशिष्ट ब्रांड या नीले रंग का सटीक शेड, जब तक कि वे कार्य के लिए महत्वपूर्ण न हों।
  3. मिलान (Matching): AI अपने द्वारा लिखे गए प्रत्येक वाक्य की जांच मास्टर डिक्शनरी के साथ करता है। यदि उसे कोई मिलान मिलता है, तो वह उस अव्यवस्थित वाक्य को साफ, आधिकारिक संस्करण से बदल देता है।

अब, दुनिया का हर वीडियो, चाहे वह टोक्यो में चलती सेल्फ-ड्राइविंग कार हो या ब्राजील के जंगल में उड़ता हुआ ड्रोन, सरल, मानक तथ्यों की एक ही भाषा में अनुवादित हो जाता है।

यह एक बड़ी बात क्यों है

यह शोध पत्र दिखाता है कि यह विधि उन तीन चीजों को करती है जिनमें पुराने "रहस्यमय मानचित्र" वाले तरीके संघर्ष करते हैं:

1. यह खोज को बेहद सटीक बनाता है
यदि आप एक ऐसा वीडियो खोजना चाहते जहाँ "पैदल यात्री सड़क पार कर रहा है" AND "लाइट लाल है" AND "सड़क गीली है," तो पुराने तरीके भ्रमित हो जाते हैं। वे ऐसे वीडियो पा सकते हैं जहाँ लाइट लाल है लेकिन सड़क सूखी है, या जहाँ पैदल यात्री पार कर रहा है लेकिन लाइट हरी है। क्योंकि नया सिस्टम चीजों को अलग-अलग तथ्यों में तोड़ देता है, इसलिए यह उन्हें पूरी तरह से मिला और मिला सकता है। यह लाइब्रेरी में पूरी किताब के शीर्षक का अनुमान लगाने के बजाय विशिष्ट टैग्स को चेक करके खोजने जैसा है। शोध पत्र ड्राइविंग वीडियो और ओपन-वर्ल्ड फुटेज के विशाल डेटासेट में दुर्लभ, जटिल परिदृश्यों को सफलतापूर्वक खोजकर इसे प्रदर्शित करता है।

2. यह उजागर करता है कि रोबोट क्या नहीं जानता
यह शायद सबसे शक्तिशाली हिस्सा है। क्योंकि सब कुछ सरल तथ्यों में लिखा गया है, आप उन्हें गिन सकते हैं। आप अपने प्रशिक्षण डेटा (वे वीडियो जिनसे रोबोट ने सीखा है) को देख सकते हैं और देख सकते हैं कि कौन से तथ्य गायब हैं।
उदाहरण के लिए, पेपर ने ड्राइविंग वीडियो के एक डेटासेट का विश्लेषण किया और पाया कि जबकि रोबोट ने "कार के बाएं मुड़ने" के लाखों उदाहरण देखे थे, उसने लगभग कभी नहीं देखा कि "एक कार बाएं मुड़ रही है जबकि बारिश हो रही है और एक पैदल यात्री सड़क पार कर रहा है।" पुराने तरीके बस कहेंगे, "हे, यह एक दुर्लभ कार टर्न है," लेकिन यह नया तरीका कहता है, "हे, आपके पास बारिश, मुड़ने और पैदल यात्रियों का संयोजन (combination) नहीं है।" यह वैज्ञानिकों को यह जानने में मदद करता है कि रोबोट को सुरक्षित बनाने के लिए किस प्रकार के नए डेटा को एकत्र करना चाहिए।

3. यह विभिन्न दुनियाओं को जोड़ता है
चूंकि सिस्टम सब कुछ एक ही सरल भाषा में अनुवादित करता है, इसलिए यह मौसम रिपोर्ट के टेक्स्ट लॉग या स्ट्रीट साइन की तस्वीर के साथ एक कार के वीडियो की तुलना कर सकता है। वे सभी एक ही "तथ्यों के बैग" में आ जाते हैं। यह रोब ביותר को यह समझने की अनुमति देता है कि "गीली सड़क" के टेक्स्ट विवरण का मतलब वही है जो एक गीली सड़क दिखाने वाले वीडियो का है, भले ही एक टेक्स्ट हो और दूसरा चित्र।

निष्कर्ष

यह शोध पत्र यह दावा नहीं करता कि इसने AI की सभी समस्याओं को हल कर दिया है। इसके बजाय, यह जानकारी को व्यवस्थित करने का एक नया तरीका सुझाता है। यह तर्क देता है कि जबकि पुराने "रहस्यमय मानचित्र" (डेंस एम्बेडिंग्स) पैटर्न पहचानने में अच्छे हैं, वे इस बात को समझाने में खराब हैं कि क्यों कुछ हुआ या घटनाओं के विशिष्ट संयोजन को खोजने में।

दुनिया को Bag of Atomic Propositions में बदलकर, लेखक दिखाते हैं कि हम AI को अधिक पारदर्शी, खोजने में आसान और उन दुर्लभ, खतरनाक स्थितियों को पकड़ने में बेहतर बना सकते हैं जिन्हें उसने शायद छोड़ दिया हो। यह रोबोट को एक बिखरे हुए स्केचबुक के बजाय एक स्पष्ट, व्यवस्थित नोटबुक देने जैसा है, जिससे हम अंततः उसके दिमाग को पढ़ सकते हैं और समझ सकते हैं कि वह वास्तव में क्या देख रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →