GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention
यह शोधपत्र GRAMformer प्रस्तुत करता है, जो एक नवीन मल्टीमॉडल ट्रांसफॉर्मर आर्किटेक्चर है जो क्वेरी और की (key) वेक्टर्स के संयुक्त ज्यामितीय आयतन (joint geometric volume) के आधार पर अटेंशन स्कोर की गणना करके किसी भी क्रम की मोडैलिटी इंटरैक्शन को कुशलतापूर्वक मॉडल करने के लिए वॉल्यूमेट्रिक मल्टीमॉडल क्रॉस-अटेंशन (VMA) का उपयोग करता है, जिससे मौजूदा पेयरवाइज या कन्सटेनेटेड दृष्टिकोणों की सीमाओं को दूर किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप तीन दोस्तों द्वारा एक साथ सुनाई जा रही एक जटिल कहानी को समझने की कोशिश कर रहे हैं: एक बोल रहा है, एक वीडियो दिखा रहा है, और एक संगीत बजा रहा है।
पुराना तरीका: "आमने-सामने" का इंटरव्यू
वर्तमान AI मॉडल (जैसे आज के अधिकांश स्मार्टफोन में मौजूद हैं) इस कहानी को समझने के लिए प्रत्येक दोस्त का अलग-अलग इंटरव्यू लेने की कोशिश करते हैं।
- पहले, AI वक्ता से पूछता है, "संगीत के बारे में आपका क्या विचार है?"
- फिर, AI वक्ता से पूछता है, "वीडियो के बारे में आपका क्या विचार है?"
- अंत में, AI वक्ता से पूछता है, "वीडियो और संगीत दोनों के बारे में आपका क्या विचार है?"
समस्या यह है कि AI संगीत और वीडियो के साथ ऐसे व्यवहार करता है जैसे वे अजनबी हों। वह यह कभी नहीं पूछता कि, "संगीत और वीडियो मिलकर वक्ता की बात के अर्थ को कैसे बदल देते हैं?" वह उस जादू को मिस कर देता है जो तब होता है जब तीनों तत्व ठीक उसी क्षण एक साथ जुड़ते हैं। इसके अलावा, यदि आप एक चौथा दोस्त (जैसे तापमान सेंसर) जोड़ते हैं, तो AI को और भी अधिक अलग-अलग इंटरव्यू करने पड़ते हैं, जिससे वह धीमा हो जाता है और उसे अधिक मेमोरी की आवश्यकता होती है, जैसे कोई मैनेजर बढ़ते हुए टीम के लिए एक-एक करके मीटिंग शेड्यूल करने की कोशिश कर रहा हो।
नया तरीका: "ग्रुप हडल" (GRAMformer)
इस पेपर के लेखकों, जियर्डानो सिचेट्टी (Giordano Cicchetti) और उनकी टीम ने एक नया सिस्टम बनाया है जिसे GRAMformer कहा जाता है। अलग-अलग इंटरव्यू करने के बजाय, उन्होंने एक "ग्रुप हडल" (समूह चर्चा) तंत्र बनाया है जिसे वोल्यूमेट्रिक मल्टीमॉडल क्रॉस-अटेंशन (VMA) कहा जाता है।
यह कैसे काम करता है, इसे एक सरल उदाहरण से समझते हैं:
1. बातचीत का "आकार"
कल्पना कीजिए कि वक्ता, वीडियो और ऑडियो अंतरिक्ष में तैरती हुई तीन छड़ियों की तरह हैं।
- पुराना AI: केवल यह मापता है कि वक्ता वीडियो के कितने करीब है, और वक्ता ऑडियो के कितने करीब है। यह उस आकार को अनदेखा कर देता है जो तीनों छड़ियों के मिलने से बनता है।
- GRAMformer: यह उस 3D आकार (वॉल्यूम/आयतन) को देखता है जो तीनों छड़ियों को आपस में जोड़ने पर बनता है।
- यदि छड़ें सभी एक ही दिशा में इशारा कर रही हैं (संरेखित), तो आकार सपाट होता है और इसका वॉल्यूम लगभग शून्य होता है।
- यदि छड़ें अलग-अलग दिशाओं में इशारा कर रही हैं लेकिन फिर भी एक सुसंगत संरचना बनाती हैं, तो आकार का एक विशिष्ट वॉल्यूम होता है।
- AI इस "वॉल्यूम" का उपयोग एक स्कोर के रूप में करता है। वह पूछता है: "क्या ये तीन सूचना के टुकड़े मिलकर एक ठोस, सार्थक आकार बनाते हैं?"
यह AI को तीनों (या अधिक) दोस्तों के बीच के संयुक्त संबंध को एक साथ तुरंत समझने की अनुमति देता है, बजाय इसके कि वह केवल जोड़ों (pairs) के आधार पर अनुमान लगाए।
2. यह स्मार्ट और हल्का क्यों है?
- "क्वाड्रेटिक" अराजकता का अंत: पुराने तरीके में, यदि आप एक नया दोस्त जोड़ते हैं, तो AI को दोगुना काम करना पड़ता है। यह ऐसा है जैसे किसी पार्टी में एक नया व्यक्ति आए और अचानक आपको हर जोड़े के लिए मीटिंग शेड्यूल करने की आवश्यकता हो।
- GRAMformer का समाधान: क्योंकि यह एक साथ पूरे "ग्रुप वॉल्यूम" को देखता है, इसलिए अधिक दोस्तों को जोड़ने से गणितीय गणना विस्फोट नहीं करती है। यह कुशल रहता है, जैसे एक ग्रुप चैट जहाँ हर कोई एक साथ बोलता है, न कि एक फोन ट्री जहाँ आप हर किसी को व्यक्तिगत रूप से कॉल करते हैं।
3. उन्होंने क्या परीक्षण किया?
टीम ने इस नए "ग्रुप हडल" सिस्टम का परीक्षण उन कार्यों पर किया जहाँ कंप्यूटर को मानवीय भावनाओं और क्रियाओं को समझने की आवश्यकता होती है। उन्होंने निम्नलिखित डेटासेट्स का उपयोग किया:
- सेंटिमेंट एनालिसिस (भावना विश्लेषण): टेक्स्ट, आवाज और चेहरे के भावों को एक साथ देखकर यह निर्धारित करना कि कोई वीडियो क्लिप खुश है, दुखी है या क्रोधित है।
- हास्य और व्यंग्य (Humor and Sarcasm): यह पता लगाना कि कोई मजाक वास्तव में मजेदार है या व्यंग्यात्मक।
- रोबोटिक्स: रोबोट को विजुअल डेटा के साथ फोर्स और टच सेंसर समझने में मदद करना।
परिणाम:
इन परीक्षणों में, GRAMformer पुराने सिस्टम की तुलना में "ग्रुप वाइब" (समूह के माहौल) को बेहतर ढंग से समझने में सक्षम रहा। इसने भावनाओं और व्यंग्य का अनुमान लगाने में उच्च स्कोर प्राप्त किया, और इसने यह काम उन भारी, जटिल मॉडलों की तुलना में कम कंप्यूटर मेमोरी और कम पैरामीटर्स (कम "मस्तिष्क शक्ति") का उपयोग करके किया जिनसे इसकी तुलना की गई थी।
सारांश
पुराने AI को एक ऐसे जासूस के रूप में सोचें जो संदिग्धों का एक-एक करके इंटरव्यू लेता है और सच का अनुमान लगाने की कोशिश करता है। GRAMformer एक ऐसे जासूस की तरह है जो सभी संदिग्धों को एक साथ एक कमरे में रखता है और यह देखने के लिए देखता है कि वे एक-दूसरे के साथ कैसे व्यवहार करते हैं ताकि तुरंत पूरी तस्वीर देखी जा सके। यह तेज़ है, हल्का है, और बहुत बेहतर है कि कैसे सूचना के विभिन्न हिस्से एक टीम के रूप में एक साथ काम करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।