Test-Time Computing for Referring Multimodal Large Language Models
यह शोध पत्र ControlMLLM++ का परिचय देता है, जो एक टेस्ट-टाइम अडैप्टेशन फ्रेमवर्क है जो बिना मॉडल रिट्रेनिंग या फाइन-ट्यूनिंग के, इन्फरेंस के दौरान सीखने योग्य विजुअल प्रॉम्प्ट्स को ऑप्टिमाइज़ करके फ्रोजन मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में सूक्ष्म क्षेत्र-आधारित विजुअल रीजनिंग को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान रोबोट (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल, या MLLM) है जो किसी तस्वीर को देख सकता है और उसका वर्णन कर सकता है। हालाँकि, इस रोबोट के साथ एक समस्या है: यह दुनिया को केवल व्यापक रूप में देखता है। यदि आप पूछते हैं, "इस तस्वीर में क्या है?" तो यह कह सकता है, "वहाँ एक कुत्ता, एक गेंद और एक पेड़ है।" लेकिन यदि आप कुत्ते की ओर इशारा करते हैं और पूछते हैं, "इस विशिष्ट कुत्ते के कॉलर का रंग क्या है?", तो रोबमा उलझन में पड़ सकता है। यह फिर से पूरी तस्वीर का वर्णन कर सकता है, या इससे भी बुरा, यह गलत रंग का अनुमान लगा सकता है क्योंकि यह इस बात पर बहुत अधिक निर्भर कर रहा है कि एक कुत्ते का कॉलर आमतौर पर कैसा होना चाहिए, बजाय इसके कि वह वास्तव में उस विशिष्ट कुत्ते को देखे जिसकी ओर आपने इशारा किया है।
परंपरागत रूप से, इसे ठीक करने के लिए, इंजीनियरों को रोबोट को खोलना पड़ता था, उसे "चीजों की ओर इशारा करने" के हजारों नए उदाहरणों के साथ फिर से प्रशिक्षित (retrain) करना पड़ता था, और यह उम्मीद करनी पड़ती थी कि वह अन्य चीजों के बारे में स्मार्ट होना नहीं भूलेगा। यह महंगा, धीमा है, और अक्सर इस प्रक्रिया में रोबोट वह सब कुछ भूल जाता है जो वह पहले से जानता था।
ControlMLLM++ से मिलिए: AI के लिए "जादुई हाइलाइटर"
यह पेपर एक चतुर नई तकनीक पेश करता है जिसे ControlMLLM++ कहा जाता है। रोबोट को फिर से प्रशिक्षित करने के बजाय, वे इसे एक "जादुई हाइलाइटर" देते हैं जो इसके सोचने के दौरान ही काम करता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. "घोस्ट" टोकन (द लर्नबल लेटेंट वेरिएबल)
कल्पना कीजिए कि रोबोट एक किताब पढ़ रहा है। आमतौर पर, वह केवल शब्दों को पढ़ता है। ControlMLLM++ चुपके से रोबोट के आंतरिक नोट्स में एक छोटा, अदृश्य "घोस्ट" (भूतिया) नोट जोड़ देता है। यह घोस्ट नोट एक लर्नबल वेरिएबल है। इसे एक स्टिकी नोट की तरह समझें जिसे रोबोट वास्तविक समय में इधर-उधर ले जा सकता है और उसका आकार बदल सकता है।
जब आप किसी विशेष भाग की ओर इशारा करते हैं (जैसे कि एक लाल टोपी), तो सिस्टम इस "घोस्ट नोट" को थोड़ा बदल देता है ताकि रोबोट का ध्यान शारीरिक रूप से उस लाल टोपी की ओर खिंचा चला जाए। यह बिल्कुल वैसा ही है जैसे रोबोट की आँखों को धीरे से उस दिशा में मोड़ना जहाँ आप चाहते हैं, बिना उसे वह सब कुछ भुलाए जो वह पहले से जानता है।
2. "एनर्जी मैग्नेट" (द एनर्जी फंक्शन)
सिस्टम को कैसे पता चलता है कि घोस्ट नोट को कैसे हिलाना है? यह एक एनर्जी फंक्शन नामक अवधारणा का उपयोग करता है।
कल्पना कीजिए कि रोबोट का ध्यान एक चुंबक की तरह है। सिस्टम आपके द्वारा इंगित किए गए क्षेत्र (रेफरिंग रीजन) के चारों ओर एक चुंबकीय क्षेत्र बनाता है। "घोस्ट नोट" एक धातु की गेंद है। सिस्टम गेंद को तब तक धकेलता है जब तक कि वह आपके विशिष्ट क्षेत्र से सबसे मजबूत चुंबकीय खिंचाव महसूस न करने लगे। एक बार जब गेंद वहां स्थिर हो जाती है, तो रोबोट का ध्यान स्वाभाविक रूप से उस स्थान की ओर बहने लगता है।
- हार्ड मैग्नेट (Hard Magnet): यदि आप किसी वस्तु के चारों ओर एक बॉक्स या मास्क बनाते हैं, तो चुंबक एक ठोस दीवार की तरह होता है।
- सॉफ्ट मैग्नेट (Soft Magnet): यदि आप केवल एक रेखा खींचते हैं या एक बिंदु रखते हैं, तो चुंबक एक कोमल ढाल (gradient) की तरह होता है, जो ध्यान को आपके निशान के करीब खींचता है।
3. "स्मार्ट नज़" (Optim++)
इस विचार के पहले संस्करण में, सिस्टम थोड़ा अनाड़ी था। इसने रोबोट के दिमाग के हर हिस्से को एक साथ धकेलने की कोशिश की, जो धीमा था और कभी-कभी रोबोट को भ्रमित कर देता था।
ControlMLLM++ अपग्रेड किया गया संस्करण है। इसने महसूस किया कि रोबोट को केवल उसके मस्तिष्क के विशिष्ट "मिडल लेयर्स" (मध्य परतों) में धकेलने की आवश्यकता है जहाँ वह शब्दों को छवियों से जोड़ता है। यह एक कोच की तरह है जो पहले पूरी टीम को निर्देश चिल्लाकर देता था, लेकिन अब केवल उन खिलाड़ियों को फुसफुसाकर निर्देश देता है जिन्हें उनकी आवश्यकता होती है। यह रोबोट को तेजी से और अधिक सटीक रूप से केंद्रित करता है।
4. "बायस बस्टर" (PromptDebias)
यहाँ पेचीदा हिस्सा है: रोबोट भाषा में अच्छे होते हैं लेकिन अपने स्वयं के पूर्वाग्रहों (biases) को अनदेखा करने में खराब होते हैं। यदि आप पूछते हैं, "इस बिल्ली में असामान्य क्या है?" और रोबोट सोचता है कि बिल्लियाँ आमतौर पर स्थिर बैठती हैं, तो वह भ्रमित होकर कुछ भी बना सकता है (hallucinate), भले ही आपने एक कूदती हुई बिल्ली की ओर इशारा किया हो।
PromptDebias तंत्र एक "दूसरी राय" वाले फिल्टर की तरह है।
- सिस्टम रोबोट से पूछता है: "आप क्या सोचते हैं यदि मैं आपको तस्वीर न दिखाऊं?" (यह इसके भाषाई पूर्वाग्रह पर निर्भर करता है)।
- फिर यह पूछता है: "आप क्या सोचते हैं यदि मैं आपको तस्वीर दिखाऊं और आपका इशारा भी दिखाऊं?"
- इसके बाद यह पहले उत्तर को दूसरे उत्तर से घटा देता है। यह रोबोट के अनुमान को रद्द कर देता है और उसे केवल उस विशिष्ट क्षेत्र पर निर्भर रहने के लिए मजबूर करता है जिसकी ओर आपने इशारा किया है।
यह एक बड़ी बात क्यों है?
- पुनः प्रशिक्षण की आवश्यकता नहीं: आपको रोबोट को नया कौशल सिखाने की आवश्यकता नहीं है। आप बस जब चाहें इस "जादुई हाइलाइटर" का उपयोग कर सकते हैं।
- हर जगह काम करता है: यह पुराने रोबोट (मॉडल्स) और नए दोनों पर काम करता है, और यह तब भी काम करता है जब आप उससे ऐसी चीजों के बारे में पूछते हैं जो उसने पहले कभी नहीं देखी हैं (जैसे किसी विदेशी ऐप के स्क्रीनशॉट में टेक्स्ट पढ़ना)।
- कम भ्रम (Hallucination): क्योंकि यह रोबोट को उस विशिष्ट स्थान को देखने के लिए मजबूर करता है जिसकी ओर आपने इशारा किया है, यह उन चीजों के बारे में कहानियाँ बनाना बंद कर देता है जो वहाँ मौजूद नहीं हैं।
संक्षेप में:
ControlMLLM++ एक अंधे व्यक्ति को चश्मे देने जैसा है जो केवल उसी वस्तु को दिखाते हैं जिसकी ओर आप इशारा कर रहे हैं। यह उस जीनियस को बदलता नहीं है; यह बस उन्हें अपनी अविश्वसनीय मानसिक शक्ति को ठीक वहीं केंद्रित करने में मदद करता है जहाँ आपको उनकी आवश्यकता है, तुरंत और बिना किसी अतिरिक्त होमवर्क के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।