INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning
यह शोध पत्र Inst-IT को प्रस्तुत करता है, जो एक व्यापक ढांचा है जिसमें एक नैदानिक बेंचमार्क, एक बड़े पैमाने का इंस्ट्रक्शन-ट्यूनिंग डेटासेट, और एक निरंतर प्रशिक्षण प्रतिमान शामिल है जो लार्ज मल्टीमॉडल मॉडल्स (LMMs) में इंस्टेंस-लेवल और जेनेरिक समझ दोनों क्षमताओं को महत्वपूर्ण रूप से बढ़ाने के लिए स्पष्ट विजुअल प्रॉम्प्ट्स का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, दुनिया घूमने वाला दोस्त है जिसे फोटो देखना और वीडियो देखना बहुत पसंद है। यह दोस्त "बड़ी तस्वीर" (big picture) समझाने में बहुत माहिर है। यदि आप उन्हें एक व्यस्त सड़क की फोटो दिखाते हैं, तो वे बता सकते हैं, "यह कारों और पैदल चलते लोगों से भरा एक शहर है जहाँ धूप खिली हुई है।"
लेकिन, यदि आप उनसे पूछें, "तीसरे फ्रेम में लाल टोपी वाले विशिष्ट व्यक्ति क्या कर रहा है, और दूसरे फ्रेम की तुलना में वह कैसे चला?" तो आपका दोस्त भ्रमित हो सकता है। वे लोगों को आपस में मिला सकते हैं, भूल सकते हैं कि किसने क्या पहना था, या बस एक अस्पष्ट उत्तर दे सकते हैं, जैसे, "कोई चला।"
यह वही समस्या है जिसे Inst-IT नामक पेपर हल करने की कोशिश कर रहा है। यह इन "बुद्धिमान दोस्तों" (जो वास्तव में 'लार्ज मल्टीमॉडल मॉडल्स' जैसे AI मॉडल हैं) को यह सिखाने के बारे में है कि वे केवल पूरे जंगल को देखना बंद करें और हर एक पेड़ पर ध्यान देना शुरू करें।
यहाँ उनके समाधान का दैनिक उदाहरणों का उपयोग करते हुए विवरण दिया गया है:
1. समस्या: "धुंधले चश्मे" का प्रभाव (The "Blurry Glasses" Effect)
वर्तमान AI मॉडल धुंधले चश्मे पहने हुए किसी व्यक्ति की तरह हैं। वे भीड़ का सामान्य आकार तो देख सकते हैं, लेकिन विशिष्ट व्यक्तियों को पहचानने में उन्हें संघर्ष करना पड़ता है। वे अक्सर भ्रमित होकर गलत जानकारी देते हैं (hallucinate) या जब चीजें हिलती हैं, खासकर वीडियो में, तो वे ट्रैक खो देते हैं कि कौन कौन है।
2. समाधान: हर चीज़ के लिए "नाम टैग" (Name Tags for Everything)
शोधकर्ताओं ने एक्सप्लिसिट विजुअल प्रॉम्प्टिंग (Explicit Visual Prompting) नामक एक चतुर तकनीक विकसित की है।
कल्पना कीजिए कि आप एक भीड़ भरी पार्टी में हैं, और आप किसी विशिष्ट अतिथि के बारे में कहानी बताना चाहते हैं। "वहाँ खड़ा वह आदमी" कहने के बजाय, आप हर किसी के माथे पर एक चमकता हुआ नाम टैग (जैसे एक नंबर: 1, 2, 3) लगा देते हैं।
- AI का काम: अब, जब आप पूछते हैं, "व्यक्ति #3 क्या कर रहा है?", तो AI को अनुमान लगाने की ज़रूरत नहीं है। वह स्पष्ट रूप से टैग "3" देख सकता है और ठीक उसी व्यक्ति को ट्रैक कर सकता है, भले ही वह किसी खंभे के पीछे चला जाए या दिशा बदल ले।
इस तकनीक को पेपर में सेट-ऑफ-मार्क्स (Set-of-Marks - SoM) कहा गया है। वे एक वीडियो या फोटो लेते हैं, एक टूल का उपयोग करके हर वस्तु पर ये अदृश्य नंबर टैग खींचते हैं, और फिर इस "टैग्ड" संस्करण को AI को दिखाते हैं।
3. प्रशिक्षण: "सुपर-नोटबुक" (The "Super-Notebook")
AI को इन टैग्स का उपयोग करना सिखाने के लिए, शोधकर्ताओं ने एक विशाल प्रशिक्षण डेटासेट (AI के लिए एक विशाल पाठ्यपुस्तक) बनाया।
- सामग्री: उन्होंने केवल साधारण वाक्य नहीं लिखे। उन्होंने एक "सुपर-नोटबुक" बनाई जिसमें शामिल हैं:
- व्यक्तियों का विवरण: "व्यक्ति #1 ने नीली शर्ट पहनी है।"
- पूरे दृश्य का विवरण: "यह एक शादी है।"
- "परिवर्तन की कहानी": "फ्रेम 1 और फ्रेम 2 के बीच, व्यक्ति #1 बाईं ओर से दाईं ओर चला गया।"
- प्रश्न और उत्तर: "व्यक्ति #2 ने अपने हाथ में क्या पकड़ा था?"
- पैमाना: उन्होंने इसे 51,000 फोटो और 21,000 वीडियो के लिए बनाया। यह AI को लाखों कहानियों के पुस्तकालय देने जैसा है जहाँ हर पात्र स्पष्ट रूप से लेबल किया गया है।
4. परिणाम: "सामान्य विशेषज्ञ" से "जासूस" तक (From "Generalist" to "Detective")
इस "टैग्ड" डेटा के साथ प्रशिक्षण के बाद, AI बदल गया।
- पहले: वह एक सामान्य विशेषज्ञ (generalist) था जो दृश्य का वर्णन कर सकता था लेकिन विवरणों में विफल रहता था।
- बाद में: वह एक जासूस (detective) बन गया। अब वह "क्या लाल ड्रेस वाली महिला ने कार के गुजरने से पहले या बाद में अपना बैग गिराया?" जैसे जटिल प्रश्नों के उत्तर उच्च सटीकता के साथ दे सकता है।
यह क्यों महत्वपूर्ण है (इसका महत्व क्या है?)
पेपर दिखाता है कि AI को विशिष्ट विवरणों (instances) पर ध्यान केंद्रित करना सिखाकर, वह वास्तव में बाकी सब चीजों में भी बेहतर हो गया।
- उपमा: इसे एक ऐसे छात्र के रूप में सोचें जो बहुत विशिष्ट, कठिन गणित के सवाल हल करने का अभ्यास करता है। आपको लग सकता है कि वे केवल उन विशिष्ट सवालों में ही अच्छे होंगे। लेकिन वास्तव में, विवरणों में महारत हासिल करके, वे सामान्य गणित, समझ और तर्क में भी बेहतर हो जाते हैं।
- वास्तविक दुनिया: इसका मतलब है कि भविष्य के AI सहायक केवल यह नहीं कहेंगे कि "वीडियो में एक कार है।" वे यह बताने में सक्षम होंगे कि "बाईं ओर की नीली कार ने कुत्ते से बचने के लिए रास्ता बदला, जबकि दाईं ओर की लाल कार सीधे चलती रही।" यह स्वायत्त कारों (self-driving cars), मेडिकल इमेजिंग (एक विशिष्ट ट्यूमर को पहचानना), या दृष्टिबाधित लोगों को दुनिया में नेविगेट करने में मदद करने के लिए अत्यंत महत्वपूर्ण है।
सारांश
Inst-IT एक नया तरीका है जो AI को पूरी तस्वीर को घूरना बंद करने और बारीक विवरणों को पढ़ना सिखाता है। वस्तुओं पर "नाम टैग" लगाकर और AI को उन विशिष्ट वस्तुओं के बारे में विस्तृत कहानियों के विशाल पुस्तकालय के साथ प्रशिक्षित करके, उन्होंने एक स्मार्ट, अधिक अवलोकनशील AI बनाया है जो दुनिया को एक समय में एक विवरण के साथ समझता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।