← नवीनतम पेपर
💻 computer science

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

यह शोध पत्र Inst-IT को प्रस्तुत करता है, जो एक व्यापक ढांचा है जिसमें एक नैदानिक बेंचमार्क, एक बड़े पैमाने का इंस्ट्रक्शन-ट्यूनिंग डेटासेट, और एक निरंतर प्रशिक्षण प्रतिमान शामिल है जो लार्ज मल्टीमॉडल मॉडल्स (LMMs) में इंस्टेंस-लेवल और जेनेरिक समझ दोनों क्षमताओं को महत्वपूर्ण रूप से बढ़ाने के लिए स्पष्ट विजुअल प्रॉम्प्ट्स का लाभ उठाता है।

मूल लेखक: Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, दुनिया घूमने वाला दोस्त है जिसे फोटो देखना और वीडियो देखना बहुत पसंद है। यह दोस्त "बड़ी तस्वीर" (big picture) समझाने में बहुत माहिर है। यदि आप उन्हें एक व्यस्त सड़क की फोटो दिखाते हैं, तो वे बता सकते हैं, "यह कारों और पैदल चलते लोगों से भरा एक शहर है जहाँ धूप खिली हुई है।"

लेकिन, यदि आप उनसे पूछें, "तीसरे फ्रेम में लाल टोपी वाले विशिष्ट व्यक्ति क्या कर रहा है, और दूसरे फ्रेम की तुलना में वह कैसे चला?" तो आपका दोस्त भ्रमित हो सकता है। वे लोगों को आपस में मिला सकते हैं, भूल सकते हैं कि किसने क्या पहना था, या बस एक अस्पष्ट उत्तर दे सकते हैं, जैसे, "कोई चला।"

यह वही समस्या है जिसे Inst-IT नामक पेपर हल करने की कोशिश कर रहा है। यह इन "बुद्धिमान दोस्तों" (जो वास्तव में 'लार्ज मल्टीमॉडल मॉडल्स' जैसे AI मॉडल हैं) को यह सिखाने के बारे में है कि वे केवल पूरे जंगल को देखना बंद करें और हर एक पेड़ पर ध्यान देना शुरू करें।

यहाँ उनके समाधान का दैनिक उदाहरणों का उपयोग करते हुए विवरण दिया गया है:

1. समस्या: "धुंधले चश्मे" का प्रभाव (The "Blurry Glasses" Effect)

वर्तमान AI मॉडल धुंधले चश्मे पहने हुए किसी व्यक्ति की तरह हैं। वे भीड़ का सामान्य आकार तो देख सकते हैं, लेकिन विशिष्ट व्यक्तियों को पहचानने में उन्हें संघर्ष करना पड़ता है। वे अक्सर भ्रमित होकर गलत जानकारी देते हैं (hallucinate) या जब चीजें हिलती हैं, खासकर वीडियो में, तो वे ट्रैक खो देते हैं कि कौन कौन है।

2. समाधान: हर चीज़ के लिए "नाम टैग" (Name Tags for Everything)

शोधकर्ताओं ने एक्सप्लिसिट विजुअल प्रॉम्प्टिंग (Explicit Visual Prompting) नामक एक चतुर तकनीक विकसित की है।

कल्पना कीजिए कि आप एक भीड़ भरी पार्टी में हैं, और आप किसी विशिष्ट अतिथि के बारे में कहानी बताना चाहते हैं। "वहाँ खड़ा वह आदमी" कहने के बजाय, आप हर किसी के माथे पर एक चमकता हुआ नाम टैग (जैसे एक नंबर: 1, 2, 3) लगा देते हैं।

  • AI का काम: अब, जब आप पूछते हैं, "व्यक्ति #3 क्या कर रहा है?", तो AI को अनुमान लगाने की ज़रूरत नहीं है। वह स्पष्ट रूप से टैग "3" देख सकता है और ठीक उसी व्यक्ति को ट्रैक कर सकता है, भले ही वह किसी खंभे के पीछे चला जाए या दिशा बदल ले।

इस तकनीक को पेपर में सेट-ऑफ-मार्क्स (Set-of-Marks - SoM) कहा गया है। वे एक वीडियो या फोटो लेते हैं, एक टूल का उपयोग करके हर वस्तु पर ये अदृश्य नंबर टैग खींचते हैं, और फिर इस "टैग्ड" संस्करण को AI को दिखाते हैं।

3. प्रशिक्षण: "सुपर-नोटबुक" (The "Super-Notebook")

AI को इन टैग्स का उपयोग करना सिखाने के लिए, शोधकर्ताओं ने एक विशाल प्रशिक्षण डेटासेट (AI के लिए एक विशाल पाठ्यपुस्तक) बनाया।

  • सामग्री: उन्होंने केवल साधारण वाक्य नहीं लिखे। उन्होंने एक "सुपर-नोटबुक" बनाई जिसमें शामिल हैं:
    • व्यक्तियों का विवरण: "व्यक्ति #1 ने नीली शर्ट पहनी है।"
    • पूरे दृश्य का विवरण: "यह एक शादी है।"
    • "परिवर्तन की कहानी": "फ्रेम 1 और फ्रेम 2 के बीच, व्यक्ति #1 बाईं ओर से दाईं ओर चला गया।"
    • प्रश्न और उत्तर: "व्यक्ति #2 ने अपने हाथ में क्या पकड़ा था?"
  • पैमाना: उन्होंने इसे 51,000 फोटो और 21,000 वीडियो के लिए बनाया। यह AI को लाखों कहानियों के पुस्तकालय देने जैसा है जहाँ हर पात्र स्पष्ट रूप से लेबल किया गया है।

4. परिणाम: "सामान्य विशेषज्ञ" से "जासूस" तक (From "Generalist" to "Detective")

इस "टैग्ड" डेटा के साथ प्रशिक्षण के बाद, AI बदल गया।

  • पहले: वह एक सामान्य विशेषज्ञ (generalist) था जो दृश्य का वर्णन कर सकता था लेकिन विवरणों में विफल रहता था।
  • बाद में: वह एक जासूस (detective) बन गया। अब वह "क्या लाल ड्रेस वाली महिला ने कार के गुजरने से पहले या बाद में अपना बैग गिराया?" जैसे जटिल प्रश्नों के उत्तर उच्च सटीकता के साथ दे सकता है।

यह क्यों महत्वपूर्ण है (इसका महत्व क्या है?)

पेपर दिखाता है कि AI को विशिष्ट विवरणों (instances) पर ध्यान केंद्रित करना सिखाकर, वह वास्तव में बाकी सब चीजों में भी बेहतर हो गया।

  • उपमा: इसे एक ऐसे छात्र के रूप में सोचें जो बहुत विशिष्ट, कठिन गणित के सवाल हल करने का अभ्यास करता है। आपको लग सकता है कि वे केवल उन विशिष्ट सवालों में ही अच्छे होंगे। लेकिन वास्तव में, विवरणों में महारत हासिल करके, वे सामान्य गणित, समझ और तर्क में भी बेहतर हो जाते हैं।
  • वास्तविक दुनिया: इसका मतलब है कि भविष्य के AI सहायक केवल यह नहीं कहेंगे कि "वीडियो में एक कार है।" वे यह बताने में सक्षम होंगे कि "बाईं ओर की नीली कार ने कुत्ते से बचने के लिए रास्ता बदला, जबकि दाईं ओर की लाल कार सीधे चलती रही।" यह स्वायत्त कारों (self-driving cars), मेडिकल इमेजिंग (एक विशिष्ट ट्यूमर को पहचानना), या दृष्टिबाधित लोगों को दुनिया में नेविगेट करने में मदद करने के लिए अत्यंत महत्वपूर्ण है।

सारांश

Inst-IT एक नया तरीका है जो AI को पूरी तस्वीर को घूरना बंद करने और बारीक विवरणों को पढ़ना सिखाता है। वस्तुओं पर "नाम टैग" लगाकर और AI को उन विशिष्ट वस्तुओं के बारे में विस्तृत कहानियों के विशाल पुस्तकालय के साथ प्रशिक्षित करके, उन्होंने एक स्मार्ट, अधिक अवलोकनशील AI बनाया है जो दुनिया को एक समय में एक विवरण के साथ समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →