← नवीनतम पेपर
💻 computer science

Boosting Visual Instruction Tuning with Self-Supervised Guidance

यह शोध पत्र V-GIFT का प्रस्ताव करता है, जो एक हल्का (lightweight) तरीका है जो प्रशिक्षण डेटा में प्राकृतिक भाषा निर्देशों के रूप में पुनर्गठित स्व-पर्यवेक्षित प्रीटेक्स्ट कार्यों (self-supervised pretext tasks) के एक छोटे अंश को शामिल करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की दृश्य तर्क क्षमताओं को बढ़ाता है, जिससे मॉडल को भाषाई पूर्वाग्रहों के बजाय दृश्य साक्ष्यों पर निर्भर रहने के लिए मजबूर किया जाता है।

मूल लेखक: Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris

प्रकाशित 2026-04-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े आलसी छात्र को दुनिया का वर्णन करना सिखा रहे हैं। आप उसे एक तस्वीर दिखाते हैं जिसमें एक बिल्ली चटाई पर बैठी है और उससे पूछते हैं, "तुम्हें क्या दिख रहा है?"

छात्र, जो किताबें पढ़ने में बहुत अच्छा है लेकिन उसने अभी तक चित्रों को ध्यान से देखना शुरू नहीं किया है, कहता है, "मुझे एक बिल्ली दिख रही है।" उसने सही कहा, लेकिन उसने वास्तव में तस्वीर को देखा नहीं। उसने केवल इस तथ्य के आधार पर अनुमान लगाया कि "बिल्लियाँ" एक सामान्य विषय हैं।

यह बिल्कुल वही समस्या है जो आज मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) के साथ है। ये AI सिस्टम हैं जो चित्र देख सकते हैं और उनके बारे में बात कर सकते हैं। वे अविश्वसनीय रूपيق से स्मार्ट हैं, लेकिन जब बात पेचीदा विजुअल पहेलियों की आती है—जैसे कि ठीक कितनी संख्या में लोग चश्मा पहने हुए हैं या यह पता लगाना कि कार किस दिशा में मुड़ रही है—तो वे अक्सर नकल (cheat) करते हैं। वे अपने "भाषा मस्तिष्क" (जो उन्होंने किताबों से सीखा है) पर भरोसा करते हैं बजाय अपने "विजुअल मस्तिष्क" (जो वे वास्तव में देख रहे हैं) के।

आपके द्वारा साझा किया गया पेपर, जिसका शीर्षक "बूस्टिंग विजुअल इंस्ट्रक्शन ट्यूनिंग विद सेल्फ-सुपरवाइज्ड गाइडेंस" (या संक्षेप में V-GIFT) है, इस समस्या का एक चतुर, कम लागत वाला समाधान प्रदान करता है।

समस्या: "लैंग्वेज चीट" (भाषा का सहारा लेकर नकल करना)

AI की ट्रेनिंग को एक कुकिंग क्लास की तरह समझें।

  • शिक्षक (डेटा): आमतौर पर छात्र को एक फोटो और एक रेसिपी (निर्देश) देता है जैसे, "इस सूर्यास्त का वर्णन करें।"
  • छात्र (AI): अक्सर उत्तर देता है, "यह नारंगी आसमान वाला एक सुंदर सूर्यास्त है," बिना वास्तव में उस विशेष फोटो के रंगों का विश्लेषण किए। वह एक "लैंग्वेज शॉर्टकट" का उपयोग कर रहा है। वह जानता है कि सूर्यास्त आमतौर पर नारंगी होते हैं, इसलिए वह अनुमान लगा लेता है।

जब टेस्ट कठिन हो जाता है—जैसे "इस पार्किंग लॉट में कितने लाल रंग के कार हैं?"—तो यह शॉर्टकट विफल हो जाता है। AI "शायद दो" का अनुमान लगाता है क्योंकि यह एक सामान्य संख्या है, लेकिन वह गलत होता है क्योंकि उसने वास्तव में पिक्सेल की गिनती नहीं की थी।

समाधान: "विजुअल जिम" (V-GIFT)

लेखकों ने महसूस किया कि इसे ठीक करने के लिए, उन्हें एक बड़ा, अधिक महंगा AI बनाने या उसके मस्तिष्क की संरचना को बदलने की आवश्यकता नहीं है। उन्हें बस होमवर्क को बदलने की आवश्यकता है।

उन्होंने एक नए प्रकार का होमवर्क पेश किया जिसे सेल्फ-सुपरवाइज्ड विजुअल टास्क कहा जाता है। ये AI की आँखों के लिए "जिम एक्सरसाइज" की तरह हैं। मुख्य बात यह है कि ये अभ्यास अनुमान लगाने या किताब पढ़ने से हल नहीं किए जा सकते। आपको उत्तर पाने के लिए चित्र को देखना ही होगा

उन्होंने तीन क्लासिक विजुअल पहेलियों को सरल प्रश्नों में बदल दिया:

  1. रोटेशन पहेली (The Rotation Puzzle):

    • कार्य: AI को एक तस्वीर दिखाई जाती है जिसे उल्टा या तिरछा कर दिया गया है।
    • प्रश्न: "यह इमेज किस दिशा में घूमी हुई है?"
    • यह क्यों काम करता है: आप भाषा से इसका अनुमान नहीं लगा सकते। यदि AI कहता है "90 डिग्री," तो उसे यह देखने के लिए चित्र को देखना ही होगा कि वस्तु तिरछी है।
  2. कलर मैच पहेली (The Color Match Puzzle):

    • कार्य: AI एक ब्लैक-एंड-व्हाइट फोटो देखता है जिस पर कुछ रंगीन बिंदु हैं, और रंगों की एक सूची है।
    • प्रश्न: "कुत्ते की नाक पर स्थित बिंदु का रंग क्या है?"
    • यह क्यों काम करता: AI को यह जानने के लिए कुत्ते के उस विशिष्ट स्थान को देखना होगा कि वह लाल था, नीला नहीं। वह केवल यह नहीं कह सकता कि "कुत्ते भूरे होते हैं।"
  3. "ट्विन खोजें" पहेली ("Find the Twin" Puzzle):

    • कार्य: AI को एक ही वस्तु की अलग-अलग कोणों से ली गई दो तस्वीरें दिखाई जाती हैं।
    • प्रश्न: "दूसरी फोटो में कौन सा बिंदु पहली फोटो के इस बिंदु से मेल खाता है?"
    • यह क्यों काम करता: यह AI को वस्तु के 3D आकार और स्थानिक संबंध (spatial relationship) को समझने के लिए मजबूर करता है, न कि केवल उसके नाम को।

उन्होंने इसे कैसे किया (जादुई ट्रिक)

इस पेपर की प्रतिभा इसकी डिलीवरी में है।

  • पुराना तरीका: आमतौर पर, AI को ये चीजें सिखाने के लिए, आपको विशेष, जटिल गणितीय सूत्र (लॉस फंक्शन्स) बनाने होते हैं या अतिरिक्त प्रशिक्षण चरण जोड़ने होते हैं। यह स्कूल के बगल में एक पूरा नया जिम बनाने जैसा है।
  • V-GIFT तरीका: उन्होंने बस इन पहेलियों को नियमित होमवर्क में मिला दिया। उन्होंने मानक "इस छवि का वर्णन करें" वाले प्रश्नों को लिया और उनमें 3% से 10% तक ये "विजुअल जिम" वाले प्रश्न शामिल कर दिए।

यह वैसा ही है जैसे एक भाषा शिक्षक, केवल "समुद्र के बारे में निबंध लिखें" पूछने के बजाय, कभी-कभी पूछता है, "इस समुद्र के मानचित्र को देखें और बताएं कि धारा किस दिशा में बह रही है।" छात्र अभी भी निबंध लिखना सीखता है, लेकिन उसे वास्तव में मानचित्र को देखने के लिए मजबूर किया जाता है।

परिणाम

जब उन्होंने इस नई पद्धति का परीक्षण किया:

  • AI विजुअल कार्यों में स्मार्ट हो गया: यह गिनती करने, स्थानिक संबंधों को पहचानने और ज्यामिति (geometry) को समझने में बहुत बेहतर हो गया।
  • यह अन्य चीजों में कमजोर नहीं हुआ: इसने निबंध लिखने या सामान्य प्रश्नों के उत्तर देने की अपनी क्षमता नहीं खोई।
  • यह सस्ता था: उन्हें सुपरकंप्यूटर या नए हार्डवेयर की आवश्यकता नहीं थी। उन्होंने बस AI को दिए जाने वाले डेटा के मिश्रण को बदल दिया।

मुख्य निष्कर्ष

यह पेपर साबित करता है कि AI "अंधा" इसलिए नहीं था क्योंकि उसके पास एक अच्छा कैमरा (विजुअल एनकोडर) नहीं था। वह इसलिए अंधा था क्योंकि वह आलसी था। वह नकल करने के लिए अपने भाषाई कौशल पर निर्भर था।

अपनी ट्रेनिंग डाइट में कुछ "विजुअल-ओनली" पहेलियों को शामिल करके, V-GIFT विधि AI को अनुमान लगाने के बजाय देखना शुरू करने के लिए मजबूर करती है। यह एक सरल, सुंदर रिमाइंडर है कि कभी-कभी, एक स्मार्ट AI को बेहतर देखने के लिए, आपको उसके मस्तिष्क को अपग्रेड करने की आवश्यकता नहीं होती; आपको बस उसे सही प्रकार का होमवर्क देने की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →