Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
यह शोध पत्र **Align-TI** का प्रस्ताव करता है, जो एक नवीन नॉलेज डिस्टिलेशन फ्रेमवर्क है जो स्टैटिक नेक्स्ट-टोकन एलाइनमेंट से आगे बढ़कर डायनेमिक टोकन इंटरैक्शन को कैप्चर करने के माध्यम से मल्टीमॉडल लार्ज लैंग्वेज मॉडल कंप्रेशन में सुधार करता है, विशेष रूप से विजन-इंस्ट्रक्शन एलाइनमेंट (IVA) और टोकन-टू-टोकन ट्रांजिशन प्रोबेबिलिटी एलाइनमेंट (TPA) के माध्यम से।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन छोटे बच्चे को एक विश्व प्रसिद्ध मास्टर कलाकार की तरह पेंटिंग करना सिखाने की कोशिश कर रहे हैं।
ज्यादातर लोग बच्चे को केवल तैयार पेंटिंग दिखाकर और यह कहकर सिखाने की कोशिश करते हैं कि, "इस सटीक चित्र की नकल करो।" इसे वर्तमान एआई शोधकर्ता "नेक्स्ट-टोकन अलाइनमेंट" (Next-Token Alignment) कहते हैं। यह ठीक-ठाक काम करता है, लेकिन बच्चा अक्सर पेंटिंग की "आत्मा" को समझने में चूक जाता है। वे रंगों को सही कर सकते हैं, लेकिन वे यह नहीं समझ पाते कि कलाकार ने एक विशिष्ट ब्रशस्ट्रोक क्यों चुना या जब उन्होंने कोने में एक छोटी सी बारीकी बनाई, तो कलाकार की नज़र कहाँ थी।
यह शोध पत्र, "Align-TI," सिखाने का एक बहुत अधिक स्मार्ट तरीका प्रस्तावित करता है। केवल अंतिम परिणाम को देखने के बजाय, "शिक्षक" एआई "छात्र" एआई को दो गुप्त सामग्रियां दिखाता है: कहाँ देखना है और कैसे सोचना है।
यह इन दो सरल उपमाओं का उपयोग करके कैसे काम करता है, यहाँ दिया गया है:
1. "स्पॉटलाइट" विधि (इंस्ट्रक्शन-अवेयर विजन अलाइनमेंट)
कल्पना कीजिए कि एक मास्टर कलाकार एक व्यस्त सड़क का दृश्य बना रहा है। यदि आप उनसे पूछें, "लाल छतरी कहाँ है?", तो उनकी आँखें तुरंत उसी विशिष्ट स्थान पर जाती हैं। वे फुटपाथ या आसमान को घूरने में अपना समय बर्बाद नहीं करते।
वर्तमान छोटे एआई मॉडल थोड़े "भटकाव वाले" होते हैं। जब वे किसी प्रश्न का उत्तर देने की कोशिश करते हैं, तो वे पूरी छवि को समान रूप से देखते हैं, जिससे वे लाल छतरी पर ध्यान केंद्रित करने के बजाय बैकग्राउंड के बादलों जैसे बेकार हिस्सों पर अपनी "बौद्धिक शक्ति" बर्बाद कर देते हैं।
Align-TI छात्र को एक स्पॉटलाइट देता है। यह छात्र को बताता है: "जब निर्देश छतरी के बारे में पूछे, तो अपनी ऊर्जा ठीक वहीं केंद्रित करें जहाँ मास्टर की आँखें केंद्रित थीं।" यह छोटे मॉडल को "विजुअल नॉइज़" (दृश्य शोर) से विचलित होने से रोकने और वास्तव में महत्वपूर्ण चीज़ को देखने में मदद करता है।
2. "विचारों का प्रवाह" विधि (ट्रांजिशन प्रोबेबिलिटी अलाइनमेंट)
कल्पना कीजिए कि आप जैज़ पियानो बजाना सीख रहे हैं। आप संगीत की एक शीट (अंतिम उत्तर) का अध्ययन कर सकते हैं, लेकिन यह आपको 'इम्प्रोवाइज' (तत्काल रचना) करना नहीं सिखाता। वास्तव में सीखने के लिए, आपको संक्रमण के तर्क (logic of the transition) को समझने की आवश्यकता है: "यदि मैं यह नोट बजाता हूँ, तो लय को बनाए रखने के लिए अगला सबसे स्वाभाविक नोट क्या होना चाहिए?"
मानक एआई प्रशिक्षण केवल "अंतिम नोट्स" सिखाता है। यदि छात्र शुरुआत में एक छोटी सी भी गलती करता है, तो वह भटक जाता है और पूरा "गीत" (वाक्य) बिखर जाता है। इसे "एक्सपोज़र बायस" (exposure bias) कहा जाता है—छात्र एक आदर्श स्क्रिप्ट का पालन करने का आदी होता है, लेकिन वास्तविक दुनिया में, उन्हें अपने स्वयं के नोट्स का पालन करना होता है।
Align-TI तर्क के लय को सिखाता है। यह केवल यह नहीं कहता कि, "अगला शब्द 'सेब' है।" यह कहता है, "यह देखते हुए कि आपने अभी-अभी कहा 'मैंने एक...', विचारों के तार्किक प्रवाह को 'सेब' की ओर ले जाना चाहिए न कि 'साइकिल' की ओर।" शब्दों के बीच के संबंध को सिखाकर, छात्र "हाजिरजवाब" बनने और ट्रैक पर रहने में बहुत बेहतर हो जाता है, भले ही वह कोई छोटी सी चूक कर दे।
परिणाम: एक नन्हा दिग्गज
इन दो विधियों—स्पốtलाइट और विचारों के प्रवाह—का उपयोग करके, शोधकर्ताओं ने एक "छात्र" मॉडल बनाया जो बहुत छोटा (केवल 2 बिलियन पैरामीटर्स) है लेकिन अविश्वसनीय रूप से स्मार्ट है।
वास्तव में, यह इतना कुशल है कि यह उन मॉडलों से भी बेहतर प्रदर्शन करता है जो इसके आकार से तीन गुना बड़े हैं! यह ऐसा है जैसे आप एक मिडिल स्कूल के छात्र को शतरंज खेलना इस तरह सिखाते हैं कि वह हाई स्कूल के छात्र को हरा सके, केवल उसे जीतने वाले खेलों की सूची याद कराने के बजाय, यह सिखाकर कि बोर्ड को कैसे देखना है और अपनी चालों की योजना कैसे बनानी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।