Joint Post-Training Quantization of Vision Transformers with Learned Prompt-Guided Data Generation
यह शोध पत्र विजन ट्रांसफॉर्मर्स के लिए एक नवीन संयुक्त पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क प्रस्तुत करता है जो सीखे गए मल्टी-मोड प्रॉम्प्ट्स द्वारा निर्देशित स्टेबल डिफ्यूजन टर्बो का उपयोग करके डेटा-फ्री कैलिब्रेशन रणनीति के साथ फुल-मॉडल ऑप्टिमाइजेशन को जोड़कर बिना लेबल वाले डेटा के स्टेट-ऑफ-द-आर्ट लो-बिट सटीकता प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक शानदार, उच्च शिक्षित शेफ (विज़न ट्रांसफॉर्मर) है जो किसी भी फोटो में किसी भी वस्तु को अविश्वसनीय सटीकता के साथ पहचान सकता है। हालाँकि, यह शेफ एक विशालकाय व्यक्ति है: उन्हें एक विशाल रसोई, महंगे सामान और सहायकों की एक बड़ी टीम की आवश्यकता है। आप इस शेफ को एक छोटे से फूड ट्रक (एक एज डिवाइस जैसे फोन या ड्रोन) में रखना चाहते हैं जहाँ जगह और शक्ति सीमित है।
इसे काम करने लायक बनाने के लिए, आपको शेफ के ज्ञान को एक बैकपैक में समाने के लिए सिकोड़ना होगा बिना उनकी बेहतरीन खाना बनाने की क्षमता खोए। इस प्रक्रिया को क्वांटाइजेशन (Quantization) कहा जाता है।
यहाँ यह पेपर शेफ को सिकोड़ने की समस्या को हल करने के लिए दो मुख्य तरकीबों का उपयोग करता है:
1. "ग्रुप हग" रणनीति (जॉइंट ऑप्टिमिज़ेशन)
समस्या:
पिछले तरीकों ने शेफ के ज्ञान को ब्लॉक-दर-ब्लॉक सिकोड़ने की कोशिश की। कल्पना कीजिए कि आप एक जटिल मशीन को सिकोड़ने की कोशिश कर रहे हैं उसे टुकड़ों में अलग करके, एक गियर को ठीक करके, उसे वापस लगाकर, फिर अगले गियर को ठीक करके। समस्या यह है कि विज़न ट्रांसफॉर्मर्स में, सभी गियर आपस में मजबूती से जुड़े होते हैं। एक गियर को अलग से ठीक करने से अक्सर अगले गियर के साथ उसका संबंध टूट जाता है, जिससे पूरी मशीन जाम हो जाती है।
समाधान:
पूरे मशीन को एक-एक करके ठीक करने के बजाय, यह पेपर पूरी मशीन को एक साथ देखने का सुझाव देता है।
- उपमा: एक गायक दल (क्वायर) की कल्पना करें। यदि आप सोप्रानो सेक्शन को ज़ोर से गाने के लिए कहते हैं, तो हार्मनी बनाए रखने के लिए बास सेक्शन को धीमा गाने की आवश्यकता हो सकती है। पुराने तरीके प्रत्येक सेक्शन को अकेले तालमेल बिठाने के लिए कहते थे। यह नया तरीका पूरे गायक दल को वास्तविक समय में एक साथ तालमेल बिठाने के लिए कहता है।
- परिणाम: सभी परतों (layers) को एक साथ अनुकूलित करके, मॉडल यह सीख जाता है कि कैसे एक हिस्से में होने वाली त्रुटियों की भरपाई दूसरे हिस्से को समायोजित करके की जाए। यह एक नृत्य की तरह है जहाँ हर कोई तालमेल में चलता है, यह सुनिश्चित करते हुए कि अंतिम प्रदर्शन (इमेज रिकग्निशन) एकदम सटीक बना रहे, भले ही "वॉल्यूम" (परिशुद्धता) को बहुत कम कर दिया गया हो।
2. "मैजिक आर्ट जनरेटर" (डेटा-फ्री कैलिब्रेशन)
समस्या:
शेफ को सिकोड़ने के लिए, आपको आमतौर पर उन्हें अभ्यास करने के लिए हजारों वास्तविक फोटो दिखाने की आवश्यकता होती है (जैसे बिल्लियों की 10,000 तस्वीरें)। लेकिन क्या होगा यदि आपके पास वे फोटो नहीं हैं? शायद वे निजी हैं, या आपके पास बस वे उपलब्ध नहीं हैं।
- पुराना तरीका: आप एक AI आर्ट जनरेटर को "बिल्ली की एक फोटो" जैसे सरल प्रॉम्प्ट का उपयोग करके बिल्ली का वर्णन करने की कोशिश कर सकते हैं। AI आपको बिल्कुल एक ही जगह पर बैठी एक ही नारंगी रंग की बिल्ली की 100 तस्वीरें दे सकता है। यह उबाऊ है और शेफ को बारिश में दौड़ती हुई काली बिल्ली को पहचानने के लिए नहीं सिखाता है।
- पेपर की तरकीब: वे AI आर्ट जनरेटर को प्रत्येक वस्तु के लिए कई "व्यक्तित्व" सीखने के लिए सिखाते हैं।
- केवल एक प्रॉम्प्ट के बजाय, वे "पतंग" के लिए 20 अलग-अलग "आवाज़ें" सीखते हैं। एक आवाज़ पतंग को एक पक्षी के रूप में सोचती है, दूसरी एक खिलौने के रूप में, तीसरी हवा में उड़ते एक रंगीन आकार के रूप में।
- उपमा: कल्पना कीजिए कि आप एक सुरक्षा गार्ड को प्रशिक्षित कर रहे हैं। उन्हें एक ही संदिग्ध को एक ही कोट में 1,000 फोटो दिखाने के बजाय, आप उन्हें संदिग्ध को रेनकोट, सूट, टोपी पहने हुए या भागते हुए दिखाते हैं। आप गार्ड को संदिग्ध के केवल एक विशिष्ट लुक को नहीं, बल्कि उसके सार (essence) को पहचानने के लिए सिखाते हैं।
- यह कैसे काम करता है: सिस्टम इन विविध छवियों को स्वचालित रूप से उत्पन्न करने के लिए एक शक्तिशाली AI (स्टेबल डिफ्यूजन) का उपयोग करता है। यह जाँचता है कि क्या छवियां सही वस्तु की तरह दिखती हैं और यह सुनिश्चित करता है कि वे एक-दूसरे से अलग दिखें।
परिणाम: बहुत छोटा, बहुत स्मार्ट
"ग्रुप हग" (जॉइंट ऑप्टिमिज़ेशन) को "मैजिक आर्ट जनरेटर" (विविध सिंथेटिक डेटा) के साथ जोड़कर, लेखकों ने कुछ अद्भुत हासिल किया:
- छोटा आकार: उन्होंने मॉडलों को अत्यंत कम बिट्स (W1.58A8) तक सिकोड़ दिया। इसे एक हाई-डेफिनिशन मूवी को एक छोटी टेक्स्ट फ़ाइल में कंप्रेस करने के रूप में सोचें, फिर भी यह पूरी तरह से चलती है। विज़न ट्रांसफॉर्मर्स के लिए बिना वास्तविक डेटा के इसे सफलतापूर्वक करने का यह पहला समय है।
- गति: पूरी सिकुड़ने की प्रक्रिया एक सिंगल कंप्यूटर चिप पर लगभग एक घंटे में पूरी हो जाती है।
- वास्तविक डेटा की आवश्यकता नहीं: उन्होंने साबित किया कि आप केवल AI-जनरेटेड "जादुई" छवियों का उपयोग करके सिस्टम को प्रशिक्षित कर सकते हैं। इसका प्रदर्शन लगभग उतना ही अच्छा है जितना कि यदि आपने इंटरनेट से 10,000 वास्तविक फोटो का उपयोग किया होता।
सारांश
यह पेपर एक विशाल, जटिल रोबोट को जेब के आकार के गैजेट में सिकोड़ने का तरीका खोजने जैसा है।
- उन्होंने रोबोट को टुकड़ों में ठीक करना बंद कर दिया और पूरी चीज़ को एक साथ ट्यून करना शुरू कर दिया (जॉइंट ऑप्टिमिज़ेशन)।
- उन्होंने वास्तविक फोटो के गोदाम की आवश्यकता को समाप्त कर दिया और इसके बजाय एक AI को चलते-फिरते हजारों विविध, पूर्ण अभ्यास परिदृश्यों की कल्पना करना सिखाया (लर्नड प्रॉम्प्ट-गाइडेड डेटा जनरेशन)।
परिणाम? एक स्मार्ट, कुशल AI जो आपके फोन पर चल सकता है, और वास्तविक फोटो देखे बिना भी वस्तुओं को बिल्कुल बड़े संस्करण की तरह पहचान सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।