← नवीनतम पेपर
💻 computer science

FTerViT: Fully Ternary Vision Transformer

यह शोध पत्र FTerViT प्रस्तुत करता है, जो एक पूर्ण टेनरियराइज्ड (ternarized) विजन ट्रांसफार्मर है जो महत्वपूर्ण मेमोरी संपीड़न प्राप्त करने और इमेजनेट-1K (ImageNet-1K) की प्रतिस्पर्धी सटीकता बनाए रखते हुए माइक्रोकंट्रोलर्स पर कुशल ऑन-डिवाइस परिनियोजन को सक्षम करने के लिए सभी भारों (weights) और सामान्यीकरण मापदंडों (normalization parameters) को क्वांटाइज़ करता है।

मूल लेखक: Szymon Ruciński, Pietro Bonazzi, Engin Türetken, Simon Narduzzi, Michele Magno, Nadim Maamari

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Szymon Ruciński, Pietro Bonazzi, Engin Türetken, Simon Narduzzi, Michele Magno, Nadim Maamari

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान, उच्च शिक्षित लाइब्रेरियन (Vision Transformer या ViT) है, जो किसी तस्वीर को देखकर बिल्कुल सटीक बता सकता है कि वह क्या है। यह लाइब्रेरियन अविश्वसनीय रूप से स्मार्ट है, लेकिन उनके दिमाग में किताबों का एक विशाल पुस्तकालय भरा हुआ है। यदि आप इस लाइब्रेरियन को एक बहुत छोटे बैग (एक माइक्रोकंट्रोलर जैसे कि स्मार्टवॉच या सस्ते कैमरे में) में रखने की कोशिश करते हैं, तो बैग फट जाता है क्योंकि किताबें बहुत भारी होती हैं और बहुत अधिक जगह घेरती हैं।

आमतौर पर, इतने छोटे डिवाइस में स्मार्ट AI को फिट करने के लिए, इंजीनियर किताबों को छोटा करने की कोशिश करते हैं। वे टेक्स्ट को एक छोटे कोड में बदल सकते हैं, लेकिन वे अक्सर सबसे महत्वपूर्ण, नाजुक पन्नों (जैसे कि कवर, इंडेक्स और अंतिम सारांश) को उनके मूल, भारी प्रारूप में ही छोड़ देते हैं। यह शोध पत्र तर्क देता है कि यह एक भारी विश्वकोश को केवल उसके बीच के अध्यायों को छोटा करके अपनी जेब में फिट करने की कोशिश करने जैसा है; कवर और इंडेक्स अभी भी बहुत भारी हैं।

FTerViT के लेखकों ने इसे हल करने के लिए यह किया:

1. "तीन-रंगों" वाला शब्दकोश

जटिल संख्याओं (जैसे कि 3.14159...) का उपयोग करके जानकारी संग्रहीत करने के बजाय, लेखकों ने AI को केवल तीन सरल प्रतीकों का उपयोग करने के लिए मजबूर किया: -1, 0, और +1

  • इसे ऐसे समझें जैसे कि हर शब्द को लाल, हरे या नीले बिंदु द्वारा बदल दिया गया हो।
  • इन केवल तीन विकल्पों का उपयोग करके, वे जानकारी को अविश्वसनीय रूप से सघनता से पैक कर सकते हैं। यह एक विशाल मानचित्र को एक छोटे से चौकोर आकार में मोड़ने जैसा है।
  • वे इसे टेनरी (Ternary) कहते हैं (जिसका अर्थ है "तीन")।

2. "नाजुक" हिस्से

मॉडल को छोटा करने के पिछले प्रयासों ने बीच में ही काम रोक दिया था। उन्होंने मुख्य मस्तिष्क (इन्कोडर) को छोटा किया, लेकिन पैच एम्बेडिंग (कैसे AI छवि की पहली झलक देखता है), लेयरनॉर्म (कैसे AI अपने विचारों को संतुलित करता है), और क्लासिफायर (अंतिम निर्णय लेने वाला) को उनके भारी, पूर्ण आकार के प्रारूप में ही छोड़ दिया।

  • लेखकों ने महसूस किया कि एक छोटे डिवाइस में, ये "बचे हुए" भारी हिस्से वास्तव में सबसे अधिक जगह घेरते हैं, भले ही उनकी संख्या कम हो।
  • FTerViT पहली ऐसी तकनीक है जो इन नाजुक हिस्सों सहित सब कुछ सरल -1, 0, +1 प्रारूप में छोटा करती है।

3. "शिक्षक और छात्र" वाली तरकीब

एक विशाल मस्तिष्क को एक छोटे मस्तिष्क में सिकोड़ने से अक्सर वह सोचना भूल जाता है, जिससे वह मूर्खतापूर्ण गलतियाँ करने लगता है। इसे ठीक करने के लिए, लेखों ने नॉलेज डिस्टिलेशन (Knowledge Distillation) नामक तकनीक का उपयोग किया।

  • कल्पना करें कि एक मास्टर शेफ (मूल, भारी AI) एक जूनियर शेफ (छोटा, सिकुड़ा हुआ AI) को सिखा रहा है।
  • केवल जूनियर शेफ को यह बताने के बजाय कि "यह एक बिल्ली है," मास्टर शेफ उसे दिखाता है कि वे बिल्ली को कैसे देखते हैं। "कानों को देखो, मूंछों को देखो, उसकी आकृति को देखो।"
  • जूनियर शेफ मास्टर की विचार प्रक्रिया की नकल करके सीखता है, न कि केवल अंतिम उत्तर से। इसने छोटे AI को अपने सबसे छोटे आकार में सिकुड़ने के बाद भी स्मार्ट बने रहने में मदद की।

4. परिणाम: $10 के कैमरे में एक स्मार्ट AI

लेखकों ने इसका परीक्षण एक बहुत ही सस्ते, सामान्य माइक्रोकंट्रोलर चिप ESP32-S3 (जो लगभग $10 वाले उपकरणों में पाया जाता है) पर किया।

  • पहले: मूल AI 88.3 MB का था। यह इतना बड़ा था कि चिप में समा ही नहीं सकता था।
  • बाद में: उनका नया FTerViT मॉडल केवल 5.81 MB का है। यह पूरी तरह से फिट बैठता है।
  • प्रदर्शन: छोटा होने के बावजूद, यह अभी भी बहुत स्मार्ट है। यह लगभग 79.6% बार छवियों को सही ढंग से पहचानता है। यह AI को छोटा करने के पिछले प्रयासों की तुलना में बहुत बेहतर है, जहाँ प्रदर्शन अक्सर 74% या उससे कम हो जाता था।

5. यह आपकी जेब के लिए क्यों मायने रखता है

यह शोध पत्र दिखाता है कि स्मार्ट विजन चलाने के लिए आपको सुपरकंप्यूटर की आवश्यकता नहीं है। आप इसे 8 MB मेमोरी वाले डिवाइस पर चला सकते हैं (जो एक छोटे टेक्स्ट फ़ाइल के आकार के बराबर है)।

  • गति: क्योंकि डेटा इतना छोटा है, डिवाइस को जानकारी प्राप्त करने के लिए बहुत अधिक मेहनत नहीं करनी पड़ती। यह तेज़ चलता है और कम बैटरी खर्च करता है।
  • दक्षता: लेखकों ने एक कस्टम "इंजन" (सॉफ्टवेयर) बनाया है जो इस छोटे AI को पूरी तरह से चिप पर चलाता है, बिना इंटरनेट या क्लाउड सर्वर से जुड़े।

संक्षेप में: यह शोध पत्र सबसे उन्नत इमेज-सीइंग AI मॉडल्स को एक छोटे कंकड़ के आकार तक सिकोड़ने का एक तरीका पेश करता है, जिससे उन्हें उन सस्ते, बैटरी से चलने वाले उपकरणों पर चलाना संभव हो जाता है जो पहले इन्हें संभालने के लिए बहुत कमजोर थे। उन्होंने इसे गणित को केवल तीन संख्याओं तक सरल बनाकर और एक "शिक्षक" का उपयोग करके किया ताकि छोटा मॉडल सही ढंग से सोचना सीख सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →