← नवीनतम पेपर
🤖 machine learning

Elastic Attention Cores for Scalable Vision Transformers

यह शोध पत्र VECA (विजुअल इलास्टिक कोर अटेंशन) प्रस्तुत करता है, जो एक विजन ट्रांसफार्मर आर्किटेक्चर है जो क्वाड्रेटिक ऑल-टू-ऑल सेल्फ-अटेंशन को एक कुशल कोर-पेरिफेरी संरचना से बदलकर रैखिक कम्प्यूटेशनल जटिलता और स्केलेबल हाई-रिज़ॉल्यूशन प्रोसेसिंग प्राप्त करता है, जहाँ पैच टोकन विशेष रूप से कोर एम्बेडिंग्स के एक छोटे, सीखे गए सेट के माध्यम से संचार करते हैं।

मूल लेखक: Alan Z. Song, Yinjie Chen, Mu Nan, Rui Zhang, Jiahang Cao, Weijian Mai, Muquan Yu, Hossein Adeli, Deva Ramanan, Michael J. Tarr, Andrew F. Luo

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alan Z. Song, Yinjie Chen, Mu Nan, Rui Zhang, Jiahang Cao, Weijian Mai, Muquan Yu, Hossein Adeli, Deva Ramanan, Michael J. Tarr, Andrew F. Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप हजारों मेहमानों (एक छवि के पिक्सेल) के साथ एक विशाल पार्टी आयोजित करने की कोशिश कर रहे हैं।

पुराना तरीका: "हर कोई हर किसी से बात करता है" वाली पार्टी

पारंपरिक AI मॉडल, जिन्हें विजन ट्रांसफॉर्मर (ViTs) कहा जाता है, एक अराजक पार्टी की तरह काम करते हैं जहाँ हर एक मेहमान को कमरे को समझने के लिए दूसरे हर मेहमान से परिचय करना ही पड़ता है।

  • समस्या: यदि आपके पास 100 मेहमान हैं, तो वह 10,000 हाथ मिलाना (handshakes) है। यदि आपके पास 1,000 मेहमान हैं (एक हाई-रिज़ॉल्यूशन फोटो), तो वह 1,000,000 हाथ मिलाना है। इसे व्यवस्थित करने में लगने वाला समय विस्फोटक रूप से बढ़ता है (क्वाड्रेटिक रूप से)। यह इतना धीमा और महंगा है कि ये मॉडल हाई-डेफिनिशन छवियों के साथ संघर्ष करते हैं।
  • धारणा: पुराने मॉडलों ने माना था कि कंप्यूटर के लिए किसी वस्तु को "देखने" के लिए, हर पिक्सेल को सीधे हर दूसरे पिक्सेल से बातचीत करने की आवश्यकता है।

नया तरीका: VECA (द "वीआईपी कोर" पार्टी)

इस पेपर के लेखक, एलन सोंग और उनके सहयोगियों ने कहा: "रुको जरा। क्या वास्तव में हमें हर किसी को हर किसी से बात करने की आवश्यकता है?" वे VECA (विजुअल इलास्टिक कोर अटेंशन) नामक एक नया सिस्टम प्रस्तावित करते हैं।

VECA को एक ऐसी पार्टी के रूप में सोचें जिसमें एक वीआईपी कोर ग्रुप और एक सामान्य अतिथि सूची है।

  1. वीआईपी कोर्स (VIP Cores): हजारों मेहमानों को आपस में बात करने देने के बजाय, मॉडल "वीआईपी" (जिन्हें कोर टोकन कहा जाता है) का एक छोटा, निश्चित समूह बनाता है। मान लीजिए कि केवल 64 वीआईपी हैं।
  2. संचार का नियम:
    • मेहमान (इमेज पैचेस) केवल वीआईपी से बात करते हैं। वे सीधे एक-दूसरे से बात नहीं करते हैं।
    • वीआईपी सभी से (सभी मेहमानों और अन्य वीआईपी से) बात करते हैं।
    • परिणाम: सूचना का प्रवाह गेस्ट → वीआईपी → गेस्ट की ओर होता है। मेहमानों को कभी भी एक-दूसरे से हाथ मिलाने की आवश्यकता नहीं होती।
  3. दक्षता लाभ (Efficiency Gain):
    • पुराने तरीके में, मेहमानों की संख्या दोगुनी करने पर काम चार गुना बढ़ जाता था।
    • VECA में, मेहमानों की संख्या दोगुनी करने पर काम केवल दोगुना होता है (लीनियर ग्रोथ)। यह ऐसा है जैसे एक छोटा, कुशल टीम मैनेजर (वीआईपी) अराजकता को संभालने के लिए है, बजाय इसके कि हर कर्मचारी को हर दूसरे कर्मचारी को प्रबंधित करने के लिए मजबूर किया जाए।

"इलास्टिक" सुपरपावर

सबसे शानदार बात यह है कि VECA इलास्टिक (लचीला) है।

  • ट्रेनिंग: ट्रेनिंग के दौरान, मॉडल अपने वीआईपी को रैंक करना सीखता है। कुछ वीआईपी "सुपर वीआईपी" होते हैं जो सबसे महत्वपूर्ण चीजों को जानते हैं (जैसे "यहाँ एक कुत्ता है"), जबकि अन्य "जूनियर वीआईपी" होते हैं जो बारीक विवरण जानते हैं (जैसे "कुत्ते का कान लटका हुआ है")।
  • इन्फरेंस (पार्टी के दौरान):
    • गति चाहिए? आप मॉडल को कह सकते हैं, "केवल शीर्ष 8 वीआईपी का उपयोग करें।" मॉडल तुरंत तेज़ हो जाता है क्योंकि यह जूनियर स्टाफ को अनदेखा कर रहा है। यह थोड़ा कम विस्तृत हो सकता है, लेकिन यह बहुत तेज़ है।
    • उच्च गुणवत्ता चाहिए? आप कह सकते हैं, "सभी 64 वीआईपी का उपयोग करें।" मॉडल थोड़ा धीमा हो जाता है लेकिन आपको एक सुपर-डिटेल्ड, उच्च-सटीक उत्तर देता है।
    • री-ट्रेनिंग की आवश्यकता नहीं: गति या गुणवत्ता के लिए आपको नया मॉडल बनाने की आवश्यकता नहीं है। आप बस चलते-फिरते (on the fly) वीआईपी की संख्या को घटा या बढ़ा सकते हैं।

उन्होंने क्या पाया?

लेखकों ने वर्गीकरण (classification) और वस्तुओं के चारों ओर रूपरेखा खींचने (segmentation) जैसे विभिन्न कार्यों पर इसका परीक्षण किया।

  • प्रदर्शन: भले ही इसमें "शॉर्टकट" लिया गया था कि पिक्सेल सीधे बात नहीं करते, फिर भी VECA वर्तमान में उपलब्ध सर्वश्रेष्ठ, सबसे महंगे मॉडलों (जैसे DINOv3) के लगभग बराबर प्रदर्शन करता है।
  • "जादुई" खोज: उन्होंने देखा कि वीआईपी (कोर टोकन) स्वाभाविक रूप से ऑब्जेक्ट डिटेक्टर के रूप में कार्य करना सीख गए। उन्हें स्पष्ट रूप से ऐसा करने के लिए नहीं कहा गया था, फिर भी वीआईपी विशिष्ट चीजों, जैसे "एक कटोरे में अंडे" या "कार का पहिया" को दर्शाने के लिए एक साथ समूह बनाने लगे। वे अस्पष्ट सूचनाओं के रूप में विकसित होने के बजाय विशिष्ट, सिमेंटिक समूहों में बदल गए।
  • रेज़ोल्यूशन: यह मॉडल छोटी छवियों पर बहुत अच्छा काम करता है और बिना क्रैश हुए या धीमा हुए बड़ी, उच्च-रिज़ॉल्यूशन वाली छवियों तक स्केल कर सकता है, जो पुराने मॉडलों के साथ मुश्किल होता है।

मुख्य निष्कर्ष (The Bottom Line)

पेपर का दावा है कि हमें स्मार्ट विजन AI बनाने के लिए महंगे, क्वाड्रेटिक "हर कोई हर किसी से बात करता है" वाले तरीके की आवश्यकता नहीं है। एक छोटे, स्मार्ट "कोर" टोकन टीम का उपयोग करके संचार को मध्यस्थ बनाने से, हम ऐसे मॉडल बना सकते हैं जो हैं:

  1. तेज़ और सस्ते (विशेष रूप से उच्च-रिज़ॉल्यूशन वाली छवियों के लिए)।
  2. लचीले (आप चलते-चलते गति और सटीकता के बीच चुनाव कर सकते हैं)।
  3. वर्तमान के दिग्गजों जितने ही स्मार्ट

यह कंप्यूटर विज़न के भविष्य के लिए एक नया बिल्डिंग ब्लॉक है जो उच्च-रिज़ॉल्यूशन वाले AI को व्यावहारिक और कुशल बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →