← नवीनतम पेपर
🤖 machine learning

Ensembling Pruned Attention Heads For Uncertainty-Aware Efficient Transformers

यह शोध पत्र हाइड्रा एनसेम्बल्स (Hydra Ensembles) को प्रस्तुत करता है, जो एक कुशल ट्रांसफॉर्मर-आधारित विधि है जो विविध, संक्षिप्त मॉडल बनाने के लिए अटेंशन हेड्स को प्रून (prune) और मर्ज करती है, जो अनिश्चितता मात्रा निर्धारण (uncertainty quantification) प्रदर्शन में डीप एनसेम्बल्स (Deep Ensembles) के बराबर या उससे बेहतर प्रदर्शन करते हुए लगभग सिंगल-नेटवर्क इन्फरेंस गति बनाए रखते हैं।

मूल लेखक: Firas Gabetni, Giuseppe Curci, Andrea Pilzer, Subhankar Roy, Elisa Ricci, Gianni Franchi

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Firas Gabetni, Giuseppe Curci, Andrea Pilzer, Subhankar Roy, Elisa Ricci, Gianni Franchi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कठिन समस्या को हल करने के लिए विशेषज्ञों की एक टीम को काम पर रख रहे हैं, जैसे कि किसी दुर्लभ बीमारी का निदान करना या शेयर बाजार की गिरावट की भविष्यवाणी करना।

समस्या: "बहुत अधिक विशेषज्ञ" की दुविधा
आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, सुरक्षित उत्तर प्राप्त करने का सबसे विश्वसनीय तरीका अलग-अलग विशेषज्ञों की एक पूरी टीम को काम पर रखना है (एक "डीप एनसेम्बल")। यदि एक विशेषज्ञ गलत होता है, तो अन्य उसे पकड़ सकते हैं। वे वोट देते हैं, और समूह एक समझदारी भरा, सतर्क निर्णय लेता है।

हालाँकि, इसमें एक पेंच है: यह अविश्वसनीय रूप से महंगा है।
शून्य से 10 अलग-अलग विशेषज्ञों को प्रशिक्षित करने में बहुत समय, पैसा और कंप्यूटर शक्ति लगती है। यह एक मरीज की जांच करने के लिए 10 पूर्णकालिक डॉक्टरों को काम पर रखने जैसा है। विशाल AI मॉडल (जैसे कि जो छवियों या भाषा को समझते हैं) के लिए, यह अक्सर असंभव होता है।

एक अदूरदर्शी समाधान: "लेजी कट" (Lazy Cut)
कोई कह सकता है, "आइए एक विशेषज्ञ को लें और उनके बेकार हिस्सों को काटकर उन्हें तेज़ बनाते हैं!" इसे प्रूनिंग (pruning) कहा जाता है।
लेकिन इस शोध पत्र के लेखकों ने एक डरावना सच खोजा है: यदि आप किसी विशेषज्ञ के हिस्सों को बेतरतीब ढंग से काट देते हैं, तो वे अति-आत्मविश्वासी और अविश्वसनीय हो जाते हैं। वे यह स्वीकार करना बंद कर सकते हैं कि वे अनिश्चित हैं, जिससे खतरनाक गलतियाँ हो सकती हैं। यह एक डॉक्टर के कान काटने जैसा है; वे अभी भी बोल सकते हैं, लेकिन वे चेतावनी के संकेतों को सुन नहीं पाते।

समाधान: "हाइड्रा एनसेम्बल" (Hydra Ensemble)
लेखक एक चतुर नई विधि पेश करते हैं जिसे हाइड्रा एनसेम्बल (हाइड्रा के नाम पर, जो एक पौराणिक सांप है जिसके कई सिर होते हैं और कटने पर वापस उग आते हैं) कहा जाता है।

यह कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:

1. "ब्रेन सर्जरी" (प्रूनिंग)

10 अलग-अलग डॉक्टरों को काम पर रखने के बजाय, वे एक अत्यंत बुद्धिमान AI डॉक्टर को लेते हैं।
वे इस डॉक्टर पर तीन बार "ब्रेन सर्जरी" करते हैं, लेकिन हर बार वे मस्तिष्क कोशिकाओं का एक अलग सेट हटा देते हैं (विशेष रूप से, "अटेंशन हेड्स" जो AI को किसी छवि या वाक्य के विभिन्न हिस्सों पर ध्यान केंद्रित करने में मदद करते हैं)।

  • डॉक्टर A अपनी बाईं आँख का फोकस खो देता है।
  • डॉक्टर B अपनी दाईं आँख का फोकस खो देता है।
  • डॉक्टर C अपनी याददाश्त का फोकस खो देता है।

अब, आपके पास एक ही डॉक्टर के तीन थोड़े अलग संस्करण हैं। वे सभी "प्रून्ड" (छंटे हुए) हैं, लेकिन वे दुनिया को अलग तरह से देखते हैं।

2. "ग्रुप हग" (मर्जिंग/विलय)

आमतौर पर, तीन डॉक्टरों का लाभ उठाने के लिए, आपको उन्हें एक के बाद एक चलाना होगा (जो धीमा है!)।
लेखकों ने एक विशेष ट्रिक खोजी है जिसे ग्रुपड फुली कनेक्टेड लेयर्स (Grouped Fully Connected layers) कहा जाता है। कल्पना कीजिए कि इन तीन डॉक्टरों को लेकर उन्हें एक एकल सुपर-डॉक्टर में मिला देना, जिसके पास तीन प्रकार की आँखें और तीन प्रकार की यादें एक साथ तालमेल में काम कर रही हैं।

  • यह नया सुपर-डॉक्टर एक अकेले व्यक्ति की तरह तेज़ चलता है।
  • लेकिन क्योंकि इसके पास तीन अलग-अलग प्रून्ड संस्करणों का "परिप्रेक्ष्य" है, इसलिए यह एक टीम के तीन डॉक्टरों की तरह बुद्धिमान और सतर्क है।

3. यह क्यों बेहतर है

  • गति: यह केवल एक मॉडल का उपयोग करने जितना तेज़ है।
  • सुरक्षा: यह शून्य से शुरू की गई तीन अलग-अलग टीमों की तुलना में गलतियों को उतनी ही अच्छी तरह से पकड़ता है।
  • पुनः प्रशिक्षण की आवश्यकता नहीं: आपको शून्य से तीन नए मॉडल प्रशिक्षित करने की आवश्यकता नहीं है। आप बस एक मौजूदा मॉडल को लेते हैं, उसे काटते हैं और फिर से जोड़ देते हैं।

वास्तविक दुनिया का परीक्षण
टीम ने इनका परीक्षण किया:

  • छवियां (Images): बिल्लियों, कुत्तों और कारों की पहचान करना।
  • टेक्स्ट (Text): यह समझना कि मूवी रिव्यू सकारात्मक है या नकारात्मक।
  • ज़ीरो-शॉट (Zero-Shot): बिना किसी पूर्व शिक्षण के यह अनुमान लगाना कि कोई छवि क्या है (जैसे कि किसी नए प्रकार के जानवर को पहचानना)।

परिणाम:
कई मामलों में, हाइड्रा एनसेम्बल वास्तव में "डीप एनसेम्बल" के मुकाबले अनिश्चितता को पहचानने (यह जानने कि वे उत्तर नहीं जानते) में बेहतर था, जो कि तीन अलग-अलग मॉडलों की महंगी प्रक्रिया है। इसने कठिन परीक्षणों पर वर्तमान अत्याधुनिक (state-of-the-art) विधियों को भी पीछे छोड़ दिया, और वह भी बहुत कम कंप्यूटर शक्ति का उपयोग करके।

मुख्य निष्कर्ष

यह शोध पत्र हमें सिखाता है कि टीम के ज्ञान को प्राप्त करने के लिए आपको एक नई टीम को काम पर रखने की आवश्यकता नहीं है। कभी-कभी, यदि आप एक विशेषज्ञ के "मस्तिष्क" को सावधानीपूर्वक काटते हैं और पुनर्संयोजित करते हैं, तो आप एक अत्यंत कुशल, अत्यधिक विश्वसनीय AI बना सकते हैं जो सेल्फ-ड्राइविंग कारों या चिकित्सा निदान जैसी महत्वपूर्ण स्थितियों में उपयोग के लिए तेज़, सस्ता और सुरक्षित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →