← नवीनतम पेपर
💻 computer science

Keep the Needle, Prune the Haystack: Defect-Preserving Token Pruning for Efficient Zero-Shot Anomaly Detection

यह शोध पत्र KeepAD का प्रस्ताव करता है, जो एक दोष-संरक्षण टोकन प्रूनिंग फ्रेमवर्क है जो विभिन्न नेटवर्क गहराइयों में विसंगतिपूर्ण (anomalous) टोकनों को रणनीतिक रूप से बनाए रखता है और अनावश्यक सामान्य टोकनों को आक्रामक रूप से हटा देता है, जिससे न्यूनतम प्रदर्शन ह्रास के साथ 7.9× तक की गति वृद्धि के साथ कुशल ज़ीरो-शॉट विसंगति का पता लगाना सक्षम होता है।

मूल लेखक: Yanning Hou, Jingyuan Zhang, Xiaoyun Wang, Qixiang Ma, Sihang Zhou, Ke Xu

प्रकाशित 2026-08-11
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanning Hou, Jingyuan Zhang, Xiaoyun Wang, Qixiang Ma, Sihang Zhou, Ke Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक बिल्कुल नई, महंगी कार पर एक छोटे से, मामूली खरोंच को खोजने की कोशिश कर रहे हैं। आपके पास एक सुपर-स्मार्ट रोबोट सहायक है जिसमें एक कैमरा है जो वाहन के हर एक इंच को देख सकता है। लेकिन पेच यह है कि रोबोट इतना विस्तृत है कि वह कार के हर एक वर्ग मिलीमीटर की जांच करता है, यहाँ तक कि उन हिस्सों की भी जो पूरी तरह से साफ और चमकदार हैं। वह अपनी जांच का 99% समय साफ पेंट की जांच करने में बिता देता है, ताकि वह पूरी तरह आश्वस्त हो सके, इससे पहले कि वह अंततः उस खरोंच को देख पाए। यह अविश्वसनीय रूप से धीमा और बर्बादी भरा है, खासकर यदि आपको प्रतिदिन हजारों कारों की जांच करनी हो।

यह ठीक वही समस्या है जिसका सामना आधुनिक "जीरो-शॉट एनोमली डिटेक्शन" (Zero-Shot Anomaly Detection) कर रहा है। कंप्यूटर विजन की दुनिया में, "जीरो-शॉट" का अर्थ है कि कंप्यूटर उन चीजों में दोष पहचान सकता है जिन्हें उसने पहले कभी नहीं देखा है—जैसे कि किसी नए प्रकार के मेडिकल स्कैन में दरार ढूंढना या किसी कारखाने के पुर्जे में खराबी का पता लगाना जिसके लिए उसे प्रशिक्षित नहीं किया गया था। ऐसा करने के लिए, ये कंप्यूटर विशाल "विज़न ट्रांसफॉर्मर्स" (ViTs) का उपयोग करते हैं, जो विशाल मस्तिष्क की तरह होते हैं जो एक छवि को हजारों छोटे पहेली के टुकड़ों (जिन्हें "टोकन" कहा जाता है) में तोड़ देते हैं और उनका विश्लेषण करते हैं। समस्या यह है कि ये मस्तिष्क भारी और धीमे हैं। वे एक सामान्य छवि और एक खराब छवि के साथ एक जैसा व्यवहार करते हैं, और हर एक टुकड़े पर गणना करते हैं, भले ही वह "खराब" टुकड़ा अच्छे टुकड़ों के समुद्र में केवल एक छोटा सा धब्बा ही क्यों न हो।

यहाँ KeepAD आता है, एक नया तरीका जो इन विशाल मस्तिष्कों के लिए एक स्मार्ट, जोखिम-जागरूक संपादक के रूप में कार्य करता है। कार के हर एक इंच की जांच करने के बजाय, KeepAD रोबोट को सतह को जल्दी से स्कैन करने, सबसे संदिग्ध स्थानों पर नज़र रखने और उबाऊ, एकदम सही हिस्सों को अनदेखा करने के लिए सिखाता है। लेकिन यह एक बहुत ही सावधानीपूर्ण नियम के साथ करता है: "सबूत को मत फेंको।" यदि रोबोट अनिश्चित है कि कोई धब्बा एक खरोंच है या केवल एक छाया, तो वह उसे रखता है। वह केवल उबाऊ, सुरक्षित हिस्सों को ही हटाता है। परिणाम यह है कि रोबोट अविश्वसनीय रूप से तेज़ हो जाता है—कुछ परीक्षणों में 8 गुना तक तेज़—बिना उन सूक्ष्म दोषों को छोड़े जिन्हें उसे ढूंढना है। यह ऐसा है जैसे एक जासूस जो घास के ढेर में सुई को बहुत कम समय में खोज लेता है, केवल उस घास को अनदेखा करके जो निश्चित रूप से केवल घास ही है।

समस्या: "हेस्टैक" (घास के ढेर) का जाल

औद्योगिक और चिकित्सा सुरक्षा की दुनिया में, दोष ढूंढना "घास के ढेर में सुई खोजने" का खेल है। अधिकांश समय, छवियां एकदम सही (घास) होती हैं और दोष दुर्लभ और सूक्ष्म (सुई) होते हैं। वर्तमान AI मॉडल एक बहुत ही मेहनती लेकिन धीमे लाइब्रेरियन की तरह हैं जो लाइब्रेरी की हर किताब के हर एक पन्ने को केवल एक टाइपो (लिखने की गलती) खोजने के लिए पढ़ता है। भले ही वह टाइपो केवल पेज 42 पर हो, लाइब्रेरियन पेज 1 से 41 तक के पन्नों को भी उसी तीव्रता के साथ पढ़ता है।

यह अक्षम है। पेपर एक विशिष्ट खतरे की ओर इशारा करता है जिसे "एसिमेट्रिक प्रूनिंग रिस्क" (Asymmetric Pruning Risk) कहा जाता है। यदि आप "अमहत्वपूर्ण" पन्नों (टोकन) को हटाकर गति बढ़ाने की कोशिश करते हैं, तो आप गलती से उस पन्ने को भी फेंक सकते हैं जिसमें टाइपो है। सामान्य छवि पहचान (जैसे बिल्ली की पहचान करना) में, कुछ पिक्सेल हटाने से ज्यादा फर्क नहीं पड़ता क्योंकि बिल्ली का चेहरा हर जगह होता है। लेकिन दोष पहचान (defect detection) में, "बिल्ली" पूरी छवि है, और "दोष" एक छोटा, छिपा हुआ विवरण है। यदि आप गलत टोकन को हटा देते हैं, तो आप समस्या का एकमात्र सबूत खो देते हैं।

समाधान: KeepAD की दो-चरणीय रणनीति

इस पेपर के लेखकों ने KeepAD (Keep Anomaly Detection) प्रस्तावित किया है, जो एक सिस्टम है जो एक स्मार्ट फिल्टर की तरह काम करता है। यह केवल चीजों को बेतरतीब ढंग से नहीं हटाता है; यह एक दो-चरणीय प्रक्रिया का उपयोग करता है जो छवि को "देखते" समय अपनी रणनीति बदलता है।

चरण 1: "सुरक्षा जाल" (उथले स्तर/Shallow Layers)
जब AI पहली बार छवि को देखता है, तो उसे अभी तक यह समझ नहीं आता कि दोष कैसा दिखता है। यह एक धुंधली फोटो देखने जैसा है। यदि वह अभी यह अनुमान लगाने की कोशिश करता है कि किन हिस्सों को हटाना है, तो वह गलती से दोष को भी हटा सकता है। इसलिए, KeepAD एक कवरेज-प्रिजर्विंग (Coverage-Preserving) रणनीति का उपयोग करता है। कल्पना कीजिए कि छवि 2x2 वर्गों का एक ग्रिड है। KeepAD कहता है, "चाहे जो भी हो, हमें हर एक 2x2 वर्ग से कम से कम एक हिस्सा रखना ही होगा।" यह सुनिश्चित करता है कि भले ही कोई दोष छोटा और अलग-थलग हो, वह पूरी तरह से मिट न जाए। यह एक "रेस्क्यू" तंत्र भी जोड़ता है: यदि कोई स्थान थोड़ा जोखिम भरा दिखता है, तो उसे बचा लिया जाता है भले ही वह सबसे स्पष्ट चीज़ न हो। यह चरण रूढ़िवादी है; थोड़ी अतिरिक्त घास रखना, सुई को खो देने से बेहतर है।

चरण 2: "स्नाइपर" (गहरे स्तर/Deep Layers)
जैसे-जैसे AI छवि को गहराई से प्रोसेस करता है, वह सामान्य बनावट और वास्तविक दोष के बीच अंतर समझना शुरू कर देता है। अब, वह अधिक आक्रामक हो सकता है। KeepAD एक एनोमली-एडेप्टिव (Anomaly-Adaptive) मोड में बदल जाता है। यह "प्रोटोटाइप्स" का उपयोग करता है—जो "सामान्य" और "असामान्य" दिखने के मानसिक टेम्पलेट हैं। यदि कोई टोकन स्पष्ट रूप से "सामान्य" टेम्पलेट से मेल खाता है, तो उसे हटा दिया जाता है। यदि वह दोष जैसा दिखता है, तो वह रहता है।

महत्वपूर्ण रूप से, यह दूसरा चरण इमेज-एडेप्टिव (Image-Adaptive) है। यह हर तस्वीर के लिए एक निश्चित नियम का उपयोग नहीं करता है। यदि कोई छवि बहुत संदिग्ध दिखती है (कई संभावित दोष), तो KeepAD सुरक्षित रहने के लिए अधिक टोकन रखता है। यदि छवि बहुत साफ दिखती है, तो वह समय बचाने के लिए अधिक टोकन हटा देता है। यह एक सुरक्षा गार्ड की तरह है जो एक संदिग्ध बैग की गहन जांच करता है लेकिन एक स्पष्ट, खाली बैग पर केवल एक नज़र डालता है।

गुप्त नुस्खा: बिना खोए सीखना

इस प्रणाली का सबसे कठिन हिस्सा AI को ये निर्णय लेने के लिए सिखाना है। यदि AI एक टोकन को हटा देता है, तो कंप्यूटर उसे सीखने के लिए फिर से "देख" नहीं सकता। इसे हल करने के लिए, लेखक डेंस-टू-स्पार्स सेल्फ-डिस्टिलेशन (Dense-to-Sparse Self-Distillation) नामक एक तकनीक का उपयोग करते हैं।

कल्पना कीजिए कि एक शिक्षक और एक छात्र हैं। "शिक्षक" वह पूर्ण, धीमा AI है जो हर टोकन को देखता है। "छात्र" वह तेज़, प्रून किया हुआ AI है जो केवल कुछ ही टोकन देखता है। प्रशिक्षण के दौरान, शिक्षक पूरी छवि को देखता है और कहता है, "अरे, इस जगह को देखो! भले ही यह शुरू में उबाऊ लग रहा था, लेकिन बाद में यह महत्वपूर्ण निकला।" छात्र यह सीखता है कि कुछ भी हटाने से पहले उन स्थानों पर ध्यान कैसे देना है। यह छात्र को कुछ भी हटाने से पहले उन स्थानों पर ध्यान केंद्रित करने में सक्षम बनाता है। इससे प्रशिक्षण समाप्त होने के बाद, शिक्षक चला जाता है, और छात्र अकेले, बहुत तेज़ी से काम संभालता है।

परिणाम: तेज़ और सटीक

शोधकर्ताओं ने औद्योगिक भागों (जैसे धातु की चादरें और सर्किट बोर्ड) से लेकर मेडिकल इमेज (जैसे ब्रेन स्कैन और एक्स-रे) तक 13 विभिन्न बेंचमार्क पर KeepAD का परीक्षण किया।

  • गति: KeepAD एक स्पीड डेमन है। इसने उन टोकन की संख्या को कम कर दिया जिन्हें AI को प्रोसेस करना था, जो मूल मात्रा के 20% से भी कम रह गई। सबसे आक्रामक सेटिंग में, यह CLIP (एक प्रसिद्ध AI मॉडल) पर आधारित सबसे मजबूत मौजूदा पद्धति की तुलना में 7.9 गुना तेज़ था।
  • सटीकता: इतने सारे डेटा को हटाने के बावजूद, इसने दोषों को नहीं छोड़ा। सटीकता में गिरावट बहुत मामूली थी—औसतन 2.7 प्रतिशत अंक से भी कम। कई मामलों में, यह लगभग मूल, पूर्ण संस्करण जितना ही सटीक था।
  • विश्वसनीयता: सिस्टम ने सफलतापूर्वक "पूर्ण चूक" (जहाँ एक दोष पूरी तरह से हट जाता है) से बचने में सफलता प्राप्त की। शुरुआत में "कवरेज-प्रिजर्विंग" चरण इसमें महत्वपूर्ण था, जिससे यह सुनिश्चित हुआ कि कोई भी छोटा दोष कभी भी प्रक्रिया में खो न जाए।

यह क्यों मायने रखता है

यह पेपर केवल यह सुझाव नहीं देता कि AI को तेज़ बनाने का एक नया तरीका क्या है; यह एक विशिष्ट, खतरनाक समस्या को हल करता है जहाँ गति आमतौर पर सुरक्षा की कीमत पर आती है। यह साबित करके कि आप महत्वपूर्ण "सुई" को खोए बिना अधिकांश डेटा को हटा (प्रून) सकते हैं, KeepAD इसे वास्तविक दुनिया के सिस्टम पर उच्च-स्तरीय दोष पहचान चलाने के लिए संभव बनाता है, जिन्हें तेज़ होने की आवश्यकता है, जैसे असेंबली लाइन या आपातकालीन चिकित्सा स्क्रीनिंग। यह दिखाता है कि सही रणनीति के साथ—शुरुआत में सावधान रहना और अंत में स्मार्ट होना—आप गति और सटीकता दोनों प्राप्त कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →