← नवीनतम पेपर
🔬 materials science

What DINO saw: ALiBi positional encoding reduces positional bias in Vision Transformers

यह शोध पत्र प्रदर्शित करता है कि ALiBi पोजीशनल एनकोडिंग के साथ विजन ट्रांसफॉर्मर्स को फाइनट्यून करना अंतर्निहित पोजीशनल बायस को प्रभावी ढंग से कम करता है और सामान्य सिमेंटिक रिप्रेजेंटेशन को सुरक्षित रखता है, जिससे दिशा-स्वतंत्र डोमेन जैसे कि मटेरियल साइंस माइक्रोस्कोपी में सफल ज़ीरो-शॉट अडैप्टेशन और सेगमेंटेशन सक्षम होता है।

मूल लेखक: Moritz Pawlowsky, Antonis Vamvakeros, Alexander Weiss, Anja Bielefeld, Samuel J. Cooper, Ronan Docherty

प्रकाशित 2026-03-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Moritz Pawlowsky, Antonis Vamvakeros, Alexander Weiss, Anja Bielefeld, Samuel J. Cooper, Ronan Docherty

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "What DINO Saw" पेपर का सरल अवधारणाओं और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी तस्वीर: AI की आँखों का "ब्लाइंड स्पॉट" (अंधा कोना)

कल्प Imagine कीजिए कि आपके पास DINO नाम का एक सुपर-स्मार्ट रोबोट है (विशेष रूप से, एक मॉडल जिसे DINOv2 कहा जाता है)। DINO तस्वीरों को देखने और उनमें मौजूद चीजों को समझने में माहिर है। यदि आप इसे कुत्ते की फोटो दिखाते हैं, तो यह जानता है कि वह कुत्ता है। यदि आप इसे कार दिखाते हैं, तो यह जानता है कि वह कार है। यह एक शानदार कला समीक्षक की तरह है जो किसी पेंटिंग का सटीक वर्णन कर सकता है।

हालाँकि, इस शोध ने खोजा कि DINO में एक अजीब ब्लाइंड स्पॉट (अंधा कोना) है।

जब DINO किसी तस्वीर को देखता है, तो वह केवल वस्तुओं को ही नहीं देखता; वह गुप्त रूप से वस्तुओं के स्थान (location) को भी बहुत कठोर तरीके से देखता है। यह ऐसा है जैसे DINO के पास एक मानसिक मानचित्र हो जो कहता है, "छवि के बाईं ओर की हर चीज़ दाईं ओर की हर चीज़ से थोड़ी अलग है," भले ही वह छवि केवल एक खाली दीवार या एक रैंडम बनावट (texture) ही क्यों न हो।

यह उन वैज्ञानिकों के लिए एक समस्या है जो पदार्थों (जैसे बैटरी के अंदर का हिस्सा या धातु का टुकड़ा) का अध्ययन करते हैं। ये छवियां अक्सर एक समान, दानेदार बनावट जैसी दिखती हैं जिनमें कोई "बाएँ" या "दाएँ" की प्राथमिकता नहीं होती। क्योंकि DINO स्थिति (position) को लेकर जुनूनी है, इसलिए वह भ्रमित हो जाता है। वह एक ऐसी तस्वीर पर "बाएँ-से-दाएँ" का पैटर्न थोपने की कोशिश करता है जिसमें ऐसा कोई पैटर्न है ही नहीं, जिससे जब वैज्ञानिक इन सामग्रियों का विश्लेषण करने की कोशिश करते हैं, तो परिणाम अस्त-व्यस्त और गलत आते हैं।

समस्या: मस्तिष्क में मौजूद "रूलर" (पैमाना)

लेखकों ने पाया कि DINO के मस्तिष्क (इसके न्यूरल नेटवर्क) में एक अंतर्निहित रूलर (पैमाना) है।

  • यह कैसे काम करता है: जब DINO को प्रशिक्षित किया गया था, तो इसने अपने मस्तिष्क के विशिष्ट हिस्सों को छवि के विशिष्ट स्थानों (ऊपरी-बाएँ, निचले-दाएँ, आदि) से जोड़ना सीख लिया था।
  • गड़बड़ी (The Glitch): शुद्ध सफेद शोर (white noise) या एक समान धातु की सतह की तस्वीर देखते समय भी, DINO का मस्तिष्क एक "रैंप" पैटर्न में चमकता है। वह सोचता है, "ओह, बाईं ओर के पिक्सेल 'कम' हैं, और दाईं ओर के पिक्सेल 'उच्च' हैं।"
  • परिणाम: जब वैज्ञानिकों ने DINO का उपयोग बैटरी की छवि के विभिन्न हिस्सों को सेगमेंट (रेखांकित) करने के लिए किया, तो AI ने रेखाएं इस आधार पर खींचीं कि पिक्सेल कहाँ थे, न कि वे क्या थे। यह एक ऐसे चित्रकार की तरह था जो नीले आकाश को तब तक नहीं रंगता जब तक कि पेंट कैनवास के बाईं ओर न हो।

समाधान: "ALiBi" फिक्स

टीम ने DINO के मस्तिष्क को ठीक करने का निर्णय लिया। वे DINO को फेंकना नहीं चाहते थे क्योंकि यह वस्तुओं को पहचानने में बहुत स्मार्ट है। वे बस उस परेशान करने वाले "रूलर" को हटाना चाहते थे।

उन्होंने DINO के मूल "सीखे हुए रूलर" को ALiBi (Attention with Linear Biases) नामक एक नई प्रणाली से बदल दिया।

उपमा: "सापेक्ष दूरी" (Relative Distance) का खेल

  • पुराना DINO (पूर्ण रूलर/Absolute Ruler): कल्पना कीजिए कि एक छात्र याद रखता है कि "प्रश्न 1 हमेशा बाएँ पृष्ठ पर होता है" और "प्रश्न 2 हमेशा दाएँ पृष्ठ पर होता है।" यदि आप उन्हें पन्ने इधर-उधर करके टेस्ट देते हैं, तो वे भ्रमित हो जाते हैं।
  • नया DINO (सापेक्ष दूरी/Relative Distance): कल्पना कीजिए कि एक छात्र को पेज नंबर से कोई फर्क नहीं पड़ता। उसे केवल इस बात से मतलब है कि, "जिस प्रश्न को मैं अभी देख रहा हूँ, वह उससे कितनी दूर है?"

इस "सापेक्ष दूरी" प्रणाली (ALिBi) पर स्विच करके, मॉडल पूर्ण निर्देशांकों (Top-Left बनाम Bottom-Right) की परवाह करना बंद कर देता है और केवल इस बात पर ध्यान केंद्रित करता है कि चीजें एक-दूसरे के कितने करीब हैं।

प्रयोग: दृष्टि को साफ करना

शोधकर्ताओं ने एक प्री-ट्रेंड DINO मॉडल लिया, उसका पुराना "रूलर" निकाला, और उसमें नया "ALiBi" सिस्टम इंस्टॉल किया। फिर, उन्होंने इसे फिर से उन्हीं तस्वीरों को देखने के लिए सिखाया, लेकिन इस बार, उन्होंने इसे कहा: "स्थिति की चिंता मत करो; बस मुझे बताओ कि वस्तु क्या है।"

परिणाम:

  1. "रूलर" गायब हो गया: जब उन्होंने एक समान छवियों (जैसे धातु के दाने या सफेद शोर) पर नए मॉडल का परीक्षण किया, तो अजीब "बाएँ-से-दाएँ" वाले पैटर्न गायब हो गए। मॉडल "होमोजेनियस" (एकसमान) हो गया—उसने बाएँ और दाएँ हिस्से के साथ बिल्कुल एक जैसा व्यवहार किया।
  2. इसे अभी भी पता था कि चीजें क्या हैं: आश्चर्यजनक रूप से, मॉडल ने अपनी बुद्धिमत्ता नहीं खोई। वह कुत्तों, कारों और जटिल बैटरी संरचनाओं को पुराने संस्करण की तरह ही अच्छी तरह पहचान सकता था।
  3. बेहतर सेगमेंटेशन: जब उन्होंने इस नए मॉडल का उपयोग वैज्ञानिकों को बैटरी की छवियों को काटने में मदद करने के लिए किया, तो परिणाम एकदम सही थे। AI ने स्थिति के आधार पर रेखाएं खींचना बंद कर दिया और वास्तविक सामग्री (जैसे एक छिद्र और एक ठोस कण के बीच अंतर करना) के आधार पर रेखाएं खींचना शुरू कर दिया।

यह क्यों महत्वपूर्ण है

यह मटेरियल्स साइंस (पदार्थ विज्ञान) के लिए एक बड़ी बात है।

वैज्ञानिक अक्सर बैटरियों, धातुओं या चट्टानों की सूक्ष्म छवियों को देखते हैं। ये छवियां अक्सर बहुत बड़ी, ग्रेस्केल और हर जगह बहुत समान दिखती हैं (जैसे कुत्ते या कार की तरह कोई स्पष्ट "विषय" नहीं होता)।

  • पहले: उन्हें जटिल वर्कअराउंड का उपयोग करना पड़ता था या वे निराश हो जाते थे क्योंकि AI बार-बार छवि की स्थिति से भ्रमित हो जाता था।
  • अब: उनके पास एक "साफ" AI है जो मानचित्र निर्देशांकों के बजाय स्वयं सामग्री को देखता है। यह बैटरी के जीवनकाल, मजबूत धातुओं और बेहतर विनिर्माण के बेहतर विश्लेषण की अनुमति देता है।

एक वाक्य में सारांश

लेखकों ने एक ऐसे सुपर-स्मार्ट AI को लिया जो गलती से अपने स्वयं के आंतरिक मानचित्र से पक्षपाती था, उसे एक नया "सापेक्ष दूरी" वाला मस्तिष्क दिया, और उसे एक पूरी तरह से संतुलित उपकरण में बदल दिया जो अंततः बिना भ्रमित हुए एकसमान वैज्ञानिक छवियों का विश्लेषण कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →