← नवीनतम पेपर
💻 computer science

SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models

यह शोध पत्र SigLino को प्रस्तुत करता है, जो एक कुशल एग्लोमेरेटिव विजन फाउंडेशन मॉडल्स का परिवार है, जो SigLIP2 और DINOv3 से ज्ञान को प्रभावी ढंग से डेंस (dense) और मिक्स्चर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts) छात्रों में डिस्टिल करने के लिए एसिमेट्रिक डिस्टिलेशन, टोकन-बैलेंस्ड बैचिंग और पदानुक्रमित डेटा सैंपलिंग का लाभ उठाता है, जिसके परिणामस्वरूप स्क्रैच से प्रशिक्षित मॉडलों की तुलना में अर्ली-फ्यूजन ग्राउंडिंग-VLMs के लिए बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Sofian Chaybouti, Sanath Narayan, Yasser Dahou, Phúc H. Lê Khac, Ankit Singh, Ngoc Dung Huynh, Wamiq Reyaz Para, Hilde Kuehne, Hakim Hacid

प्रकाशित 2026-04-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sofian Chaybouti, Sanath Narayan, Yasser Dahou, Phúc H. Lê Khac, Ankit Singh, Ngoc Dung Huynh, Wamiq Reyaz Para, Hilde Kuehne, Hakim Hacid

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक युवा, प्रतिभाशाली कलाकार (छात्र) को दुनिया को पूरी तरह से देखना सिखाने की कोशिश कर रहे हैं। आमतौर पर, आप उन्हें सिखाने के लिए एक मास्टर पेंटर को काम पर रखेंगे। लेकिन क्या होगा अगर आप दो अलग-अलग महारत रखने वाले "मास्टर्स" को काम पर रख सकें, जिनमें से प्रत्येक के पास एक अनूठी सुपरपावर हो, और उन्हें एक साथ छात्र को सिखाने के लिए कहें?

यही वह तरीका है जिससे SigLino पेपर काम करता है। यह दो अलग-अलग "मास्टर शिक्षकों" की ताकत को एक सुपर-कुशल छात्र में जोड़कर AI विजन मॉडल को प्रशिक्षित करने का एक नया तरीका पेश करता है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. दो मास्टर्स (शिक्षक)

शोधकर्ताओं ने केवल कोई भी शिक्षक नहीं चुना; उन्होंने दो विशिष्ट "मास्टर्स" को चुना जो अलग-अलग चीजों में विशेषज्ञ हैं:

  • मास्टर SigLIP2: यह शिक्षक भाषा में माहिर है। इसे पता है कि एक छवि को क्या कहा जाता है और यह उसे शब्दों में वर्णित कर सकता है। यह एक कवि की तरह है जो एक तस्वीर देख सकता है और एक सटीक विवरण लिख सकता है।
  • मास्टर DINOv3: यह शिक्षक ज्यामिति (geometry) और विवरण में माहिर है। यह वस्तुओं के आकार, बनावट और सीमाओं को पूरी तरह से समझता है। यह एक मूर्तिकार की तरह है जो जानता है कि एक मूर्ति का हर किनारा कहाँ है।

समस्या: आमतौर पर, यदि आप दोनों से सीखने की कोशिश करते हैं, तो छात्र भ्रमित हो जाता है। कवि शब्दों के बारे में बात करना चाहता है, और मूर्तिकार आकृतियों के बारे में बात करना चाहता है। वे अलग-अलग भाषाएं बोलते हैं, और छात्र बिना अभिभूत हुए एक साथ दोनों से सीखने में संघर्ष करता है।

2. समाधान: SigLino (छात्र)

SigLino एक नया "छात्र" मॉडल है जिसे बिना सिरदर्द के दोनों मास्टर्स को एक साथ सुनने के लिए डिज़ाइन किया गया है। यह एक विशेष आर्किटेक्चर का उपयोग करता है जिसे Mixture-of-Experts (MoE) कहा जाता है।

उपमा: कल्पना कीजिए कि एक कक्षा है जिसमें एक शिक्षक (SigLIP2) और दूसरा (DINOv3) है। एक छात्र द्वारा सब कुछ नोट करने के बजाय, छात्र के पास विशेषज्ञ सहायकों ( "Experts") की एक टीम है।

  • जब कक्षा कविता पर चर्चा करती है, तो "कविता सहायक" नोट्स लेता है।
  • जब कक्षा आकृतियों पर चर्चा करती है, तो "मूर्तिकला सहायक" नोट्स लेता है।
  • वे एक पूर्ण समझ बनाने के लिए मिलकर काम करते हैं।

यह छात्र को कम कंप्यूटर संसाधनों का उपयोग करके दोनों मास्टर्स से कुशलतापूर्वक सीखने की अनुमति देता है।

3. गुप्त नुस्खा: तीन जादुई तरकीबें

पेपर उन तीन विशिष्ट "ट्रिक्स" को प्रकट करता है जिन्होंने इस सीखने की प्रक्रिया को इतना तेज़ और बेहतर बनाया:

A. "संतुलित लंच" (Token-Balanced Batching)

समस्या: कल्पना कीजिए कि एक कक्षा है जहाँ कुछ छात्र एक छोटा सैंडविच (कम-रिज़ॉल्यूशन वाली छोटी छवियां) लाते हैं और अन्य एक विशाल दावत (बड़ी, उच्च-रिज़ॉल्यूशन वाली छवियां) लाते हैं। यदि आप एक साथ सबको खिलाने की कोशिश करते हैं, तो मेज अव्यवस्थित हो जाती है, और छोटे सैंडविच वाले छात्रों को अनदेखा कर दिया जाता है क्योंकि बड़ी दावत सारी जगह घेर लेती है।
समाधान: शोधकर्ताओं ने बड़े भोज को छोटे, कौर (bite-sized) टुकड़ों में काटने और उन्हें छोटे सैंडविच के साथ पैक करने का एक तरीका आविष्कार किया ताकि प्रत्येक छात्र को भोजन की बिल्कुल समान मात्रा (tokens) मिले। यह सीखने को स्थिर रखता है और यह सुनिश्चित करता है कि AI बड़ी तस्वीरों को देखते समय छोटे विवरणों को देखना न भूल जाए।

B. "ग्रुप हग" (Asymmetric Relational Knowledge Distillation)

समस्या: आमतौर पर, AI अपने शिक्षक के साथ तुलना करके सीखता है। लेकिन कभी-कभी, शिक्षक गलती करता है, या छात्र इस बारे में भ्रमित हो जाता है कि दो अलग-अलग छवियां एक-दूसरे से कैसे संबंधित हैं।
समाधान: शोधकर्ताओं ने छात्र को छवियों के बीच के संबंधों को देखने के लिए प्रशिक्षित किया।

  • सामान्य सीखना: "यह छवि एक बिल्ली जैसी दिखती है।"
  • SigLino सीखना: "यह छवि एक बिल्ली है, और वह छवि एक कुत्ता है। वे अलग हैं। लेकिन बिल्लियों की ये दो छवियां बहुत समान हैं।"
  • "असममित" (Asymmetric) मोड़: उन्होंने एक नियम जोड़ा: "छवियों को तभी एक साथ धकेलें जब वे पहले से ही करीब हों, और उन्हें केवल तभी अलग करें जब वे पहले से ही दूर हों।" यह AI को भ्रमित होने और असंबंधित चीजों को एक जैसा दिखने के लिए मजबूर करने से रोकता है। यह एक डांस इंस्ट्रक्टर की तरह है जो आपको केवल उन्हीं लोगों का हाथ पकड़ने के लिए कहता है जिनके पास आप पहले से ही खड़े हैं, बजाय इसके कि आपको कमरे के पार अजनबियों को पकड़ने के लिए मजबूर करे।

C. "क्यूरेटेड लाइब्रेरी" (OpenLVD200M)

समस्या: इंटरनेट कचरे से भरा है। यदि आप एक छात्र को एक अस्त-व्यस्त लाइब्रेरी की हर किताब पढ़ने देकर सिखाते हैं, तो वह बहुत सारा बकवास सीख जाएगा।
समाधान: शोधकर्ताओं ने OpenLVD200M नामक एक विशेष लाइब्रेरी बनाई। 200 मिलियन रैंडम छवियां लेने के बजाय, उन्होंने हर विषय को समान रूप से कवर करने के लिए एक स्मार्ट सॉर्टिंग सिस्टम (hierarchical clustering) का उपयोग करके छवियों को सावधानीपूर्वक चुना।

  • उपमा: लाइब्रेरी से 200 मिलियन रैंडम पन्ने उठाने के बजाय, उन्होंने यह सुनिश्चित करने के लिए हर किताब से एक पन्ना सावधानीपूर्वक चुना कि छात्र "सेब," "कारें," "बादल," और "सूक्ष्मदर्शी" के बारे में समान रूप से सीखे, बिना एक ही बिल्ली की 1,000 तस्वीरें देखकर ऊब जाए।

4. परिणाम: एक सुपर-छात्र

परिणामस्वरूप एक ऐसा मॉडल प्राप्त हुआ जो है:

  1. तेज़: यह कम डेटा और कम कंप्यूटिंग पावर के साथ सीखता है।
  2. स्मार्ट: यह स्क्रैच से प्रशिक्षित मॉडलों की तुलना में शब्दों और आकृतियों दोनों को बेहतर समझता है।
  3. बहुमुखी (Versatile): इसका उपयोग "ग्राउंडिंग VLMs" बनाने के लिए किया जा सकता है—ऐसे AI सिस्टम जो न केवल एक छवि का वर्णन कर सकते हैं बल्कि यह भी बता सकते हैं कि किसी वस्तु का स्थान कहाँ है (जैसे किसी फोटो में एक विशिष्ट पक्षी को घेरे में लेना)।

सारांश

SigLino एक अत्यंत कुशल प्रशिक्षु कार्यक्रम (apprenticeship program) की तरह है। कक्षा को सावधानीपूर्वक व्यवस्थित करके (batching), छात्र को वस्तुओं के बीच संबंधों को समझने में प्रशिक्षित करके (relational distillation), और सबसे अच्छी पाठ्यपुस्तकों को क्यूरेट करके (OpenLVD200M), उन्होंने एक ऐसा AI बनाया जो दो अलग-अलग मास्टर्स से एक साथ सीख सकता है, और रिकॉर्ड समय में भाषा और दृष्टि दोनों का मास्टर बन सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →