← नवीनतम पेपर
💻 computer science

SAMPLe: SAM-based Optimizer for Prompt Learning in VLMs

यह शोधपत्र SAMPLe को प्रस्तुत करता है, जो एक शार्पनेस-अवेयर ऑप्टिमाइज़र (sharpness-aware optimizer) है जिसे विजन-लैंग्वेज मॉडल प्रॉम्प्ट लर्निंग में प्रदर्शन-सामान्यीकरण द्वंद्व (performance-generalization dilemma) को हल करने के लिए डिज़ाइन किया गया है, जो विभिन्न ढांचों में ओवरफिटिंग को कम करने और अनदेखे डेटा के प्रति अनुकूलन क्षमता बढ़ाने के लिए अन्वेषण (exploration) और दोहन (exploitation) के बीच गतिशील रूप से संतुलन बनाता है।

मूल लेखक: Hossein Rajoli, Fatemeh Lotfi, Niloufar Alipour Talemi, Hossein Kashiani, Xiaolong Ma, Fatemeh Afghah

प्रकाशित 2026-07-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hossein Rajoli, Fatemeh Lotfi, Niloufar Alipour Talemi, Hossein Kashiani, Xiaolong Ma, Fatemeh Afghah

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट, प्री-ट्रेन्ड रोबोट है (जैसे CLIP) जिसने लाखों किताबें पढ़ी हैं और लाखों तस्वीरें देखी हैं। वह पहले से ही दुनिया को समझने में बहुत कुशल है। हालाँकि, आप उसे एक विशिष्ट नया कौशल सिखाना चाहते हैं, जैसे दुर्लभ फूलों की पहचान करना या विशिष्ट कार मॉडलों को पहचानना।

अतीत में, लोग पूरे रोबोट को "फाइन-ट्यून" (fine-tune) करने की कोशिश करते थे, लेकिन यह एक सुपरकंप्यूटर को नया कार्ड गेम सीखने के लिए फिर से वायर करने जैसा है—यह महंगा है और अक्सर रोबोट अपने पुराने कौशल भूल जाता है या भ्रमित हो जाता है।

इसके बजाय, शोधकर्ता प्रॉम्प्ट लर्निंग (Prompt Learning) का उपयोग करते हैं। इसे रोबोट को एक विशिष्ट "चीट शीट" या जादू के कीवर्ड्स (जिन्हें प्रॉम्प्ट्स कहा जाता है) देने के रूप में समझें जो उसे नए कार्य पर ध्यान केंद्रित करने में मदद करते हैं। रोबोट का मस्तिष्क स्थिर (frozen) रहता है, और हम केवल इन कुछ कीवर्ड्स को बदलते हैं।

समस्या: "अति-आत्मविश्वासी" छात्र

यह पेपर इस दृष्टिकोण के साथ एक बड़ी समस्या की पहचान करता है। जब हम इन कीवर्ड्स को अपने प्रशिक्षण उदाहरणों (देखे गए डेटा - "seen" data) पर एक सटीक स्कोर पाने के लिए बदलते हैं, तो रोबोट अक्सर बहुत आत्मविश्वासी और बहुत विशिष्ट हो जाता है।

कल्पना कीजिए कि एक छात्र अभ्यास टेस्ट के सटीक उत्तर रट लेता है। वह अभ्यास टेस्ट में 100% अंक प्राप्त करता है, लेकिन यदि आप उससे वास्तविक परीक्षा में थोड़ा अलग प्रश्न पूछते हैं, तो वह असफल हो जाता है। पेपर की भाषा में, रोबोट ने एक "शार्प मिनिमम" (Sharp Minimum) खोज लिया है।

  • शार्प मिनिमम (Sharp Minimum): मानचित्र पर एक ऐसा स्थान जहाँ स्कोर तो उच्च है, लेकिन यदि आप एक भी छोटा कदम किसी भी दिशा में लेते हैं, तो स्कोर गिर जाता है। यह एक सुई की नोक पर गेंद को संतुलित करने जैसा है। यह केवल तभी स्थिर है जब कुछ भी न हिले।
  • फ्लैट मिनिमम (Flat Minimum): एक ऐसा स्थान जहाँ स्कोर उच्च है, लेकिन ज़मीन चौड़ी और समतल है। यदि आप एक कदम लेते हैं, तो स्कोर ऊँचा ही रहता है। यह एक चौड़ी घाटी में बैठी गेंद की तरह है। यह मजबूत है और झटकों को झेल सकता है।

इन प्रॉम्प्ट्स को सिखाने के मौजूदा तरीके रोबोट को "सुई की नोक" पर रख देते हैं। यह प्रशिक्षण डेटा पर तो बहुत अच्छा काम करता है, लेकिन नए, अनदेखे डेटा (जैसे फूल का अलग प्रकार या खराब मौसम में कार) का सामना करने पर बुरी तरह विफल हो जाता है।

समाधान: SAMPLe (एक "सुरक्षा-प्रथम" कोच)

लेखक एक नया टूल पेश करते हैं जिसे SempLe (Sharpness-Aware Minimization Prompt Learning) कहा जाता है। आप SAMPLe को एक बहुत ही स्मार्ट कोच के रूप में देख सकते हैं जिसे न केवल वर्तमान स्कोर की चिंता है, बल्कि इस बात की भी चिंता है कि वह स्कोर कितना स्थिर है।

यहाँ बताया गया है कि SAMPLe कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. "क्या होगा अगर" परीक्षण (Exploration बनाम Exploitation)
अधिकांश कोच बस कहते हैं, "तेज़ दौड़ो ताकि बेहतर समय मिल सके!" (इसे Exploitation कहा जाता है)। वे रोबोट को वर्तमान मानचित्र पर पूर्णतः सर्वोत्तम स्थान तक पहुँचने के लिए धकेलते हैं।
SAMPLe अलग है। रोबोट के एक स्थान पर स्थिर होने से पहले, SAMPLe पूछता है: "ठीक है, तुम एक बेहतरीन स्थान पर हो। लेकिन क्या होगा अगर तुमने बाईं ओर एक छोटा कदम लिया? या दाईं ओर एक कदम लिया? क्या तुम अभी भी अच्छा प्रदर्शन करोगे?"

  • यदि उत्तर है "नहीं, मैं ढलान से नीचे गिर जाऊँगा," तो SAMPLe कहता है, "ठीक है, यह स्थान बहुत तीखा (sharp) है। चलो एक सपाट क्षेत्र की तलाश करते हैं।"
  • यदि उत्तर है "हाँ, मैं अभी भी बहुत अच्छा कर रहा हूँ," तो SAMPLe कहता है, "बहुत बढ़िया! यह एक सुरक्षित, सपाट स्थान है। यहीं बने रहो।"

2. "दो-चरणीय" नृत्य (The "Two-Step" Dance)
पेपर बताता है कि SAMPLe रोबोट के सीखने के चरणों के साथ एक विशेष नृत्य करता है:

  • चरण A (दबाव/Push): यह वर्तमान डेटा को देखता है और कहता है, "अपने स्कोर को सुधारने के लिए इस दिशा में जाओ।"
  • चरण B (सुरक्षा जाँच/Safety Check): इसके बाद यह डेटा के संपूर्ण इतिहास को देखता है ताकि यह देखा जा सके कि क्या वह दिशा बहुत जोखिम भरी है। यह एक "सेफ्टी वेक्टर" (safety vector) की गणना करता है जो रोबोट को सीखने के परिदृश्य के खतरनाक, तीखे किनारों से दूर धकेलता है।
  • परिणाम: रोबोट उस दिशा में आगे बढ़ता है जो स्कोर में सुधार करता है लेकिन साथ ही उसे एक चौड़ी, सुरक्षित घाटी में भी रखता है।

3. यह दूसरों से बेहतर क्यों है?
पेपर SAMPLe की तुलना अन्य तरीकों (जैसे SAM, F-SAM, और SAGM) से करता है।

  • पुराने तरीके: कुछ बहुत आक्रामक हैं और रोबोट को बहुत अधिक धकेलते हैं, जिससे वह अस्थिर हो जाता है। अन्य बहुत कठोर हैं और डेटा के बदलते "भू-भाग" (terrain) के साथ अच्छी तरह अनुकूलित नहीं होते हैं।
  • SAMPLe: यह एक अनुभवी हाइकर (पर्वतारोही) की तरह है। वह जानता है कि कब एक पहाड़ी पर चढ़ने के लिए ज़ोर लगाना है (exploit) और कब थोड़ा भटकना है ताकि एक सुरक्षित, चौड़ा रास्ता मिल सके (explore)। यह गतिशील रूप से अपनी रणनीति को समायोजित करता है कि उस सटीक क्षण में रोबोट कैसा महसूस कर रहा है।

परिणाम: एक अधिक मजबूत रोबोट

लेखकों ने SAMPLe का परीक्षण 11 विभिन्न इमेज डेटासेट्स (जैसे पालतू जानवरों, कारों, फूलों और विमानों को पहचानना) पर किया और इसकी तुलना सर्वश्रेष्ठ मौजूदा तरीकों से की।

  • "बेस" बनाम "न्यू" का संतुलन: इन परीक्षणों में, रोबोट को कुछ श्रेणियों (Base) पर प्रशिक्षित किया जाता है और फिर उसे उन नई श्रेणियों पर टेस्ट किया जाता है जिन्हें उसने पहले कभी नहीं देखा (New)।
  • जीत: SAMPLe ने लगातार सबसे अच्छा संतुलन हासिल किया। इसने न केवल प्रशिक्षण डेटा पर उच्च स्कोर प्राप्त किया; बल्कि नए, कठिन डेटा का सामना करते समय भी अपने उच्च स्कोर को बनाए रखा।
  • उपमा: यदि अन्य तरीके उन छात्रों की तरह थे जिन्होंने पाठ्यपुस्तक रट ली लेकिन सरप्राइज क्विज़ में फेल हो गए, तो SAMPLe वह छात्र था जिसने अवधारणाओं (concepts) को इतनी अच्छी तरह समझा कि वह किसी भी प्रश्न का उत्तर दे सका, यहाँ तक कि उन प्रश्नों का भी जो किताब में नहीं थे।

सारांश

SAMPLe AI मॉडल को अनपेक्षित स्थितियों को संभालने की क्षमता को तोड़े बिना नए कार्य सिखाने का एक नया तरीका है। केवल प्रशिक्षण डेटा पर उच्चतम संभव स्कोर का पीछा करने के बजाय, यह एक ऐसे "सुरक्षित क्षेत्र" की तलाश करता है जहाँ मॉडल सटीक भी हो और मजबूत (robust) भी। यह सुनिश्चित करता है कि AI केवल उत्तरों को रटे नहीं बल्कि यह सीखे कि सामान्यीकरण (generalize) कैसे किया जाता है, जिससे यह वास्तविक दुनिया के अनुप्रयोगों के लिए एक बहुत अधिक विश्वसनीय उपकरण बन जाता है जहाँ डेटा हमेशा बदलता रहता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →