← नवीनतम पेपर
🤖 machine learning

Neutral-Reference Prompting for Vision-Language Models

यह शोध पत्र NeRP का प्रस्ताव करता है, जो एक प्लग-एंड-प्ले प्रॉम्प्टिंग सुधार रणनीति है जो न्यूट्रल टेक्स्ट प्रॉम्प्ट्स और रेफरेंस इमेजेस का लाभ उठाकर विजन-लैंग्वेज मॉडल्स में बेस-न्यू ट्रेड-ऑफ को कम करती है, ताकि बिना मॉडल पैरामीटर्स को संशोधित किए अनदेखी क्लासेज पर पूर्व-प्रधान (prior-dominated) गलत भविष्यवाणियों को सुधारा जा सके।

मूल लेखक: Senmao Tian, Xiang Wei, Shunli Zhang

प्रकाशित 2026-05-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Senmao Tian, Xiang Wei, Shunli Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Neutral-Reference Prompting for Vision–Language Models" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके किया गया स्पष्टीकरण दिया गया है।

मुख्य समस्या: AI मॉडल्स की "जलन" (Jealousy)

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान छात्र (एक AI मॉडल) है जिसने हजारों चित्रों और शब्दों का अध्ययन किया है। आप चाहते हैं कि यह छात्र उन विषयों पर एक नया टेस्ट दे जो उसने पहले कभी नहीं देखे हैं।

आमतौर पर, जब हम इस छात्र को इस नए टेस्ट के लिए अध्ययन करने में मदद करने की कोशिश करते हैं, तो हमें Base–New Trade-off नामक एक समस्या का सामना करना पड़ता है। यह कुछ ऐसा है: यदि आप छात्र को नए उत्तरों को पूरी तरह से याद करने के लिए मजबूर करते हैं, तो वह अचानक उन पुराने उत्तरों को भूल जाता है जिन्हें वह पहले से जानता था। यदि आप उसे पुराने उत्तर याद रखने के लिए मजबूर करते हैं, तो वह नए वाले करने में विफल रहता है। यह एक 'जीरो-सम गेम' (zero-sum game) है।

अधिकांश शोधकर्ताओं का मानना था कि यह इसलिए होता है क्योंकि छात्र "ओवरफिटिंग" (overfitting) कर रहा था—मूल रूप से, बहुत अधिक रट लेना और अपनी सामान्य सोचने की क्षमता खो देना। लेकिन यह पेपर तर्क देता है कि यह कहानी का केवल आधा हिस्सा है।

खोज: विषम भ्रम (Asymmetric Confusion)

लेखकों ने ध्यान दिया कि AI गलतियाँ कैसे करता है, इसमें एक अजीब सा व्यवहार होता है। आइए इसे Asymmetric Confusion कहें।

कल्पना कीजिए कि AI सेब (Apples) और आडू (Peaches) की तस्वीरें देख रहा है।

  • Symmetric Confusion (सममित भ्रम): AI समान रूप से भ्रमित है। वह 50% बार सेब को आडू समझ लेता है, और 50% बार आडू को सेब। यह केवल ईमानदार भ्रम है क्योंकि वे दिखने में समान हैं।
  • Asymmetric Confusion (विषम भ्रम): AI पक्षपाती (biased) है। वह 90% बार सेब को आडू समझ लेता है, लेकिन वह लगभग कभी भी आडू को सेब नहीं समझता।

क्यों? क्योंकि अपने मूल प्रशिक्षण के दौरान, AI ने एक "वरीयता" या "पूर्वाग्रह" विकसित कर लिया था। हो सकता कि उसने कुछ संदर्भों में आडू की अधिक तस्वीरें देखी हों, या उसके टेक्स्ट विवरण एक दूसरे के पक्ष में झुके हुए हों। इसलिए, जब वह एक धुंधली तस्वीर देखता है, तो उसका दिमाग स्वचालित रूप से "आडू" की ओर झुक जाता है, भले ही तस्वीर स्पष्ट रूप से एक सेब हो।

उन क्लासों के लिए जिन्हें AI पहले से देख चुका है (Base classes), हम इस पूर्वाग्रह को सही ढंग से सिखाकर ठीक कर सकते हैं। लेकिन नई, अनदेखी क्लासों के लिए, AI अपने पुराने, पक्षपाती सहज ज्ञान (instincts) पर निर्भर रहता है, और यह पूर्वाग्रह उसके प्रदर्शन को नुकसान पहुँचाता है।

समाधान: NeRP (द "न्यूट्रल रेफरेंस" चेक)

लेखक NeRP नामक एक विधि प्रस्तावित करते हैं। NeRP को AI को सिखाने का नया तरीका मानने के बजाय, इसे एक दूसरी राय या रियलिटी चेक के रूप में सोचें जो AI द्वारा उत्तर देने से ठीक एक सेकंड पहले होता है।

यह कैसे काम करता है, यहाँ एक पक्षपाती जज की उपमा दी गई है:

  1. न्यूट्रल रेफरेंस (तटस्थ संदर्भ): कल्पना कीजिए कि आप जज को एक "न्यूट्रल" छवि देखने के लिए कहते हैं—एक धुंधली, सामान्य फोटो जिसमें कोई विशिष्ट वस्तु नहीं है—और एक न्यूट्रल वाक्य जैसे "एक वस्तु की फोटो।"
  2. पूर्वाग्रह को मापना: यह देखकर कि जज न्यूट्रल इनपुट पर कैसी प्रतिक्रिया देता है, हम उनके अंतर्निहित पूर्वाग्रह को माप सकते हैं। उदाहरण के लिए, यदि जज न्यूट्रल फोटो को देखता है और कहता है, "यह सेब की तुलना में आडू जैसा दिखता है," तो हम जानते हैं कि जज का स्वाभाविक झुकाव आडू की ओर है।
  3. सुधार (The Correction): अब, जब जज एक वास्तविक, विशिष्ट तस्वीर (साक्ष्य) को देखता है, तो NeRP दो चीजें जाँचता है:
    • साक्ष्य (The Evidence): तस्वीर कितनी स्पष्ट रूप से एक सेब की तरह दिख रही है?
    • पूर्वाग्रह (The Bias): जज की पूर्व-निर्धारित वरीयता (आडू के प्रति) कितनी मजबूत है?

यदि तस्वीर स्पष्ट रूप से एक सेब है (मजबूत साक्ष्य), लेकिन जज अपने पूर्वाग्रह के कारण "आडू" कहने वाला है, तो NeRP हस्तक्षेप करता है। यह कहता है, "रुको, साक्ष्य मजबूत है, लेकिन तुम्हारा पूर्वाग्रह तुम्हें गलत दिशा में खींच रहा है। अपना निर्णय बदलो।"

हालाँकि, यदि तस्वीर वास्तव में धुंधली और अस्पष्ट है (कमजोर साक्ष्य), तो NeRP निर्णय को अकेला छोड़ देता है। यह केवल तभी सुधार करता है जब AI अपने पूर्वाग्रह के कारण गलत तरीके से आत्मविश्वासी (wrongly confident) होता है, न कि तब जब वह वास्तव में अनिश्चित होता है।

यह क्यों काम करता है

  • यह प्लग-एंड-प्ले है: आपको AI को फिर से प्रशिक्षित करने या उसके मस्तिष्क को बदलने की आवश्यकता नहीं है। NeRP मौजूदा तरीकों के ऊपर बैठता है और अंतिम उत्तर को थोड़ा बदल देता है।
  • यह पुराने ज्ञान को बचाता है: क्योंकि NeRP केवल नई क्लासों पर विशिष्ट पक्षपाती त्रुटियों को ठीक करता है, यह पुरानी क्लासों को पहचानने की AI की क्षमता को खराब नहीं करता है।
  • यह कुशल है: यह वास्तविक साक्ष्य के विरुद्ध "न्यूट्रल" पूर्वाग्रह की तुलना करने के लिए सरल गणित का उपयोग करता है।

परिणाम

लेखकों ने विभिन्न प्रकार की छवियों (जानवर, कारें, फूल, सैटेलाइट आदि) पर इसका परीक्षण किया। उन्होंने पाया कि:

  • AI उन नई चीजों को पहचानने में बहुत बेहतर हो गया जिन्हें उसने पहले नहीं देखा था।
  • AI उन पुरानी चीजों को पहचानने में खराब नहीं हुआ जिन्हें वह पहले से जानता था।
  • यह विभिन्न अलग-अलग AI मॉडल्स के साथ काम करता है, जो एक सार्वभौमिक "बायस करेक्टर" (bias corrector) के रूप में कार्य करता है।

संक्षेप में

यह पेपर पहचान करता है कि AI मॉडल्स में छिपे हुए "पूर्वाग्रह" होते हैं जो उन्हें व्यवस्थित रूप से एक चीज़ को दूसरी चीज़ समझने के लिए मजबूर करते हैं (Asymmetric Confusion)। AI को इस पूर्वाग्रह को भूलने के लिए फिर से प्रशिक्षित करने के बजाय, लेखकों ने NeRP बनाया, जो एक हल्का टूल है जो "न्यूट्रल" उदाहरणों का उपयोग करके इस पूर्वाग्रह को मापता है। इसके बाद यह एक रेफरी की तरह काम करता है, AI के उत्तर को केवल तभी सुधारता है जब AI अपने पूर्वाग्रह को वास्तविक दृश्य साक्ष्य (visual evidence) पर हावी होने देता है। यह AI को पुराने को भूले बिना नई चीजें सीखने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →