← नवीनतम पेपर
🤖 AI

When Prompts Ignore Structure: Graph-Based Attribute Reasoning for Calibrated VLMs

यह शोध पत्र ARGTCA का प्रस्ताव करता है, जो एक ग्राफ-आधारित फ्रेमवर्क है जो एक सिम्बोलिक एट्रिब्यूट ग्राफ और ग्राफ अटेंशन नेटवर्क के माध्यम से अंतर-विशेषता निर्भरताओं (inter-attribute dependencies) को मॉडल करता है ताकि टेस्ट-टाइम अडैप्टेशन के दौरान विजन-लैंग्वेज मॉडल्स के कैलिब्रेशन में महत्वपूर्ण सुधार किया जा सके, जो उन मौजूदा तरीकों से बेहतर प्रदर्शन करता है जो विशेषताओं को स्वतंत्र रूप से मानते हैं।

मूल लेखक: Tanay Sodha, Aditya Sharma, Ramya Hebbalaguppe, Vinti Agarwal, Pranav Murthy Yeluripaty

प्रकाशित 2026-07-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tanay Sodha, Aditya Sharma, Ramya Hebbalaguppe, Vinti Agarwal, Pranav Murthy Yeluripaty

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान लाइब्रेरियन (AI मॉडल) है जिसने लाखों किताबें पढ़ी हैं और लाखों तस्वीरें देखी हैं। यह लाइब्रेरियन किसी फोटो को देखकर ही यह पहचानने में माहिर है कि वह क्या है, भले ही उसने उस विशिष्ट फोटो को पहले कभी न देखा हो। इसे "जीरो-शॉट" (zero-shot) लर्निंग कहा जाता है।

हालाँकि, एक समस्या है: लाइब्रेरियन अक्सर खुद पर बहुत अधिक भरोसा करने लगता है।

यदि लाइब्रेरियन 99% आत्मविश्वास के साथ अनुमान लगाता है कि "यह एक बिल्ली है", लेकिन वास्तव में वह एक कुत्ता है, तो वह मिसकैलिब्रेटेड (miscalibrated) है। वह अति-आत्मविश्वासी है। वास्तविक दुनिया में, यदि कोई AI चिकित्सा निदान या सेल्फ-ड्राइविंग कार के निर्णय के बारे में अति-आत्मविश्वासी है, तो यह खतरनाक हो सकता है।

पिछले सुधारों के साथ समस्या

वैज्ञानिकों ने लाइब्रेरियन को कुछ वर्णनात्मक शब्द (विशेषताएं/attributes) देकर इसे ठीक करने की कोशिश की। उदाहरण के लिए, केवल "तेंदुआ" कहने के बजाय, वे कह सकते हैं "तेंदुआ: धब्बेदार, जंगली, बिल्ली।"

लेकिन पुराने तरीके में एक दोष था: उन्होंने शब्दों को यादों की एक सपाट सूची (flat list) की तरह माना।

  • उन्हें यह समझ नहीं आया कि "धब्बेदार" (spotted) और "बिंदीदार" (dotted) लगभग एक ही बात हैं।
  • उन्हें यह समझ नहीं आया कि "स्तनधारी" (mammal) एक ऐसा शब्द है जो तेंदुए, डॉल्फिन और बीवर तीनों के लिए उपयोग किया जाता है, इसलिए यह उनमें अंतर करने के लिए बहुत उपयोगी नहीं है।

क्योंकि लाइब्रेरियन इन शब्दों के बीच के संबंधों को नहीं समझता था, इसलिए वह अभी भी भ्रमित और अति-आत्मविश्वासी बना रहा।

नया समाधान: ARGTCA (शब्दों का "सोशल नेटवर्क")

इस शोध पत्र के लेखकों ने, ARGTCA ने, शब्दों को एक सपाट सूची के रूप में देखना बंद कर दिया और उन्हें एक सोशल नेटवर्क की तरह मानना शुरू किया।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, इस सरल उपमा का उपयोग करते हुए:

1. मानचित्र बनाना (ग्राफ)

कल्पना कीजिए कि आप एक शहर का नक्शा बना रहे हैं।

  • नोड्स (Nodes): प्रत्येक शब्द (जैसे "फर", "पानी", "शिकारी") मानचित्र पर एक इमारत है।
  • सड़कें (Edges): आप उन इमारतों के बीच सड़कें बनाते हैं जो एक-दूसरे से संबंधित हैं।
    • यदि दो शब्द एक ही जानवर का वर्णन करते हैं (जैसे तेंदुए के लिए "फर" और "शिकारी"), तो आप उनके बीच एक सड़क बनाते हैं।
    • यदि दो शब्द अलग-अलग जानवरों द्वारा साझा किए जाते हैं (जैसे डॉल्फिन और बीवर दोनों के लिए "पानी"), तो आप विभिन्न मोहल्लों को जोड़ने के लिए एक सड़क बनाते हैं।

यह मानचित्र एक सिंबोलिक एट्रिब्यूट ग्राफ (Symbolic Attribute Graph) कहलाता है। यह कैप्चर करता है कि शब्द एक-दूसरे से कैसे संबंधित हैं, न कि केवल वे कागज पर कैसे दिखते हैं।

2. स्मार्ट टूर गाइड (GAT)

एक बार जब मानचित्र बन जाता है, तो वे एक "स्मार्ट टूर गाइड" (ग्राफ अटेंशन नेटवर्क - GAT) को घूमने के लिए भेजते हैं।

  • गाइड सीखता है कि "तेंदुए" के मोहल्ले में "फर" और "शिकारी" एक-दूसरे के करीबी पड़ोसी हैं।
  • गाइड यह भी सीखता है कि "पानी" एक व्यस्त चौराहा है जो "डॉल्फिन" और "बीवर" के मोहल्लों को जोड़ता है।
  • गाइड इन शब्दों की उनकी परिभाषाओं के आधार पर नहीं, बल्कि उनके संबंधों के आधार पर एक नई, स्मार्ट समझ विकसित करता है।

3. सर्वश्रेष्ठ शब्दों का चयन (रणनीति)

अब, जब लाइब्रेरियन को किसी फोटो की पहचान करनी होती है, तो वह केवल उन पहले शब्दों को नहीं पकड़ता जो उसके दिमाग में आते हैं। वह सबसे अच्छे शब्दों को चुनने के लिए टूर गाइड के मानचित्र का उपयोग करता है:

  • रणनीति A (ARGTCA-DIV - "विविध पार्टी"): लाइब्रेरियन ऐसे शब्द चुनता है जो एक ही जानवर के समूह के भीतर एक-दूसरे से बहुत अलग हों। "फर" और "फर्री" (जो बहुत समान हैं) चुनने के बजाय, वे "फर" और "शिकारी" चुनते हैं। यह जानवर की एक व्यापक, अधिक पूर्ण तस्वीर देता है, जिससे लाइब्रेरियन एक संकीर्ण, अति-आत्मविश्वासी लूप में फंसने से बच जाता है।

  • रणनीति B (ARGTCA-DISC - "अद्वितीय पहचान"): लाइब्रेरियन ऐसे शब्द चुनता है जो अन्य जानवरों के लिए उपयोग किए जाने वाले शब्दों से बहुत दूर होते हैं। वे "पानी" (क्योंकि डॉल्फिन और बीवर दोनों इसका उपयोग करते हैं) से बचते हैं और "दहाड़" या "धब्बे" (जो तेंदुए के लिए अद्वितीय हैं) जैसे शब्द चुनते हैं। यह लाइब्रेरियन को जानवरों के बीच स्पष्ट अंतर करने में मदद करता है।

परिणाम

इस शोध पत्र ने 9 अलग-अलग इमेज डेटासेट (जैसे कारों, फूलों और जानवरों की तस्वीरें) पर इस नई पद्धति का परीक्षण किया।

  • पुराना तरीका: लाइब्रेरियन अक्सर अति-आत्मविश्वासी होता था (यह सोचते हुए कि वह सही है जबकि वह गलत था) या कभी-कभी बहुत अनिश्चित होता था।
  • नया तरीका (ARGTC): लाइब्रेरियन बहुत अधिक कैलिब्रेटेड (calibrated) हो गया।
    • जब वे कहते थे कि वे 90% सुनिश्चित हैं, तो वे वास्तव में 90% बार सही होते थे।
    • उन्होंने पिछले सर्वोत्तम तरीकों की तुलना में "कॉन्फिडेंस एरर" (विश्वास त्रुटि) को लगभग 37% कम कर दिया।

मुख्य निष्कर्ष

यह शोध पत्र तर्क देता है कि AI को भरोसेमंद बनाने के लिए, हमें केवल उसे अधिक डेटा या बेहतर शब्द देने की आवश्यकता नहीं है। हमें AI को यह सिखाना होगा कि वे शब्द एक-दूसरे से कैसे जुड़े हैं। शब्दों का एक "सोशल नेटवर्क" बनाकर और उस नेटवर्क का उपयोग करके सबसे सहायक, अद्वितीय और विविध विवरण चुनने से, AI कम अहंकारी और अपने आत्मविश्वास में अधिक सटीक हो जाता है।

नोट: लेखक विशेष रूप से उल्लेख करते हैं कि यह AI के अपने आत्मविश्वास (कैलिब्रेशन) के आकलन को बेहतर बनाने के लिए है। वे यह दावा नहीं करते हैं कि यह विधि वर्तमान में रोगों के निदान या ड्राइविंग जैसे विशिष्ट वास्तविक दुनिया के उपयोगों के लिए तैयार है, हालांकि वे नोट करते हैं कि बेहतर कैलिब्रेशन उन सुरक्षा-महत्वपूर्ण अनुप्रयोगों के लिए एक आवश्यक कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →