← नवीनतम पेपर
🤖 AI

Symbal: Detecting Systematic Misalignments in Model-Generated Captions

यह शोधपत्र Symbal को प्रस्तुत करता है, जो फाउंडेशन मॉडल्स का उपयोग करने वाली एक द्वि-चरणीय विधि है जिसका उपयोग छवियों और MLLM-जनित कैप्शन के बीच व्यवस्थित विसंगतियों का पता लगाने और उनका सारांश प्रस्तुत करने के लिए किया जाता है, साथ ही SymbalBench को भी प्रस्तुत करता है, जो एक बड़े पैमाने का बेंचमार्क है जो अंतर्निहित मॉडल्स तक पहुँच की आवश्यकता के बिना इमेज-टेक्स्ट डेटासेट के ऑडिट करने में Symbal के उत्कृष्ट प्रदर्शन को प्रदर्शित करता है।

मूल लेखक: Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz

प्रकाशित 2026-07-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपने आस-पास की दुनिया का वर्णन करना सिखा रहे हैं। आप उसे एक कुत्ते की तस्वीर दिखाते हैं और पूछते हैं, "तुम्हें क्या दिख रहा है?" एक स्मार्ट रोबोट कह सकता है, "पार्क में दौड़ता हुआ एक रोएँदार कुत्ता।" लेकिन कभी-कभी, इन रोबोट के दिमाग थोड़े ज़्यादा रचनात्मक हो जाते हैं या कुछ अजीब आदतों को पकड़ लेते हैं। वे समुद्र तट पर एक कुत्ते की तस्वीर देखकर कह सकते हैं, "एक कुत्ता सैंडविच खा रहा है," भले ही वहाँ कोई सैंडविच न हो। ऐसा इसलिए होता है क्योंकि रोबोट ने सीखा है कि "कुत्ते" और "सैंडविच" अक्सर एक साथ दिखाई देते हैं, इसलिए वह मान लेता है कि वे वहाँ होने ही चाहिए, भले ही वे वहाँ न हों।

यह मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) की दुनिया है—सुपर-स्मार्ट कंप्यूटर जो चित्रों को देख सकते हैं और उनके बारे में वाक्य लिख सकते हैं। वे अद्भुत हैं, लेकिन उनमें एक छिपी हुई खामी है: वे कभी-कभी एक ही गलती बार-बार करते हैं। यदि कोई रोबोट किसी विशिष्ट वस्तु को देखता है, जैसे कि मेडिकल एक्स-रे में पेसमेकर, तो वह हमेशा गलत तरीके से दावा कर सकता है कि रोगी को हृदय रोग है, भले ही हृदय बिल्कुल ठीक दिख रहा हो। ये केवल रैंडम टाइपो नहीं हैं; ये "सिस्टमैटिक मिसअलाइनमेंट्स" (systematic misalignments) हैं, जिसका अर्थ है कि रोबोट का एक विशिष्ट, दोहराव वाला ब्लाइंड स्पॉट है। वैज्ञानिक इस बात पर ध्यान देते हैं क्योंकि यदि हम इन रोबोटों का उपयोग डॉक्टरों के लिए रिपोर्ट लिखने या दृष्टिहीनों के लिए फोटो का वर्णन करने के लिए करते हैं, तो हमें यह जानना होगा कि उनके दिमाग में गड़बड़ी कहाँ हो रही है ताकि हम उन्हें ठीक कर सकें।

यहाँ आता है SYMBAL, एक नया जासूसी टूल जिसे शोधकर्ता माया वर्मा और उनकी टीम ने इन दोहराव वाली रोबोट की "झूठ" को पकड़ने के लिए बनाया है। SYMBAL को एक सुपर-व्यवस्थित लाइब्रेरियन की तरह समझें जो केवल एक समय में एक किताब नहीं पढ़ता, बल्कि पैटर्न खोजने के लिए लाखों किताबों को स्कैन करता है। एक एकल चित्र और उसके कैप्शन को देखने के बजाय, SYMBAL एक साथ हजारों को देखता है ताकि एक बड़े सवाल का जवाब दे सके: "क्या तस्वीरों में कोई ऐसी विशिष्ट चीज़ है जो रोबोट को लगातार कुछ गलत कहने के लिए प्रेरित करती है?"

शोधकर्ताओं ने SYMBAL को दो चतुर चरणों में काम करने के लिए बनाया है, जो एक दो-चरणीय जांच की तरह है। पहले, यह टूल एक टेक्स्ट डिटेक्टिव (पाठ जासूस) के रूप में कार्य करता है। यह हजारों रोबोट-जनित कैप्शन को पढ़ता है, उन वाक्यों को एक साथ समूहबद्ध करता है जो समान बातें कहते हैं, और पूछता है, "इनमें से कौन सा समूह सबसे अधिक झूठ बोल रहा है?" यह गणित का उपयोग करके यह मापता है कि पाठ वास्तविक छवि के साथ कितना असहमत है। एक बार जब यह वाक्यों के उस समूह को ढूंढ लेता है जो सबसे अधिक गलत होने की संभावना रखता है, तो यह उस झूठ को एक एकल अवधारणा में सारांशित करता है, जैसे कि "रोबोट बार-बार 'कार्डियोमेगाली' (बढ़ा हुआ हृदय) कह रहा है।"

दूसरे चरण में, SYMBAL एक विजुअल डिटेक्टिव (दृश्य जासूस) बन जाता है। यह उस विशिष्ट झूठ के साथ जुड़ी सभी तस्वीरों को लेता है और पूछता है, "इन तस्वीरों में क्या समानता है?" यह छवियों को एक साथ समूहित करता है और एक आवर्ती दृश्य विशेषता (visual feature) की तलाश करता है। हमारे उदाहरण में, यह खोज सकता है कि हर बार जब रोबले ने "कार्डियोमेगाली" कहा, तो तस्वीर में वास्तव में एक "पेसमेकर" (एक चिकित्सा उपकरण) मौजूद था। SYMBAL फिर कड़ियों को जोड़ता है और रिपोर्ट करता है: "रोबोट व्यवस्थित रूप से पेसमेकर को हृदय की स्थिति के साथ भ्रमित कर रहा है।"

यह परीक्षण करने के लिए कि उनका जासूस कितना अच्छा है, टीम ने त्रुटि-पहचान उपकरणों के परीक्षण के लिए एक विशाल प्रशिक्षण मैदान बनाया, जिसे SYMBAL-BENCH कहा जाता है। उन्होंने केवल उम्मीद नहीं की; उन्होंने 1.7 मिलियन इमेज-टेक्स्ट पेयर्स का उपयोग करके 420 अलग-अलग परीक्षण परिदृश्य बनाए। उन्होंने प्राकृतिक तस्वीरों और मेडिकल एक्स-रे के वास्तविक डेटासेट लिए, और फिर गुप्त रूप से उनमें विशिष्ट, नकली त्रुटियां डालीं ताकि यह देखा जा सके कि क्या SYMBAL उन्हें ढूंढ पाता है। यह एक बगीचे में एक विशिष्ट प्रकार का कीड़ा छिपाने और यह देखने जैसा था कि क्या माली उसे ढूंढ पाता है।

परिणाम प्रभावशाली थे। SYMBAL ने इन व्यवस्थित त्रुटियों को 63.8% टेस्ट डेटासेट्स में सफलतापूर्वक पहचाना। इसे समझने के लिए, अगली सर्वश्रेष्ठ विधि, जो बिना चरणों में तोड़े एक ही बड़ी छलांग में उत्तर का अनुमान लगाने की कोशिश करती थी, केवल 17.1% बार ही सही हो पाई। यह सुझाव देता है कि समस्या को दो छोटे, संरचित चरणों में तोड़ने की रणनीति एक विशाल AI से सीधे "पैटर्न का अनुमान लगाने" के लिए पूछने की तुलना में बहुत बेहतर है।

टीम ने SYMBAL को लैब से बाहर निकालकर वास्तविक दुनिया में भी उतारा। उन्होंने चार अलग-अलग लोकप्रिय रोबोट मॉडल द्वारा जनित कैप्शन का ऑडिट करने के लिए इसका उपयोग किया। एक मामले में, उन्होंने पाया कि जब एक रोबोट ने तस्वीर में एक बस देखी, तो उसमें ज़मीन पर हैंडबैग होने का गलत दावा करने की एक मजबूत आदत थी। दूसरे मामले में, उन्होंने पाया कि एक रोबोट अक्सर तस्वीर में संकेतों (signs) पर मौजूद ऐसे टेक्स्ट का आविष्कार करता था जो वास्तव में वहां नहीं था। ये निष्कर्ष साबित करते हैं कि SYMBAL बिना यह जाने कि रोबोट कैसे बनाया गया था या उसके आंतरिक कोड तक पहुंच प्राप्त किए, इन छिपी हुई, दोहराव वाली त्रुटियों को पहचान सकता है।

अंततः, यह पेपर सुझाव देता है कि SYMBAL भविष्य के रोबोटों को प्रशिक्षित करने के लिए उपयोग किए जाने वाले डेटा के "ऑडिट" करने के लिए एक शक्तिशाली उपकरण है। इन व्यवस्थित मिसअलाइनमेंट्स को ढूंढकर, हम रोबोटों को गलत आदतें सीखने से पहले ही रोक सकते हैं। जैसा कि लेखक नोट करते हैं, यह चिकित्सा जैसे सुरक्षा-महत्वपूर्ण क्षेत्रों के लिए महत्वपूर्ण है, जहाँ एक रोबोट द्वारा पेसमेकर को हृदय की स्थिति के रूप में भ्रमित करना गंभीर गलतियाँ पैदा कर सकता है। हालाँकि SYMBAL सब कुछ तुरंत ठीक करने वाली कोई जादुई छड़ी नहीं है, लेकिन यह हमारे AI साथियों के गलत होने के विशिष्ट तरीकों पर रोशनी डालने का एक स्पष्ट, संरचित तरीका प्रदान करता है, जिससे भविष्य के लिए बेहतर, अधिक विश्वसनीय मॉडल बनाने में मदद मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →