← नवीनतम पेपर
💬 NLP

LADDER: Language-Driven Slice Discovery and Error Rectification in Vision Classifiers

LADDER एक नवीन फ्रेमवर्क है जो विजन क्लासिफायर में व्यापक पूर्वाग्रह शमन (bias mitigation) के लिए सुसंगत, भाषा-संचालित एरर स्लाइस खोजने और छद्म-विशेषताओं (pseudo-attributes) को उत्पन्न करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो डोमेन ज्ञान और उन्नत तर्क को एकीकृत करके और स्पष्ट एनोटेशन की आवश्यकता के बिना पारंपरिक क्लस्टरिंग और विशेषता-आधारित विधियों की सीमाओं को दूर करता है।

मूल लेखक: Shantanu Ghosh, Rayan Syed, Chenyu Wang, Vaibhav Choudhary, Binxu Li, Clare B. Poynton, Shyam Visweswaran, Kayhan Batmanghelich

प्रकाशित 2026-08-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shantanu Ghosh, Rayan Syed, Chenyu Wang, Vaibhav Choudhary, Binxu Li, Clare B. Poynton, Shyam Visweswaran, Kayhan Batmanghelich

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को जानवरों को पहचानना सिखा रहे हैं। आप उसे बिल्लियों और कुत्तों की हजारों तस्वीरें दिखाते हैं, और वह अनुमान लगाने में बहुत माहिर हो जाता है। लेकिन फिर, आप एक अजीब बात देखते हैं: रोबोट वास्तव में यह नहीं सीख रहा है कि बिल्ली क्या होती है। इसके बजाय, वह शॉर्टकट का सहारा ले रहा है। वह बैकग्राउंड (पृष्ठभूमि) को देख रहा है। यदि बिल्ली हरी घास पर है, तो रोबोट सोचता है, "हरी घास? पक्का बिल्ली ही होगी!" लेकिन यदि आप उसे लाल कालीन पर बिल्ली दिखाते हैं, तो वह घबरा जाता है और "कुत्ता" होने का अनुमान लगाता है। इसे "बायस" (bias) कहा जाता है, और यह आर्टिफिशियल इंटेलिजेंस में एक चालाक समस्या है। रोबोट समझने की कठिन मेहनत करने के बजाय शॉर्टकट पर निर्भर है।

लंबे समय तक, वैज्ञानिकों ने इसे ठीक करने के लिए चीजों की एक विशाल चेकलिस्ट बनाने की कोशिश की, जैसे "क्या वहां घास है?" या "क्या वहां कोई पेड़ है?" लेकिन यह कुछ ऐसा है जैसे केवल लाल टोपी की जांच करके चोर को पकड़ने की कोशिश करना; क्या होगा अगर चोर नीली टोपी पहने हो? पुराने तरीके बहुत कठोर थे। वे लीक से हटकर नहीं सोच सकते थे, और वे अक्सर उन सूक्ष्म सुरागों को छोड़ देते थे जिनके कारण रोबोट विफल हो जाता था। यहीं पर एक नया विचार आता है: क्या होगा अगर हम बस रोबोट से पूछ सकें, "हे, तुमने यह गलत क्यों किया?" और उससे शब्दों का उपयोग करके खुद को समझाने के लिए कहें? यह वही बड़ा सवाल है जिसे यह शोध पत्र (paper) हल करता है।

यहाँ LADDER आता है, जो एक चतुर नए टूल की तरह है जो AI की गलतियों के लिए एक जासूस का काम करता है। रोबोट को पहले से बनी चेकलिस्ट में फिट करने के बजाय, LADDER एक सुपर-स्मार्ट भाषा मस्तिष्क (जिसे लार्ज लैंग्वेज मॉडल या LLM कहा जाता है) का उपयोग यह पता लगाने के लिए करता है कि रोबोट क्यों विफल हो रहा है। इसे इस तरह सोचें: यदि रोबोट एक परीक्षा देने वाला छात्र है, तो पुराने तरीके एक ऐसे शिक्षक की तरह थे जो केवल यह देखते थे कि छात्र ने सही उत्तर लिखा है या नहीं। LADDER एक ऐसे शिक्षक की तरह है जो छात्र के रफ वर्क (स्क्रैच पेपर) को पढ़ता है, देखता है कि उसका ध्यान खिड़की के बाहर उड़ते पक्षी पर भटक गया था, और कहता है, "आह! तुम गणित में असफल नहीं हुए क्योंकि तुम्हें गणित नहीं आता; तुम इसलिए असफल हुए क्योंकि तुम्हारा ध्यान पक्षी पर था!"

LADDER अपना जादू कैसे चलाता है, यहाँ बताया गया है। सबसे पहले, यह उन तस्वीरों को देखता है जिन्हें रोबोट ने सही पहचाना और उन्हें भी जिन्हें उसने गलत पहचाना। फिर यह एक भाषा विशेषज्ञ (LLM) से उन तस्वीरों के विवरण या "कैप्शन" को पढ़ने के लिए कहता है। भाषा विशेषज्ञ एक आवर्धक लेंस (magnifying glass) के साथ एक जासूस की तरह है, जो सुरागों के लिए टेक्स्ट को स्कैन कर रहा है। वह कह सकता है, "एक मिनट रुकिए! हर बार जब रोबोट ने 'न्यूमोथोरैक्स' (फेफड़ों की एक स्थिति) का निदान सही किया, तो रिपोर्ट में 'चेस्ट ट्यूब' का उल्लेख था। लेकिन जब यह गलत हुआ, तो चेस्ट ट्यूब गायब थी!" रोबोट फेफड़ों को नहीं देख रहा था; वह बस ट्यूब को देख रहा था।

एक बार जब LADDER इन चालाक पैटर्न को पकड़ लेता है, तो वह केवल उन्हें बताता नहीं है; वह उन्हें ठीक भी करता है। यह नियमों का एक नया सेट (जिसे "स्यूडो-लेबल्स" कहा जाता है) बनाता है ताकि रोबोट को चेस्ट ट्यूब को अनदेखा करने और वास्तव में फेफड़ों को देखने के लिए सिखाया जा सके। यह छात्र को यह बताने जैसा है कि, "अगली बार, पक्षी को अनदेखा करें और गणित की समस्या पर ध्यान केंद्रित करें।" इस शोध पत्र ने इसे जंगलों में पक्षियों को खोजने से लेकर मेडिकल स्कैन में कैंसर खोजने जैसे तमाम कठिन कार्यों पर परखा। उन्होंने इसे 200 से अधिक अलग-अलग रोबोट दिमागों पर आजमाया और पाया कि LADDER पुराने चेकलिस्ट तरीकों की तुलना में इन छिपी हुई गलतियों को खोजने में बहुत बेहतर था।

सबसे अच्छी बात? LADDER को यह लिखने की आवश्यकता नहीं है कि उसे किन चीजों को देखना चाहिए। वह खुद ही चित्रों के साथ आने वाले टेक्स्ट को पढ़कर इसे समझ लेता है। वास्तव में, जब उन्होंने मेडिकल इमेज पर इसका परीक्षण किया, तो LADDER ने ऐसे बायस (biases) खोज निकाले जिन्हें पुराने तरीके भी मिस कर गए थे, जैसे कि मरीज की उम्र या एक्स-रे लेने के लिए उपयोग किए जाने वाले विशिष्ट मशीन के प्रकार से रोबोट का भ्रमित होना। यह शोध पत्र सुझाव देता है कि इस भाषा-आधारित जासूसी कार्य का उपयोग करके, हम AI को बहुत अधिक निष्पक्ष और विश्वसनीय बना सकते हैं, विशेष रूप से चिकित्सा जैसे महत्वपूर्ण क्षेत्रों में जहाँ सही उत्तर प्राप्त करना सबसे अधिक मायने रखता है। यह कोई जादुई छड़ी नहीं है जो सब कुछ तुरंत हल कर देती है, लेकिन यह हमारी AI की बात सुनने और उसे सही सबक सीखने में मदद करने का एक शक्तिशाली नया तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →