← नवीनतम पेपर
🤖 AI

Can We Trust a Black-box LLM? LLM Untrustworthy Boundary Detection via Bias-Diffusion and Multi-Agent Reinforcement Learning

यह शोध पत्र GMRL-BD प्रस्तुत करता है, जो एक नवीन ब्लैक-बॉक्स एल्गोरिदम है जो विकिपीडिया-व्युत्पन्न नॉलेज ग्राफ और मल्टी-एजेंट रिइन्फोर्समेंट लर्निंग का लाभ उठाकर उन विषयों की पहचान करके बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) की अविश्वसनीय सीमाओं का कुशलतापूर्वक पता लगाता है जो पक्षपाती प्रतिक्रियाओं के प्रति संवेदनशील हैं, जिसके साथ ही ललामा2 (Llama2) और विकुना (Vicuna) जैसे लोकप्रिय मॉडलों को कवर करने वाला एक नया डेटासेट भी जारी किया गया है।

मूल लेखक: Xiaotian Zhou, Di Tang, Xiaofeng Wang, Xiaozhong Liu

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaotian Zhou, Di Tang, Xiaofeng Wang, Xiaozhong Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, विद्वान रोबोट मित्र (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो आपके द्वारा पूछे गए लगभग किसी भी प्रश्न का उत्तर दे सकता है। आपको उससे इतिहास, विज्ञान और फिल्मों के बारे में पूछना बहुत पसंद है। लेकिन कभी-कभी, जब आप उससे राजनीति, आव्रजन (immigration), या धर्म जैसे संवेदनशील विषयों के बारे में पूछते हैं, तो रोबोट ऐसे उत्तर देने लगता है जो पक्षपाती, अनुचित या बिल्कुल गलत होते हैं। यह ऐसा है जैसे रोबोट के पास एक छिपा हुआ "ब्लाइंड स्पॉट" (अंधा कोना) है जहाँ उसका निर्णय धुंधला हो जाता है।

बड़ी समस्या यह है कि आप जानते भी नहीं हैं कि वे ब्लाइंड स्पॉट कहाँ हैं। और चूंकि रोबोट एक "ब्लैक बॉक्स" है (आप उसके दिमाग के अंदर नहीं देख सकते कि वह कैसे सोचता है), इसलिए आप सीधे उससे यह नहीं पूछ सकते, "हे, क्या तुम X के बारे में पक्षपाती हो?" वह झूठ बोल सकता है या उसे पता भी नहीं चलेगा कि वह पक्षपाती है।

यह शोध पत्र बिना रोबोट का दिमाग खोले, इन ब्लाइंड स्पॉट्स का मानचित्र बनाने का एक चतुर नया तरीका पेश करता है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. मानचित्र: नॉलेज ग्राफ (Knowledge Graph)

कल्पना कीजिए कि दुनिया के सभी विषय एक विशाल सबवे मैप की तरह आपस में जुड़े हुए हैं।

  • स्टेशन: प्रत्येक स्टेशन एक विषय है (जैसे, "आप्रवास/Immigration," "अर्थव्यवस्था," "AI")।
  • ट्रैक्स: ट्रैक संबंधित विषयों को जोड़ते हैं। यदि आप "आप्रवास" पर हैं, तो ट्रैक आपको "शरणार्थी," "सीमा नीति," और "मानवाधिकारों" तक ले जाते हैं।

शोधकर्ताओं ने विकिपीडिया की श्रेणियों पर आधारित एक मानचित्र का उपयोग किया। यह एक विशाल, व्यवस्थित मानचित्र है जहाँ हर चीज़ किसी न किसी से जुड़ी हुई है।

2. सिद्धांत: पक्षपात का "संक्रमण" (Contagion of Bias)

शोधकर्ताओं ने एक दिलचस्प बात देखी: पक्षपात संक्रामक होता है।
यदि रोबोट "आप्रवास" के बारे में पक्षपाती उत्तर देता है, तो इसकी पूरी संभावना है कि वह "शरणार्थी" या "सीमा नीति" के बारे में भी पक्षपाती उत्तर देगा क्योंकि वे मानचित्र पर एक-दूसरे के ठीक बगल में स्थित हैं।

  • उपमा: इसे एक जुकाम की तरह समझें। यदि एक कमरे में एक व्यक्ति को जुकाम है, तो उसके ठीक बगल में बैठे लोगों के बीमार होने की संभावना सबसे अधिक होती। आपको पूरी इमारत के हर व्यक्ति की जांच करने की आवश्यकता नहीं है; यदि आप पहले बीमार व्यक्ति को ढूंढ लेते हैं, तो आप उसके पड़ोसियों के प्रति सावधान रहने के बारे में जान जाते हैं।

3. समाधान: "स्काउट टीम" (मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग)

रोबोट से एक-एक करके सवाल पूछने के बजाय (जो धीमा और महंगा है), शोधकर्ताओं ने डिजिटल स्काउट्स (जिन्हें एजेंट कहा जाता है) की एक टीम भेजी।

  • वे कैसे काम करते हैं:

    • स्काउट्स सबवे मैप के विभिन्न बिंदुओं से शुरू होते हैं।
    • वे रोबोट से किसी विषय के बारे में कुछ प्रश्न पूछते हैं।
    • यदि रोबोट पक्षपाती लगता है, तो स्काउट्स टीम के बाकी सदस्यों को चिल्लाकर बताते हैं: "हे, यह क्षेत्र खतरनाक है! यहाँ समय बर्बाद न करें, लेकिन इसके ठीक बगल वाले स्टेशनों की जाँच करें!"
    • यदि रोबोट ठीक लगता है, तो स्काउट्स मानचित्र के दूसरे हिस्से में चले जाते हैं।
  • जादू: स्काउट्स जानकारी तुरंत साझा करते हैं। यदि स्काउट A को "राजनीति" में पक्षपात मिलता है, तो स्काउट B (जो "अर्थव्यवस्था" की खोज कर रहा है) को अतिरिक्त सावधानी बरतने की जानकारी मिलती है क्योंकि वे विषय आपस में जुड़े हुए हैं। यह उन्हें बहुत कम प्रश्नों के साथ सभी "खतरों के क्षेत्रों" (अविश्वसनीय सीमाओं) को खोजने की अनुमति देता है।

4. परिणाम: एक "ट्रस्ट मैप" (Trust Map)

इस स्काउट टीम का उपयोग करके, सिस्टम तेजी से एक मानचित्र बना सकता है जो कहता है:

  • ग्रीन ज़ोन (हरा क्षेत्र): "विज्ञान और इतिहास के बारे में पूछना सुरक्षित है।"
  • ⚠️ रेड ज़ोन (लाल क्षेत्र): "सावधान रहें! रोबोट यहाँ पक्षपाती हो जाता है (जैसे, आप्रवास और प्रजनन अधिकार)।"

यह एक बड़ी बात क्यों है?

  • दक्षता (Efficiency): पहले, यह जानने के लिए कि रोबोट कहाँ पक्षपाती है, आपको उससे 10,000 प्रश्न पूछने पड़ सकते थे। यह नई विधि केवल 100 प्रश्नों की आवश्यकता हो सकती है क्योंकि स्काउट्स एक-दूसरे से सीखते हैं।
  • "एक्स-रे विज़न" की आवश्यकता नहीं: यह तब भी काम करता है जब आप नहीं जानते कि रोबोट कैसे बनाया गया था या यह किस कोड पर चलता है। यह रोबोट को एक रहस्यमय बॉक्स की तरह मानता है और बस उसके व्यवहार को देखता है।
  • नया डेटा: शोधकर्ताओं ने कई लोकप्रिय रोबोट्स (जैसे Llama, Falcon, और Vicuna) को कवर करने वाला एक विशाल नया डेटासेट (प्रश्नों और उत्तरों का पुस्तकालय) भी बनाया है ताकि अन्य वैज्ञानिक अपने स्वयं के पक्षपात-पहचान टूल का परीक्षण करने में मदद कर सकें।

संक्षेप में

यह शोध पत्र एक शहर (AI के ज्ञान आधार) में "बुरे इलाकों" (detectives) को खोजने के लिए जासूसों की एक टीम को काम पर रखने जैसा है, बिना हर एक गली में पैदल चले। वे जुड़े हुए रास्तों के मानचित्र और सूचना साझा करने वाली एक प्रणाली का उपयोग करते हैं, जिससे वे तेजी से पहचान सकते हैं कि कौन से क्षेत्र जनता (उपयोगकर्ताओं) के भरोसे के लिए असुरक्षित हैं, जिससे प्रक्रिया में समय और पैसा दोनों बचते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →