← नवीनतम पेपर
🤖 machine learning

LAMP: Extracting Local Decision Surfaces From Large Language Models

LAMP (लोकल एट्रिब्यूशन मैपिंग प्रोब) एक हल्का, ब्लैक-बॉक्स फ्रेमवर्क है जो बड़े भाषा मॉडलों का ऑडिट करने के लिए उनके स्वयं द्वारा रिपोर्ट किए गए स्पष्टीकरणों पर स्थानीय रैखिक सरोगेट्स (locally linear surrogates) को फिट करता है, जिससे शोधकर्ताओं को यह आकलन करने की अनुमति मिलती है कि एक मॉडल का घोषित तर्क उसके वास्तविक भविष्यवाणियों के साथ कितनी निरंतरता से संरेखित होता है।

मूल लेखक: Ryan Chen, Youngmin Ko, Zeyu Zhang, Catherine Cho, Sunny Chung, Mauro Giuffré, Dennis L. Shung, Bradly C. Stadie

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ryan Chen, Youngmin Ko, Zeyu Zhang, Catherine Cho, Sunny Chung, Mauro Giuffré, Dennis L. Shung, Bradly C. Stadie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

"मिस्ट्री शेफ" की समस्या: LAMP मेथड को समझना

कल्पना कीजिए कि आप एक विश्व प्रसिद्ध, उच्च श्रेणी के रेस्तरां में खाना खा रहे हैं। शेफ एक पूर्ण रहस्य है—आप रसोई के अंदर नहीं देख सकते, आपको उनकी रेसिपी नहीं पता, और न ही आपको पता है कि उन्हें कैसे प्रशिक्षित किया गया था। आप केवल अंतिम व्यंजन देखते हैं और मेनू पर एक छोटा सा नोट देखते हैं जिसमें लिखा है: "यह व्यंजन स्वादिष्ट है क्योंकि इसमें ताज़ा बेसिल (तुलसी), समुद्री नमक और लहसुन का उपयोग किया गया है।"

आपके सामने एक समस्या है: क्या आप वास्तव में शेफ पर विश्वास करते हैं?

हो सकता है कि शेफ सिर्फ इसलिए "बेसिल" कह रहा हो क्योंकि यह सुनने में शानदार लगता है, लेकिन वास्तव में वह व्यंजन को स्वादिष्ट बनाने के लिए उसमें बहुत सारा नमक डाल रहा हो। यदि आप कम नमक मांगते, तो क्या व्यंजन वास्तव में बदल जाता, या शेफ बस वही नमकीन भोजन देते रहता और दावा करता कि यह "बेसिल-फॉरवर्ड" है?


पेश है LAMP: "फ्लेवर टेस्टर" (स्वाद परीक्षक)

शोधकर्ताओं ने LAMP (लोकल एट्रिब्यूशन मैपिंग प्रोब) नामक एक नया टूल बनाया है। रसोई में घुसकर शेफ की गुप्त नोटबुक चुराने की कोशिश करने के बजाय (जो GPT-4 जैसे "ब्लैक-बॉक्स" मॉडल के साथ असंभव है), LAMP एक अत्यधिक वैज्ञानिक फ्लेवर टेस्टर की तरह काम करता है।

यहाँ बताया गया है कि तीन चरणों वाली एक सरल प्रक्रिया का उपयोग करके LAMP कैसे काम करता है:

1. "सामग्री" की सूची (एक्सट्रैक्शन/निष्कर्षण)

सबसे पहले, हम AI से पूछते हैं: "आपने इस फिल्म को 5-स्टार रेटिंग क्यों दी?" AI उत्तर देता है: "क्योंकि अभिनय शानदार था (वेट: 0.8) और कहानी रोमांचक थी (वेट: 0.2)।" ये हमारी "सामग्री" और उनके "महत्वपूर्ण वेट (वजन)" हैं।

2. "क्या होगा अगर?" का खेल (पर्टरबेशन/परिवर्तन)

यही सबसे बुद्धिमानी वाला हिस्सा है। LAMP केवल AI की बात पर भरोसा नहीं करता। यह "क्या होगा अगर?" का खेल खेलना शुरू करता है।

  • यह AI से कहता है: "ठीक है, क्या होगा अगर अभिनय का महत्व 0.8 के बजाय केवल 0.4 होता?"
  • फिर: "क्या होगा अगर कहानी का महत्व 0.2 के बजाय 0.5 होता?"

LAMP इन रेसिपी के दर्जनों "थोड़े अलग" संस्करण बनाता है। यह बिल्कुल वैसा ही है जैसे एक वैज्ञानिक यह देखने के लिए बार-बार केक में चीनी की मात्रा को थोड़ा बदलता है कि वह कब मीठा होना बंद होता है और कड़वा होने लगता है।

3. "मैप" बनाना (डिसीजन सरफेस/निर्णय सतह)

उन सामग्रियों में बदलाव करते समय AI के उत्तरों में कैसे बदलाव आता है, इसे देखकर LAMP एक मैप (एक "डिसीजन सरफेस") बनाता है।

  • यदि AI कहता है "कहानी महत्वपूर्ण है," और फिर हम कहानी के वेट को कम करते हैं और AI की रेटिंग वास्तव में गिर जाती है, तो LAMP पुष्टि करता है: "हाँ, कहानी एक वास्तविक डायल है जिसे आप घुमा सकते हैं।"
  • यदि AI कहता है "कहानी महत्वपूर्ण है," लेकिन कहानी के वेट को बदलने से रेटिंग पर कोई प्रभाव नहीं पड़ता, तो LAMP अलार्म बजा देता है: "चेतावनी! AI इस बारे में झूठ बोल रहा है कि उसने यह निर्णय क्यों लिया!"

यह क्यों मायने रखता है?

शोधकर्ताओं ने मूवी रिव्यू से लेकर मेडिकल डायग्नोसिस तक सब कुछ LAMP पर टेस्ट किया। उन्होंने दो बहुत महत्वपूर्ण चीजें पाईं:

  1. "डायल" वास्तविक हैं: अधिकांश समय, AI के "कारण" वास्तव में वास्तविक कंट्रोल नॉब्स (नियंत्रण बटन) की तरह काम करते हैं। यदि आप "पॉजिटिविटी" के नॉब को ऊपर घुमाते हैं, तो AI का प्रेडिक्शन वास्तव में उस दिशा में आगे बढ़ता है। इसका मतलब है कि AI कुछ हद तक सुसंगत है।
  2. "डॉक्टर" टेस्ट: एक उच्च-स्तरीय मेडिकल टेस्ट में, LAMP ने यह दिखाने में मदद की कि AI लक्षणों को कितना महत्व दे रहा था। यह एक मानव डॉक्टर को "मैप" देखने और यह कहने की अनुमति देता है, "रुको, AI इस निदान (diagnosis) को मरीज के लक्षणों के बजाय उसकी उम्र के आधार पर कर रहा है। मुझे इस पर भरोसा नहीं करना चाहिए।"

निष्कर्ष

LAMP, AI लॉजिक के लिए एक झूठ पकड़ने वाले यंत्र (Lie Detector) की तरह है। इसे यह जानने के लिए कि क्या AI सच बोल रहा है, AI के "दिमाग" को देखने की आवश्यकता नहीं है; इसे बस यह देखने की आवश्यकता है कि क्या AI का व्यवहार उस तरह से बदलता है जैसा कि उसका दावा है। यह एक "ब्लैक बॉक्स" को ऐसे मशीन में बदल देता है जिसके दृश्य और अनुमानित नॉब्स और डायल होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →