← नवीनतम पेपर
💻 computer science

Interpreting Black-Box Large Language Models with Sentence-Level Energy Landscapes

यह शोधपत्र एक मॉडल-अज्ञेय (model-agnostic), पोस्ट-हॉक एट्रिब्यूशन इंटरप्रेटर प्रस्तावित करता है जो एक स्टैंडअलोन टूल को प्रशिक्षित करने के लिए एक सरोगेट के रूप में एनर्जी-बेस्ड मॉडल का उपयोग करता है, जो बिना किसी अतिरिक्त API क्वेरी की आवश्यकता के LLM आउटपुट पर वाक्य-स्तरीय प्रॉम्प्ट प्रभाव को मापने में सक्षम है।

मूल लेखक: Maryam Rezaee, Pooriya Safaei, Maryam Asgarinezhad, Fatemeh Seyyedsalehi

प्रकाशित 2026-08-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maryam Rezaee, Pooriya Safaei, Maryam Asgarinezhad, Fatemeh Seyyedsalehi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन रहस्यमय, रोबोटिक मित्र से बात कर रहे हैं। आप उससे एक प्रश्न पूछते हैं, और वह आपको एक लंबा, सहायक उत्तर देता है। लेकिन यहाँ एक पेच है: आप रोबोट के मस्तिष्क के अंदर झाँक नहीं सकते। आप उसके गियर्स को देख नहीं सकते या यह जानने के लिए उसकी डायरी नहीं पढ़ सकते कि उसने उन विशिष्ट शब्दों को क्यों चुना। यह "ब्लैक-बॉक्स" आर्टिफिशियल इंटेलिजेंस की दुनिया है। ये शक्तिशाली कंप्यूटर प्रोग्राम जिन्हें लार्ज लैंग्वेज मॉडल्स (LLMs) कहा जाता है, इतने जटिल और गुप्त हैं कि उनके निर्माता भी कभी-कभी यह स्पष्ट नहीं कर पाते कि वे निर्णय कैसे लेते हैं। यदि आप महत्वपूर्ण कार्यों, जैसे चिकित्सा सलाह या कानूनी सहायता देने के लिए रोबोट पर भरोसा करना चाहते हैं, तो यह एक बड़ी समस्या है। आपको जानने की आवश्यकता है: "रोबोट ने यह इसलिए कहा क्योंकि मेरे प्रश्न के उस हिस्से की वजह से था, या उसने इसे बस यूँ ही बना लिया?"

इस समस्या को हल करने के लिए, वैज्ञानिक "इंटरप्रेटर्स" (व्याख्याकार) बनाने की कोशिश कर रहे हैं—ऐसे उपकरण जो AI के लिए एक्स-रे चश्मे की तरह काम करते हैं। आमतौर पर, ये उपकरण भाषा के छोटे निर्माण खंडों, जैसे व्यक्तिगत शब्दों या अक्षरों (जिन्हें "टोकन" कहा जाता है) को देखने की कोशिश करते हैं। लेकिन भाषा के बारे में एक-एक अक्षर करके सोचना एक फिल्म को सिंगल पिक्सेल देखकर समझने की कोशिश करने जैसा है; यह अव्यवज़ित है और अक्सर बड़ी तस्वीर को मिस कर देता है। असली जादू पूर्ण विचारों, या वाक्यों में होता है। बड़ा सवाल जिसका यह पेपर समाधान करता है, वह यह है: क्या हम एक ऐसा उपकरण बना सकते हैं जो इन छोटे पिक्सेलों को अनदेखा करे और इसके बजाय पूरे वाक्यों को देखे ताकि यह पता चल सके कि आपके प्रश्न के वास्तव में किन हिस्सों ने रोबोट के उत्तर को प्रभावित किया?

इस शोध पत्र के शोधकर्ता कहते हैं "हाँ, हम कर सकते हैं!" और उन्होंने एक चतुर नया तरीका बनाया है। ब्लैक बॉक्स को खोलने के बजाय, उन्होंने उस रोबोट का एक "शैडो ट्विन" (परछाईं जैसा जुड़वा) बनाया। इस जुड़वा को एक जासूस की तरह समझें जो असली रोबोट को काम करते हुए देखता है, उसकी आदतों को सीखता है, और फिर उसके सोचने की प्रक्रिया का एक मानचित्र बनाता है। वे इस मानचित्र को "एनर्जी लैंडस्स्केप" (ऊर्जा परिदृश्य) कहते हैं। कल्पना कीजिए एक पहाड़ी इलाके की जहाँ कम घाटियाँ "अच्छे, तार्किक उत्तरों" का प्रतिनिधित्व करती हैं और ऊँची चोटियाँ "अजीब, गलत उत्तरों" का। असली रोबोट हमेशा कम घाटियों में रहने की कोशिश करता है।

टीम ने अपने जासूसी जुड़वा को इस परिदृश्य को समझने के लिए प्रशिक्षित किया। एक बार जब जुड़वा मानचित्र को जान लेता है, तो वह रोबोट द्वारा दिए गए एक विशिष्ट उत्तर को देख सकता है और पूछ सकता है, "किस वाक्य ने रोबोट को इस विशिष्ट घाटी में नीचे धकेला?" उन्होंने एक हल्का उपकरण बनाया, जिसे वे ESCI कहते हैं, जो एक स्टैंडअलोन ट्रांसलेटर के रूप में कार्य करता है। प्रशिक्षित होने के बाद, इस उपकरण को बड़े रोबोट से मदद माँगने की ज़रूरत नहीं होती है; यह केवल प्रश्न और उत्तर को देख सकता है और सीधे सबसे महत्वपूर्ण वाक्यों की ओर इशारा कर सकता है।

उन्होंने इसका परीक्षण कैसे किया और उन्हें क्या मिला, यहाँ बताया गया है। उन्होंने एक लोकप्रिय AI मॉडल (GPT-4o-Mini) को अपने "ब्लैक बॉक्स" के रूप में उपयोग किया और उसे हजारों प्रश्न और उत्तर दिए। उन्होंने अपने ESCI टूल को यह समझने के लिए प्रशिक्षित किया कि प्रश्न के कौन से हिस्से सबसे अधिक मायने रखते हैं। जब उन्होंने ESCI के अनुमानों की तुलना अन्य सुपर-स्मार्ट AI मॉडल्स (जो "ओरेकल" के रूप में कार्य करते हैं) के अनुमानों से की, तो उन्होंने पाया कि ESCI आश्चर्यजनक रूप से सटीक था। यह बहुत सारी अतिरिक्त बातों या "फिलर" शब्दों के बावजूद प्रश्न के मुख्य बिंदु को पहचान सकता था। उदाहरण के लिए, यदि आपने पूछा, "जैसे मैं पाँच साल का हूँ वैसे समझाएं" (Explain like I'm five), तो ESCI ने सही ढंग से पहचाना कि "जैसे मैं पाँच साल का हूँ वैसे समझाएं" वाला हिस्सा सबसे महत्वपूर्ण निर्देश था, न कि केवल वह विषय जिसके बारे में आप पूछ रहे थे।

हालाँकि, पेपर सावधानीपूर्वक यह दावा नहीं करता है कि यह एक पूर्ण, जादुई समाधान है। लेखक सुझाव देते हैं कि जबकि ESCI सही वाक्यों को खोजने में बहुत अच्छा है, यह वह क्रिस्टल बॉल नहीं है जो रोबोट के सटीक आंतरिक विचारों को देख लेती है। उन्होंने इसे एक "क्या होगा अगर" परीक्षण करके मापा: उन्होंने वे वाक्य लिए जिन्हें ESCI ने महत्वपूर्ण बताया था, बाकी को हटा दिया, और रोबोट से फिर से उत्तर देने के लिए कहा। रोबोट अभी भी एक बहुत ही समान उत्तर देने में सक्षम था, जो यह सुझाव देता है कि ESCI ने वास्तविक "कारण संबंधी" (causal) चालकों को खोज लिया था। लेकिन, उन्होंने यह भी नोट किया कि यदि आप महत्वपूर्ण वाक्यों को हटा देते हैं, तो रोबलेट कभी-कभी सही उत्तर का अनुमान लगा लेता है क्योंकि उसके पास बहुत सारा सामान्य ज्ञान होता है। इसका मतलब है कि ESCI बहुत अच्छा है, लेकिन यह रोबोट के सोचने का अंतिम शब्द नहीं है।

इस पद्धति की सबसे कूल चीज़ इसकी दक्षता है। अन्य तरीके जो ऐसा करने की कोशिश करते हैं, उन्हें अक्सर एक उत्तर का पता लगाने के लिए बड़े रोबोट से हजारों प्रश्न पूछने पड़ते हैं, जो धीमा और महंगा है। ESCI टूल, प्रशिक्षित होने के बाद, बिना बड़े रोबोट की मदद लिए तुरंत अपना काम कर सकता है। यह एक गाइड डॉग को एक बार प्रशिक्षित करने जैसा है, और फिर वह कुक को बिना ट्रेनर को कॉल किए शहर में रास्ता दिखाने के लिए हमेशा के लिए तैयार रहता है। शोधकर्ताओं ने पाया कि लगभग 20,000 उदाहरणों पर प्रशिक्षण के बाद, उनका टूल पुराने तरीकों की तुलना में बहुत तेज़ी से नए प्रश्नों को संभाल सकता था, जिससे बहुत अधिक समय और कंप्यूटर पावर की बचत हुई।

अंत में, यह पेपर सुझाव देता है कि सूक्ष्म शब्दों के बजाय वाक्यों को देखना AI को समझने का एक स्मार्ट तरीका है। यह दिखाता है कि हम ऐसे उपकरण बना सकते हैं जो हमें इन रहस्यमय रोबोटों पर भरोसा करने में मदद करते हैं, यह बताते हुए कि हमारी बातचीत के कौन से हिस्से वास्तव में मायने रखते हैं। हालाँकि यह रोबोट की आत्मा में झाँकने वाली कोई पूर्ण खिड़की नहीं है, लेकिन यह एक बहुत ही मजबूत चश्मा है जो हमें जादू के पीछे के तर्क को देखने में मदद करता है, जिससे इन शक्तिशाली उपकरणों का हमारे दैनिक जीवन में उपयोग करना अधिक सुरक्षित और विश्वसनीय हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →