← नवीनतम पेपर
💻 computer science

What are They Thinking? Delineation, Probing and Tracking of Concepts in LLMs

यह शोध पत्र विभिन्न परतों और संदर्भों में बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के एम्बेडिंग्स के भीतर विशिष्ट अवधारणाओं को चित्रित करने, पता लगाने और ट्रैक करने के लिए कम लागत वाले, स्केलेबल लीनियर प्रोब्स (linear probes) बनाने के लिए एक ढांचे की रूपरेखा प्रस्तुत करता है, जिससे उनकी व्याख्यात्मकता और निगरानी क्षमताओं को बढ़ाया जा सके।

मूल लेखक: Mohamed Abdelwahab, Michelle Yu Collins, Sihan Chen, Yi Cheng Zhao, Zafarullah Mahmood, Jiading Zhu, Soliman Ali, Jonathan Rose

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohamed Abdelwahab, Michelle Yu Collins, Sihan Chen, Yi Cheng Zhao, Zafarullah Mahmood, Jiading Zhu, Soliman Ali, Jonathan Rose

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक लार्ज लैंग्वेज मॉडल (LLM) एक विशाल, तेज़ गति वाले शेफ की तरह है जो एक रसोई में काम कर रहा है। यह शेफ आपके द्वारा मांगी गई किसी भी रेसिपी को बना सकता है, लेकिन जब वह सब्जियां काट रहा होता है, मिश्रण बना रहा होता है या स्वाद चख रहा होता है, तो आप उसके दिमाग के अंदर नहीं देख सकते। आप केवल अंतिम व्यंजन (वह टेक्स्ट जो वह आउटपुट देता है) देख पाते हैं। सवाल यह है: जब वह खाना बना रहा होता है, तो वह वास्तव में क्या सोच रहा होता है?

यह पेपर "एक्स-रे चश्मे" (X-ray glasses) की एक जोड़ी बनाने के बारे में है जो हमें शेफ के दिमाग में झांकने और यह देखने की अनुमति देते हैं कि किसी दिए गए क्षण में कौन से विचार (जैसे "महत्वाकांक्षा", "जांच", "लोकतंत्र", या "ईर्ष्या") मौजूद हैं।

शोधकर्ताओं ने इसे कैसे किया, इसे सरल चरणों में यहाँ समझाया गया है:

1. "विचार" को परिभाषित करना (The Delineation)

इससे पहले कि आप किसी चीज़ की तलाश कर सकें, आपको ठीक से पता होना चाहिए कि वह क्या है। शोधकर्ताओं ने केवल अंदाज़ा नहीं लगाया कि "महत्वाकांक्षा" कैसी दिखती है; उन्होंने इसे सावधानीपूर्वक परिभाषित किया।

  • उपमा (Analogy): कल्पना कीजिए कि आप पेंट के ढेर में "लाल" रंग को खोजना चाहते हैं। आप केवल यह नहीं कह सकते कि "कुछ भी लाल सा।" आपको एक सख्त नियम चाहिए: "लाल रंग ठीक यह विशिष्ट शेड है, गुलाबी या नारंगी नहीं।"
  • विधि: उन्होंने हजारों वाक्य उत्पन्न करने के लिए एक स्मार्ट AI का उपयोग किया। कुछ वाक्य इस तरह बनाए गए थे जो स्पष्ट रूप रूप से उस अवधारणा (concept) को दर्शाते थे (जैसे, एक लक्ष्य के लिए संघर्ष करने वाला पात्र), और अन्य ऐसे बनाए गए थे जो दिखने में समान थे लेकिन उनमें वह अवधारणा नहीं थी। महत्वपूर्ण बात यह है कि उन्होंने यह सुनिश्चित किया कि वाक्यों में कोई स्पष्ट "चीट कोड" (जैसे सीधे "महत्वाकांक्षा" शब्द का उपयोग करना) न हो, जिससे परीक्षण बहुत आसान हो जाए। उन्होंने उदाहरणों का एक "गोल्ड स्टैंडर्ड" डेटासेट बनाया जहाँ वह अवधारणा या तो निश्चित रूप से मौजूद है या निश्चित रूप से नहीं है।

2. "डिटेक्टर" बनाना (The Probe)

एक बार जब आपके पास "हाँ, यह महत्वाकांक्षा है" और "नहीं, यह महत्वाकांक्षा नहीं है" की अपनी सूची बन गई, तो उन्होंने एक छोटा, सरल डिटेक्टर बनाया जिसे लीनियर प्रोब (linear probe) कहा जाता है।

  • उपमा: LLM को एक विशाल पुस्तकालय के रूप में सोचें जहाँ हर किताब (वाक्य में हर शब्द) एक विशिष्ट स्थान पर संग्रहीत है। शोधकर्ताओं ने एक छोटा, सस्ता मेटल डिटेक्टर बनाया जिसे वे लाइब्रेरी की किसी भी शेल्फ के ऊपर सरका सकते हैं।
  • यह कैसे काम करता है: उन्होंने इस मेटल डिटेक्टर को अपने "गोल्ड स्टैंडर्ड" की सूची पर प्रशिक्षित किया। यदि डिटेक्टर ज़ोर से बीप करता है (उच्च स्कोर), तो इसका मतलब है कि अवधारणा मॉडल के आंतरिक "विचारों" (embeddings) में मौजूद है। यदि यह शांत रहता है (कम स्कोर), तो अवधारणा अनुपस्थित है।
  • आश्चर्य: उन्होंने पाया कि इन डिटेक्टरों को जटिल सुपर-कंप्यूटर की आवश्यकता नहीं है। 80 से भी कम "नॉब्स" (पैरामीटर्स) वाला एक बहुत ही सरल डिटेक्टर इन अवधारणाओं को सटीक रूप से पहचानने के लिए पर्याप्त था।

3. "विचारों" को विकसित होते देखना (Waxing and Waning)

सबसे दिलचस्प हिस्सा यह देखना है कि कहानी आगे बढ़ने के साथ ये विचार कैसे बदलते हैं।

  • उपमा: कल्पना कीजिए कि शेफ एक कहानी सुना रहा है। शुरुआत में, वह केवल मौसम के बारे में बात कर रहा है (वहाँ "महत्वाकांक्षा" नहीं है)। फिर, वह एक पात्र के बारे में बात करना शुरू करता है जो दौड़ जीतना चाहता है (महत्वाकांक्षा प्रकट होती है)। अंत में, पात्र हार मान लेता है (महत्वाकांक्षा लुप्त हो जाती है)।
  • परिणाम: शोधकर्ताओं ने दिखाया कि उनके डिटेक्टर इस प्रक्रिया को वास्तविक समय (real-time) में ट्रैक कर सकते हैं। जैसे ही वे मॉडल में शब्द-दर-शब्द कहानी फीड करते हैं, अवधारणा के आने पर डिटेक्टर की "बीप" बढ़ जाती है और कहानी आगे बढ़ने पर कम हो जाती है। यह किसी विशिष्ट विचार के लिए हार्ट मॉनिटर देखने जैसा है।

4. यह क्यों महत्वपूर्ण है (बिना बढ़ा-चढ़ाकर कहे)

पेपर का दावा है कि यह पूरे मॉडल को फिर से प्रशिक्षित किए बिना या भारी मशीनरी (जैसे "स्पार्स ऑटोएनकोडर्स" जिनका उल्लेख पेपर में किया गया है, जो एक किताब खोजने के लिए पूरी लाइब्रेरी को फिर से बनाने जैसा है) का उपयोग किए बिना, यह समझने का एक नया, कम लागत वाला तरीका है कि LLMs क्या "सोच" रहे हैं।

पेपर के मुख्य निष्कर्ष:

  • यह काम करता है: उन्होंने सफलतापूर्वक चार विशिष्ट अवधारणाओं (महत्वाकांक्षा, जांच, लोकतंत्र, ईर्ष्या) के लिए डिटेक्टर बनाए, जो तीन अलग-अलग प्रकार के AI मॉडल पर काम करते हैं।
  • यह सस्ता है: आपको किसी अवधारणा के लिए डेटासेट केवल एक बार बनाने की आवश्यकता है, और फिर आप उस डिटेक्टर का उपयोग किसी भी मॉडल पर कर सकते हैं।
  • यह सटीक है: डिटेक्टर आपको बिल्कुल बता सकते हैं कि कोई अवधारणा मॉडल के मन में कब आती है और संदर्भ बदलने पर कब बाहर निकल जाती है।
  • यह जादू नहीं है: पेपर स्वीकार करता है कि हालांकि यह इन चार अवधारणाओं के लिए काम करता है, लेकिन हमें अभी तक यह नहीं पता कि क्या यह हर संभावित अवधारणा के लिए काम करता है। साथ भी, डेटा AI द्वारा उत्पन्न किया गया था, इसलिए मानवीय बारीकियों को पूरी तरह से दोहराने में इसकी कुछ सीमाएँ हैं।

संक्षेप में, यह पेपर सरल, पुन: प्रयोज्य (reusable) "थॉट डिटेक्टर्स" बनाने का एक ब्लूप्रिंट प्रदान करता है जो हमें यह देखने की अनुमति देते हैं कि AI मॉडल जानकारी को प्रोसेस करते समय उनके आंतरिक तर्क (internal logic) में क्या चल रहा है, जिससे यह सिद्ध होता है कि ये मॉडल बोलने से पहले वास्तव में कुछ विशिष्ट अमूर्त विचारों के बारे में "सोचते" हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →