← नवीनतम पेपर
💬 NLP

Large Language Models Encode Semantics and Alignment in Linearly Separable Representations

यह शोध पत्र प्रदर्शित करता है कि बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) उच्च-स्तरीय अर्थ संबंधी और संरेखण संबंधी जानकारी को अपने लेटेंट रिप्रजेंटेशन के भीतर निम्न-आयामी, रैखिक रूप से विभाज्य उप-स्थानों (लो-डायमेंशनल, लीनियरली सेपरेबल सबस्पेस) में व्यवस्थित करते हैं, जिससे प्रभावी ज्यामिति-जागरूक गार्डरेल्स का विकास सक्षम होता है जो दुर्भावनापूर्ण सामग्री का पता लगाने और उसे कम करने में पारंपरिक सुरक्षा तंत्रों से बेहतर प्रदर्शन करते हैं।

मूल लेखक: Baturay Saglam, Paul Kassianik, Blaine Nelson, Sajana Weerawardhena, Yaron Singer, Amin Karbasi

प्रकाशित 2026-01-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Baturay Saglam, Paul Kassianik, Blaine Nelson, Sajana Weerawardhena, Yaron Singer, Amin Karbasi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, बहु-मंजिला पुस्तकालय के रूप में करें जहाँ हर किताब उस जानकारी का एक हिस्सा है जिसे मॉडल ने सीखा है। लंबे समय तक, शोधकर्ताओं को लगा कि यह पुस्तकालय एक अराजक ढेर था, जहाँ "भौतिक विज्ञान" (physics), "कंप्यूटर विज्ञान" (computer science), या "सुरक्षा" (safety) जैसे विचार अलमारियों में बेतरतीब ढंग से बिखरे हुए थे।

यह पेपर तर्क देता है कि यह पुस्तकालय हमारी सोच से कहीं अधिक व्यवस्थित है। यह कोई अस्त-व्यस्त अटारी नहीं है; बल्कि एक अत्यधिक संरचित इमारत है जहाँ विचार करीने से विशिष्ट, सीधी रेखाओं में सजे हुए हैं।

यहाँ शोधकर्ताओं ने जो पाया है, उसका सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. "सॉर्टिंग हैट" प्रभाव (रैखिक पृथकशीलता - Linear Separability)

शोधकर्ताओं ने 11 अलग-अलग AI मॉडलों को लिया और उन्हें छह अलग-अलग वैज्ञानिक विषयों (जैसे भौतिक विज्ञान, गणित और कंप्यूटर विज्ञान) पर टेक्स्ट दिया। उन्होंने मॉडल के अंदर "छिपे हुए विचारों" (representations) को देखा जब वह टेक्स्ट पढ़ रहा था।

  • निष्कर्ष: उन्होंने पाया कि मॉडल इन विषयों को केवल मिलाता-जुलता नहीं है। इसके बजाय, यह उन्हें अलग-अलग, सीधी-रेखा समूहों में छाँटता है।
  • उपमा: कल्पना कीजिए कि आपके पास मिश्रित रंग की कंचों (marbles) का एक थैला है। यदि आप थैले को हिलाते हैं, तो वे मिल जाते हैं। लेकिन यदि आप उन्हें एक विशेष फनल (AI की गहरी परतों) के माध्यम से डालते हैं, तो लाल कंचे (भौतिक विज्ञान) अपने आप बाईं ओर लुढ़क जाते हैं, और नीले कंचे (कंप्यूटर विज्ञान) दाईं ओर लुढ़क जाते हैं। मॉडल एक स्पष्ट, सीधी रेखा बनाता है जहाँ आप केवल यह देखकर कि वे कहाँ गिरते हैं, विषयों के बीच अंतर आसानी से कर सकते हैं।
  • ट्विस्ट: जैसे-जैसे आप मॉडल में गहराई तक जाते हैं, यह छंटाई बेहतर होती जाती है। पुस्तकालय की ऊपरी मंजिलें सबसे अधिक व्यवस्थित होती हैं। इसके अलावा, यह छंटाई तब भी होती है जब आप विशिष्ट "कीवर्ड" शब्दों को छिपा देते हैं (जैसे भौतिक विज्ञान के टेक्स्ट से "क्वांटम" शब्द को हटा देना)। मॉडल फिर भी जानता है कि यह भौतिक विज्ञान है क्योंकि यह वाक्य की संरचना (structure) के कारण है, न कि केवल कीवर्ड्स के कारण।

2. "निर्देश स्विच" (The Instruction Switch)

शोधकर्ताओं ने परीक्षण किया कि क्या होता है जब आप मॉडल को एक विशिष्ट निर्देश देते हैं, जैसे "चरण-दर-चरण सोचें" (Chain-of-Thought), बनाम केवल एक प्रश्न सामान्य रूप से पूछना।

  • निष्कर्ष: भले ही प्रश्न एक ही हो, वह छोटा सा निर्देश मॉडल के आंतरिक "विचार पैटर्न" को इतना नाटकीय रूप से बदल देता है कि वह पूरी तरह से एक अलग, पृथक क्षेत्र में पहुँच जाता है।
  • उपमा: कल्पना कीजिए कि आप एक गलियारे में चल रहे हैं। यदि आप सामान्य रूप से चलते हैं, तो आप "लिविंग रूम" में पहुँचते हैं। यदि कोई आपके कंधे को थपथपाता है और कहता है, "एक रोबोट की तरह चलो," तो आप तुरंत एक अलग रास्ते पर स्विच कर जाते हैं और "किचन" में पहुँच जाते हैं। पेपर ने पाया कि मॉडल के पास इन निर्देशों के लिए एक विशिष्ट "स्विच" है। वास्तव में, वे उस "स्टेप-बाय-स्टेप" मोड का प्रतिनिधित्व करने वाले एक गणितीय वेक्टर (दिशा तीर) को ले सकते थे और मॉडल की आंतरिक स्थिति को उस दिशा में शारीरिक रूप से धकेल सकते थे, जिससे उसे बिना पूछे भी चरण-दर-चरण सोचने के लिए मजबूर किया जा सके।

3. "सेफ्टी रडार" (The Safety Radar)

टीम ने यह भी देखा कि मॉडल "बुरे" अनुरोधों (जैसे बम बनाने के बारे में पूछना) बनाम "अच्छे" अनुरोधों, और यहाँ तक कि "चालाकी भरे" अनुरोधों (जो मॉडल को धोखा देने की कोशिश करते हैं - प्रॉम्प्ट इंजेक्शन) को कैसे संभालता है।

  • निष्कर्ष: मॉडल का आंतरिक मानचित्र "सुरक्षित" विचारों को "खतरनाक" विचारों से स्पष्ट रूप से अलग करता है। भले ही किसी बुरे अनुरोध को एक चतुर कहानी (इंजेक्शन) में छिपाया गया हो, मॉडल का आंतरिक ज्यामिति (geometry) फिर भी इसे एक सामान्य, सुरक्षित बातचीत से अलग पहचान लेता है।
  • उपमा: मॉडल के आंतरिक स्थान को एक सुरक्षा चेकपॉइंट के रूप में सोचें। एक सामान्य अनुरोध सामने के दरवाजे से आता है। एक खतरनाक अनुरोध पीछे के दरवाजे से घुसने की कोशिश करता है। मॉडल का आंतरिक "रडार" देखता है कि खतरनाक अनुरोध सुरक्षित अनुरोधों की तुलना में एक अलग "फ्रीक्वेंसी" पर चल रहा है, भले ही शब्द समान दिख रहे हों।

4. "लाइटवेट गार्डरेल" (The Lightweight Guardrail - समाधान)

चूंकि शोधकर्ताओं ने पाया कि ये "अच्छे" और "बुरे" विचार इतने विशिष्ट, सीधी-रेखा क्षेत्रों में रहते हैं, इसलिए उन्होंने बुरे वाले को पकड़ने के लिए एक सरल उपकरण बनाया।

  • प्रयोग: एक विशाल, भारी सुरक्षा प्रणाली (जैसे एक बड़ा AI मॉडल जो हर शब्द को पढ़ने के लिए उपयोग किया जाता है) का उपयोग करने के बजाय, उन्होंने एक छोटा, हल्का "गार्डरेल" (एक छोटा न्यूरल नेटवर्क) बनाया जो मॉडल के लिखने को पूरा करने से पहले उसके आंतरिक "विचारों" को देखता है।
  • परिणाम: यह छोटा गार्डरेल अविश्वसनीय रूप से प्रभावी था। इसने उन हानिकारक अनुरोधों और "धोखा देने वाले" प्रॉम्प्ट्स को पकड़ा जिन्हें मॉडल की अंतर्निहित सुरक्षा विशेषताओं ने मिस कर दिया था। यह एक ऐसे सुरक्षा गार्ड की तरह था जिसे पूरी किताब पढ़ने की ज़रूरत नहीं है कि यह खतरनाक है या नहीं; वे बस किताब की रीढ़ (spine) और कवर के रंग को देखकर तुरंत जान जाते हैं (आंतरिक ज्यामिति)।
  • दक्षता: यह नया गार्डरेल बहुत छोटा है (केवल 13.9 मिलियन पैरामीटर्स) जबकि आमतौर पर उपयोग किए जाने वाले सुरक्षा मॉडल (8 बिलियन पैरामीटर्स) बहुत बड़े होते हैं, फिर भी इसने हानिकारक सामग्री को दो गुने से अधिक प्रभावी ढंग से रोका।

सारांश

पेपर का दावा है कि AI मॉडल अराजक ब्लैक बॉक्स नहीं हैं। वे जटिल विचारों, निर्देशों और सुरक्षा नियमों को अपने मस्तिष्क के भीतर सुव्यवस्थित, सीधी रेखाओं में व्यवस्थित करते हैं। इस ज्यामिति को समझकर, हम बहुत छोटे, तेज़ और अधिक प्रभावी उपकरण बना सकते हैं ताकि AI को हानिकारक बातें कहने से रोका जा सके, भले ही वे बातें चालाकी भरे तरीकों से छिपाई गई हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →