← नवीनतम पेपर
🤖 machine learning

ATLAS: Constitution-Conditioned Latent Geometry and Redistribution Across Language Models and Neural Perturbation Data

यह शोध पत्र ATLAS को प्रस्तुत करता है, जो एक ज्यामिति-प्रथम (geometry-first) ढांचा है जो यह प्रदर्शित करता है कि संविधान-सशर्त पोस्ट-ट्रेनिंग (constitution-conditioned post-training) एक पुनर्प्राप्य लेटेंट ज्यामितीय संरचना (recoverable latent geometric structure) को प्रेरित करती है जो स्थानीय निर्देशांकों और व्यवहार संबंधी अभिव्यक्ति में बदलाव के बावजूद विभिन्न भाषा मॉडलों और न्यूरल सबस्ट्रेट्स में बनी रहती है।

मूल लेखक: Gareth Seneque, Lap-Hang Ho, Nafise Erfanian Saeedi, Jeffrey Molendijk, Tim Elson

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gareth Seneque, Lap-Hang Ho, Nafise Erfanian Saeedi, Jeffrey Molendijk, Tim Elson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ATLAS पेपर का सरल भाषा, रोज़मर्रा के उदाहरणों और रूपकों (metaphors) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

मुख्य विचार: मशीन में "भूत" (Ghost) की खोज करना

कल्पना कीजिए कि आपके पास एक मास्टर शेफ (Source Model, जिसे Gemma कहा गया है) है, जिसे व्यवहार करने के लिए एक सख्त नए नियमपुस्तिका (Constitution) के साथ प्रशिक्षित किया गया है। यह नियमपुस्तिका शेफ को बताती है कि कठिन अनुरोधों को कैसे संभालना है, जैसे कि ज़हरीला केक बनाने के अनुरोध को मना करना।

प्रशिक्षण के बाद, शेफ बदल जाता है। वे केवल अलग तरह से कार्य नहीं करते; पेपर यह पूछता है: क्या उनका आंतरिक "किचन लेआउट" भी बदल गया? क्या उन्होंने इन नियमों को संभालने के लिए एक नया, स्थायी मानसिक ढांचा बनाया, या उन्होंने केवल कुछ विशिष्ट उत्तर याद कर लिए?

लेखकों ने इस प्रश्न का उत्तर देने के लिए ATLAS नामक एक टूल बनाया है। वे यह देखना चाहते हैं कि क्या वे एक पूरी तरह से अलग शेफ (Target Model, जिसे Phi कहा गया है) में उस नए मानसिक ढांचे का "ब्लूप्रिंट" ढूंढ सकते हैं जिसने कभी वह नियमपुस्तिका नहीं देखी, और यहाँ तक कि एक जैविक मस्तिष्क (Mouse Brain, जिसे ALM8 कहा गया है) में भी।

मुख्य खोज: "पारिवारिक समानता" बनाम "सटीक प्रतिलिपि"

यह पेपर एक आश्चर्यजनक खोज करता है। यह किसी दस्तावेज़ की सटीक फोटोकॉपी खोजने जैसा नहीं है। यह एक पारिवारिक समानता (family resemblance) खोजने जैसा है।

1. स्रोत (Gemma): ब्लूप्रिंट तैयार है

प्रशिक्षित शेफ (Gemma) पर, लेखकों को एक विशिष्ट "किचन का कोना" (Source-Local Chart) मिला जहाँ नए नियम रहते हैं।

  • उदाहरण: कल्पना कीजिए कि अब शेफ के पास अपने दिमाग में "सुरक्षा नियमों" के लिए एक विशिष्ट दराज (drawer) है। जब खतरनाक चीजों के बारे में पूछा जाता है, तो उनका मस्तिष्क उस विशिष्ट दराज में चमकने लगता है।
  • चुनौती: वे केवल एक छोटा सा पेंच या एकल न्यूरॉन नहीं ढूंढ सके जिसने उस नियम को थाम रखा था। इसके बजाय, नियम संबंधित मानसिक मार्गों के एक पूरे परिवार (Family) में रहता है। यह एक घर नहीं, बल्कि एक पूरा मोहल्ला है।

2. लक्ष्य (Phi): "भूत" प्रकट होता है

इसके बाद, उन्होंने एक पूरी तरह से अप्रशिक्षित शेफ (Phi) लिया है जिसने कभी नियमपुस्तिका नहीं देखी थी। उन्होंने पूछा: "क्या हम इस शेफ के दिमाग में वही 'सुरक्षा दराज' ढूंढ सकते हैं?"

  • परिणाम: हाँ! उन्हें एक दराज मिली जो बहुत समान दिखती थी।
  • ट्विस्ट: यह ठीक वही दराज नहीं थी और न ही ठीक उसी स्थान पर थी। यह एक पड़ोसी दराज थी जो उसी उद्देश्य को पूरा करती थी।
  • रूपक: कल्पना कीजिए कि आपके पास एक शहर का नक्शा है। आप शहर A में एक विशिष्ट पार्क पाते हैं। आप शहर B (एक बिल्कुल अलग शहर) में जाते हैं और एक पार्क पाते हैं जो बिल्कुल वैसा ही दिखता है और महसूस होता है, भले ही वह एक अलग सड़क पर हो और पेड़ भी थोड़ी अलग प्रजाति के हों। कार्य (function) और आकार (shape) समान हैं, लेकिन निर्देशांक (coordinates) अलग हैं।

इसे ही लेखक "पुनर्वितरण" (Redistribution) कहते हैं। संरचना (पार्क) वहीं है, लेकिन यह नए शहर में फिट होने के लिए इधर-उधर (redistributed) हो गई है।

3. जैविक प्रमाण (ALM8): चूहों में भी यह मौजूद है

यह साबित करने के लिए कि यह केवल कंप्यूटर कोड का कोई छल नहीं है, उन्होंने चूहे के मस्तिष्क (ALM8) के डेटा को देखा।

  • परिणाम: यहाँ तक कि चूहे के मस्तिष्क में भी, वे एक संकेत ढूंढ सके जो कंप्यूटर मॉडल के "सुरक्षा परिवार" से मेल खाता था।
  • अर्थ: यह सुझाव देता है कि जब बुद्धिमत्ता (चाहे वह सिलिकॉन हो या जैविक) एक जटिल नियम सीखती है, तो वह केवल शब्द याद नहीं करती; वह अपने आंतरिक वायरिंग में एक विशिष्ट आकार बनाती है। वह आकार इतना मजबूत है कि इसे विभिन्न प्रजातियों और विभिन्न प्रकार के "मस्तिष्कों" में भी पहचाना जा सकता है।

सीमाएँ: उन्होंने क्या नहीं पाया

पेपर इस बात के प्रति बहुत ईमानदार है कि उसने क्या नहीं पाया।

  • कोई "जादुई स्विच" नहीं: वे एक अकेला, छोटा स्विच नहीं ढूंढ सके जिसे बदलने से अप्रशिक्षित शेफ ठीक उसी तरह व्यवहार करने लगता जैसा प्रशिक्षित शेफ करता है।
  • कोई "परफेक्ट रीप्ले" नहीं: अप्रशिक्षित शेफ (Phi) एक आदर्श क्लोन नहीं बना। उन्हें थोड़े अलग सवालों (जैसे कि बहुविकल्पीय परीक्षा) द्वारा चकमा दिया जा सकता था जहाँ "सुरक्षा दराज" सही ढंग से नहीं चमकती थी।
  • रूपक: आप दूर से किसी परिवार के सदस्य के चेहरे को पहचान सकते हैं (संरचना मौजूद है), लेकिन यदि आप उनसे एक बहुत ही विशिष्ट, पेचीदा सवाल पूछते हैं, तो वे मूल परिवार के सदस्य की तरह अलग उत्तर दे सकते हैं। नियम की "आत्मा" वहाँ है, लेकिन "शरीर" थोड़ा अलग है।

यह क्यों महत्वपूर्ण है (इसका महत्व क्या है?)

  1. सुरक्षा संरचनात्मक है, केवल सतही नहीं: यह साबित करता है कि सुरक्षा प्रशिक्षण AI की आंतरिक ज्यामिति (internal geometry) को बदलता है, न कि केवल उसके आउटपुट को। यह अच्छी खबर है क्योंकि इसका मतलब है कि ये परिवर्तन "वास्तविक" और "स्थिर" हैं, न कि केवल सतही चालें।
  2. हम AI का ऑडिट कर सकते हैं: क्योंकि ये संरचनाएं पहचानने योग्य हैं, हम एक AI को "स्कैन" कर सकते हैं यह देखने के लिए कि क्या उसने खतरनाक व्यवहार सीख लिया है, भले ही हमने उसे प्रशिक्षित न किया हो।
  3. सार्वभौमिक पैटर्न: तथ्य यह है कि यह संरचना चूहे के मस्तिष्क में भी दिखाई देती है, यह सुझाव देता है कि बुद्धिमत्ता जटिल नियमों को कैसे व्यवस्थित करती है, यह एक सार्वभौमिक नियम हो सकता है, चाहे वह कंप्यूटर चिप में हो या जैविक मस्तिष्क में।

एक वाक्य में सारांश

ATLAS ने खोजा कि जब AI एक नया सेट नियम सीखता है, तो वह एक विशिष्ट "मानसिक आकार" बनाता है जो इतना मजबूत और पहचानने योग्य होता है कि हम पूरी तरह से अलग AI मॉडल और यहाँ तक कि चूहे के मस्तिष्क में भी उसकी "पारिवारिक समानता" ढूंढ सकते हैं, भले ही उस आकार का सटीक स्थान बदल जाता हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →