← नवीनतम पेपर
💬 NLP

Geometric Factual Recall in Transformers

यह शोध पत्र यह प्रदर्शित करता है कि ट्रांसफॉर्मर एक ज्यामितीय तंत्र के माध्यम से तथ्यात्मक संबंधों को याद कर सकते हैं जहाँ विषय एम्बेडिंग (subject embeddings) गुणों के रैखिक सुपरपोजिशन (linear superpositions) को एनकोड करती हैं और एक छोटा MLP एक सामान्य, संबंध-आधारित चयनकर्ता (relation-conditioned selector) के रूप में कार्य करता है, जो रैखिक पैरामीटर वृद्धि पर निर्भर रहने के बजाय लघुगणकीय स्केलिंग (logarithmic scaling) और नए तथ्यों में ज़ीरो-शॉट ट्रांसफर सक्षम बनाता है।

मूल लेखक: Shauli Ravfogel, Gilad Yehudai, Joan Bruna, Alberto Bietti

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shauli Ravfogel, Gilad Yehudai, Joan Bruna, Alberto Bietti

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल पुस्तकालय है जहाँ एक लाइब्रेरियन (AI) को लाखों तथ्यों को याद रखने की आवश्यकता है: "X की माता कौन है?", "Y की राजधानी क्या है?", "Z का CEO कौन है?"

लंबे समय तक, वैज्ञानिकों ने सोचा कि यह लाइब्रेरियन एक विशाल, अराजक फाइलिंग कैबिनेट की तरह काम करता है। उनका मानना था कि AI को हर एक तथ्य के लिए एक अलग, अद्वितीय दराज बनानी पड़ती है। यदि आपके पास 1,000 लोग और प्रत्येक के बारे में 10 तथ्य हैं, तो AI को 10,000 विशिष्ट दराजों की आवश्यकता होगी। यह एक फोन बुक को हर एक नंबर को एक अलग, विशाल इंडेक्स कार्ड पर लिखकर याद करने जैसा है। यह काम तो करता है, लेकिन यह बहुत भारी और अक्षम है।

यह शोध पत्र इस बारे में एक पूरी तरह से अलग, बहुत अधिक स्मार्ट तरीका प्रस्तावित करता है कि AI इसे कैसे कर रहा होगा। एक अराजक फाइलिंग कैबिनेट के बजाय, AI एक संरचित, ज्यामितीय मानचित्र (geometric map) बनाता है।

यहाँ यह पेपर इस "ज्यामितीय स्मृति" (Geometric Memorization) को सरल उपमाओं का उपयोग करके कैसे समझाता है:

1. "सुपरपोजिशन" सूटकेस

कल्पना कीजिए कि आप एक यात्रा के लिए पैकिंग कर रहे हैं। 10 अलग-अलग गंतव्यों के लिए 10 अलग-अलग सूटकेस ले जाने के बजाय, आप एक विशाल सूतकस पैक करते हैं जिसमें उन सभी स्थानों का एक फोल्ड किया हुआ नक्शा है जहाँ आप जा सकते हैं।

पेपर के सिद्धांत में, AI तथ्यों को अलग-अलग, यादृच्छिक वस्तुओं के रूप में संग्रहीत नहीं करता है। इसके बजाय, वह एक विशिष्ट व्यक्ति (मान लीजिए, "एलिस") के बारे में सभी तथ्यों को एक ही "सूटकेस" (एक एम्बेडिंग वेक्टर) में पैक करता है। इस सूटकेस के अंदर, एलिस के तथ्य एक सैंडविच की परतों या संकेतों के सुपरपोजिशन की तरह एक के ऊपर एक स्टैक (stack) किए गए हैं।

  • परत 1: उसका जन्म शहर।
  • परत 2: उसकी नौकरी।
  • परत 3: उसका पसंदीदा रंग।

ये सभी तथ्य एक ही स्थान में एक साथ मौजूद हैं, लेकिन वे एक बहुत ही विशिष्ट, व्यवस्थित ज्यामितीय पैटर्न में व्यवस्थित हैं।

2. "स्मार्ट फ़िल्टर" (MLP)

यदि तथ्य सभी एक साथ स्टैक किए गए हैं, तो AI को वह कैसे पता चलता है जिसकी उसे आवश्यकता है? यहीं पर "MLP" (AI के मस्तिष्क का एक विशिष्ट हिस्सा) आता है।

MLP को एक स्मार्ट फ़िल्टर या लेजर कटर के रूप में सोचें।

  • यदि आप पूछते हैं, "एलिस की नौकरी क्या है?", तो AI एक विशाल सूची में खोज नहीं करता है।
  • इसके बजाय, "फ़िल्टर" "एलिस के सूटकेस" को देखता है, प्रश्न "नौकरी?" को पहचानता है, और तुरंत बाकी सब कुछ को काटकर अलग कर देता है, जिससे केवल "नौकरी" वाली परत दिखाई देने लगती है।
  • पेपर सिद्ध करता है कि यह फ़िल्टर "जेनेरिक" (सामान्य) है। यह यह याद नहीं रखता कि एलिस कौन है; यह केवल उस तंत्र को सीखता है कि किसी भी सूटकेस से "नौकरी" की परत को कैसे बाहर निकाला जाए। यह किसी भी फाइलिंग कैबिनेट में "नौकरी" की दराज खोलने वाली एक सार्वभौमिक कुंजी की तरह है, चाहे उसके अंदर कोई भी हो।

3. "चेन ऑफ थॉट" (Chain of Thought) का जादू

इस पेपर ने कठिन प्रश्नों को भी देखा, जैसे: "एलिस की पत्नी की माता कौन है?" (यह एक "मल्टी-हॉप" प्रश्न है)।

बिना चेन ऑफ थॉट के (कठिन तरीका):
यदि AI एक ही बड़ी छलांग में इसे हल करने की कोशिश करता है, तो यह एक अंधे मोड़ (maze) में चलते समय पूरे मानचित्र को अपने दिमाग में रखकर चलने जैसा है। ऐसा करने के लिए, AI को एक ऐसे विशाल सूटकेस की आवश्यकता होगी जो कमरे में फिट ही न हो सके (एक घातीय रूप से बड़ा मेमोरी)। उसे एक साथ हर संभावित रास्ते को याद करना होगा।

चेन ऑफ थॉट के साथ (आसान तरीका):
पेपर दिखाता है कि यदि AI को ज़ोर से सोचने (मध्यवर्ती चरणों को लिखने) की अनुमति दी जाती है, तो यह सब कुछ बदल देता है।

  • चरण 1: "एलिस की पत्नी कौन है?" -> "सारा" लिखता है।
  • चरण 2: "सारा की माता कौन है?" -> "मैरी" लिखता है।

बड़े जंप को छोटे, एकल चरणों में तोड़कर, AI को अब एक विशाल सूटकेस की आवश्यकता नहीं है। उसे बस एक छोटा, कुशल सूटकेस चाहिए। "चेन ऑफ थॉट" एक रिले रेस की तरह कार्य करता है: एक धावक द्वारा पूरी दूरी के लिए पूरा बैटन ले जाने के बजाय, वे हर कदम पर इसे एक-दूसरे को सौंपते हैं। यह AI को जटिल पहेलियों को कम मेमोरी के साथ हल करने की अनुमति देता है।

4. "ज़ीरो-शॉट" का आश्चर्य

इस पेपर का सबसे रोमांचक हिस्सा वह प्रयोग है जो उन्होंने चलाया। उन्होंने AI को तथ्यों के एक सेट पर प्रशिक्षित किया (जैसे, "एलिस की नौकरी डॉक्टर है")। फिर, उन्होंने AI के उस हिस्से को फ्रीज (freeze) कर दिया जो फ़िल्टरिंग करता है (MLP) और उसे लोगों और तथ्यों का एक पूरी तरह से नया सेट दिया जिसे उसने पहले कभी नहीं देखा था (जैसे, "बॉब की नौकरी बेकर है")।

परिणाम: AI ने बिना किसी नए प्रशिक्षण के तुरंत सही उत्तर दे दिया।
यह सिद्ध करता है कि AI ने केवल एलिस के विशिष्ट तथ्यों को याद नहीं किया। इसने खेल की ज्यामिति (geometry of the game) को सीखा। इसने किसी व्यक्ति से नौकरी निकालने के "आकार" को सीखा है, और यह किसी भी नए व्यक्ति पर उस आकार को तुरंत लागू कर सकता है। यह साइकिल चलाने के बारे में सीखने जैसा है; एक बार जब आप संतुलन सीख जाते हैं, तो आप किसी भी साइकिल को चला सकते हैं, भले ही आपने उसे पहले कभी न देखा हो।

सारांश

  • पुराना दृष्टिकोण: AI एक विशाल, ब्रूट-फोर्स डेटाबेस है जो हर तथ्य को अलग से संग्रहीत करता है।
  • नया दृष्टिकोण (यह पेपर): AI एक ज्यामितीय वास्तुकार (geometric architect) है। यह तथ्यों को सघन "सूटकेस" में करीने से स्टैक करता है और उत्तर निकालने के लिए एक सार्वभौमिक "फ़िल्टर" का उपयोग करता है।
  • लाभ: यह तरीका अविश्वसनीय रूप से कुशल है। यह AI को बहुत कम स्थान का उपयोग करके लाखों तथ्यों को याद रखने की अनुमति देता है, और यह जो कुछ भी सीखा है उसे तुरंत नई स्थितियों में लागू कर सकता है।
  • गुप्त हथियार: AI को "चरण-दर-चरण सोचने" (Chain of Thought) की अनुमति देना विशाल मेमोरी की आवश्यकता को समाप्त कर देता है, जिससे असंभव पहेलियाँ सरल, प्रबंधनीय चरणों में बदल जाती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →