← नवीनतम पेपर
💬 NLP

Weights to Code: Extracting Interpretable Algorithms from the Discrete Transformer

यह शोधपत्र डिस्क्रीट ट्रांसफॉर्मर (Discrete Transformer) को प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो टेम्परेचर-एनिलियेटेड सैंपलिंग (temperature-annealed sampling) के माध्यम से विविक्तता (discreteness) को इंजेक्ट करके मानक ट्रांसफॉर्मर्स में प्रतिनिधित्व एंटैंगलमेंट (representation entanglement) को दूर करता है ताकि निरंतर मॉडलों से व्याख्या योग्य, मानव-पठनीय एल्गोरिदम का निष्कर्षण सक्षम किया जा सके।

मूल लेखक: Yifan Zhang, Wei Bi, Kechi Zhang, Dongming Jin, Jie Fu, Zhi Jin

प्रकाशित 2026-03-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yifan Zhang, Wei Bi, Kechi Zhang, Dongming Jin, Jie Fu, Zhi Jin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट शेफ (एक Transformer) है, जिसने लाखों व्यंजनों का स्वाद लेकर हजारों रेसिपी बनाना सीख लिया है। वह जानता है कि एक परफेक्ट केक कैसे बनाया जाता है, लेकिन अगर आप उससे पूछें, "आपने यह कैसे किया?" तो वह खुद को समझा नहीं सकता। वह बस कहता है, "मैंने अपने दिमाग के एक बड़े, अस्त-व्यस्त कटोरे में सामग्री को मिलाया।"

समस्या यह है कि रोबोट का दिमाग एक किचन ब्लेंडर की तरह है। यह सब कुछ इतनी अच्छी तरह से मिला देता है कि आप यह नहीं बता सकते कि आटा कहाँ खत्म हुआ और चीनी कहाँ शुरू हुई। इसे "एंटैंगलमेंट" (entanglement) कहा जाता है। क्योंकि सामग्रियाँ आपस में मिल गई हैं, आप उसके दिमाग से एक साफ, लिखित रेसिपी (एक एल्गोरिदम) बाहर नहीं निकाल सकते।

यह पेपर एक नए प्रकार के रोबोट शेफ को पेश करता है जिसे डिस्क्रीट ट्रांसफॉर्मर (Discrete Transformer) कहा जाता है। ब्लेंडर के बजाय, यह शेफ एक मॉड्यूलर असेंबली लाइन का उपयोग करता है।

यह कैसे काम करता है, यहाँ सरल चरणों में दिया गया है:

1. विशेष असेंबली लाइन (The Specialized Assembly Line)

लेखकों ने रोबोट के दिमाग को दो अलग-अलग, स्पष्ट टीमों के साथ फिर से डिज़ाइन किया है:

  • डिलीवरी टीम (Numerical Attention): उनका एकमात्र काम सामग्रियों को एक स्थान से दूसरे स्थान पर ले जाना है। वे चीजें मिलाते या पकाते नहीं हैं; वे बस कहते हैं, "फ्रिज से अंडा उठाओ और उसे काउंटर पर रख दो।"
  • मिक्सिंग टीम (Numerical MLP): उनका एकमात्र काम गणित करना है। वे उन सामग्रियों को लेते हैं जिन्हें डिलीवरी टीम लेकर आई है और उन्हें मिलाते हैं (जोड़ना, घटाना, गुणा करना)। वे चीजों को इधर-उधर नहीं घुमाते।

इन कामों को अलग रखने के लिए मजबूर करके, "ब्लेंडर" का प्रभाव खत्म हो जाता है। आप स्पष्ट रूप से देख सकते हैं कि किसने क्या हिलाया और किसने क्या मिलाया।

2. "तापमान" प्रशिक्षण (The "Temperature" Training)

इस रोबोट को सिखाने के लिए, लेखक टेम्परेचर एनीलिंग (Temperature Annealing) नामक एक चतुर तकनीक का उपयोग करते हैं।

  • हॉट स्टार्ट (Hot Start): कल्पना कीजिए कि रोबोट एक बहुत गर्म कमरे में सीख रहा है। यह अराजक और धुंधला है। यह चीजों को हिलाने और मिलाने के कई अलग-अलग तरीके आज़माता है। यह खोज (exploring) कर रहा है।
  • कूलिंग डाउन (Cooling Down): धीरे-धीरे, वे तापमान को कम करते हैं। जैसे-जैसे वातावरण ठंडा होता है, रोबोट के चुनाव अधिक सटीक और निश्चित होते जाते हैं। वह अनुमान लगाना बंद कर देता है और ठोस निर्णय लेने लगता है।
  • फ्रोजन स्टेट (Frozen State): अंत तक, रोबोट एक परफेक्ट, कठोर अवस्था में "जम" जाता है। हर हलचल और हर मिश्रण बिल्कुल सटीक होता है। क्योंकि रोबोट को इतना सटीक होने के लिए मजबूर किया गया था, इसलिए उसका आंतरिक तर्क अब पूरी तरह से स्पष्ट है।

3. रेसिपी का रिवर्स-इंजीनियरिंग (Reverse-Engineering the Recipe)

एक बार जब रोबोट जम जाता है, तो लेखक जासूसों की तरह काम करते हुए रेसिपी लिखते हैं:

  • डिलीवरी टीम के लिए: वे देखते हैं कि रोबोट ने सामग्रियों को कहाँ स्थानांतरित किया। क्या इसने हमेशा "एक कदम पीछे" से वस्तु उठाई? यह एक सरल नियम है: पिछली वस्तु लें (Take previous item)।
  • मिक्सिंग टीम के लिए: वे देखते हैं कि रोबोट ने क्या गणित किया। एक अस्त-व्यस्त न्यूरल नेटवर्क देखने के बजाय, वे एक टूल (सिंबोलिक रिग्रेशन) का उपयोग करके छिपे हुए सरल गणितीय समीकरण को ढूंढते हैं, जैसे A + B या A * 2|

4. परिणाम: एक मानव-पठनीय पुस्तक (The Result: A Human-Readable Book)

अंत में, वे इन सुरागों को एक साथ जोड़ते हैं। एक बिखरे हुए न्यूरल नेटवर्क के बजाय, वे एक साफ, सरल पायथन (Python) कोड फ़ाइल तैयार करते हैं जो एक सामान्य कंप्यूटर प्रोग्राम की तरह दिखती है।

यह एक बड़ी बात क्यों है?

  • यह निरंतर संख्याओं (continuous numbers) पर काम करता है: पिछले तरीके केवल साधारण "ऑन/ऑफ" स्विच (जैसे 0 या 1) को ही संभाल सकते थे। यह नई विधि वास्तविक दुनिया की संख्याओं जैसे तापमान, गति या पैसा (उदाहरण के लिए, एक गेंद कितनी ऊँची गिरेगी, इसकी गणना करना) को भी संभाल सकती है।
  • यह नए समाधान खोजता है: क्योंकि रोबोट केवल मानव कोड की नकल नहीं कर रहा है, इसलिए वह किसी समस्या को हल करने का कोई चतुर, कुशल तरीका खोज सकता है जिसे किसी इंसान ने कभी नहीं सोचा था।
  • यह नियंत्रणीय है: यदि आप रोबोट को कहते हैं, "मिक्सिंग टीम का उपयोग न करें, केवल डिलीवरी टीम का उपयोग करें," तो वह केवल मूवमेंट का उपयोग करके समस्या को हल करने का एक पूरी तरह से अलग तरीका खोज लेगा। यह साबित करता है कि हम रोबोट की सोच को नियंत्रित कर सकते हैं।

निचोड़ (The Bottom Line)

यह पेपर "ब्लैक बॉक्स" ट्रांसफॉर्मर के रहस्य को सुलझाता है। उन्होंने एक ऐसा AI बनाया है जो एक धुंधलेपन (blur) के बजाय चरणों (steps) में सोचता है। इसे ठंडा करके और इसके कामों को अलग करके, वे इसके दिमाग के अंदर देख सकते हैं और एक स्पष्ट, लिखित निर्देश पुस्तिका निकाल सकते हैं जिसे इंसान पढ़ सकते हैं, समझ सकते हैं और भरोसा कर सकते हैं। यह एक जादू के खेल को एक चरण-दर-चरण विज्ञान प्रयोग में बदलने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →