← नवीनतम पेपर
🤖 machine learning

NRGPT: An Energy-based Alternative for GPT

यह शोध पत्र NRGPT प्रस्तुत करता है, जो एक संशोधित GPT आर्किटेक्चर है जो जनरेटिव मॉडलिंग को ऊर्जा-आधारित ढांचों के साथ जोड़ता है, इन्फरेंस (inference) को एक ऊर्जा परिदृश्य (energy landscape) के अन्वेषण के रूप में अवधारणाबद्ध करता है, और विभिन्न कार्यों में प्रतिस्पर्धी प्रदर्शन प्रदर्शित करते हुए ओवरफिटिंग के प्रति बढ़ी हुई प्रतिरोधक क्षमता प्रदर्शित करता है।

मूल लेखक: Nima Dehmamy, Benjamin Hoover, Bishwajit Saha, Leo Kozachkov, Jean-Jacques Slotine, Dmitry Krotov

प्रकाशित 2026-05-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nima Dehmamy, Benjamin Hoover, Bishwajit Saha, Leo Kozachkov, Jean-Jacques Slotine, Dmitry Krotov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक हाई-स्पीड ट्रेन से लेकर एक लुढ़कती गेंद तक

एक मानक एआई भाषा मॉडल (जैसे प्रसिद्ध GPT) की कल्पना एक हाई-स्पीड ट्रेन के रूप में करें। यह ट्रैक पर एक-एक टोकन के हिसाब से आगे बढ़ती है। जब यह "The" शब्द देखती है, तो यह तुरंत जान जाती है कि अगला शब्द संभवतः "cat" या "dog" होगा, जो इसके प्रशिक्षण पर आधारित है। यह तेज़ है, लेकिन यह केवल उन्हीं पटरियों का अनुसरण करती है जो इसके प्रशिक्षण के दौरान बिछाई गई थीं।

इस शोध पत्र के लेखक इस बात को समझने का एक अलग तरीका प्रस्तावित करते हैं कि ये मॉडल कैसे काम करते हैं। वे अपने नए मॉडल को NRGPT कहते हैं। ट्रैक पर चलती ट्रेन के बजाय, NRGPT को एक पहाड़ी परिदृश्य में लुढ़कती हुई गेंद के रूप में कल्पना करें।

इस नए दृष्टिकोण में:

  • परिदृश्य (The Landscape): "पहाड़" और "घाटियाँ" टेक्स्ट की ऊर्जा (energy) का प्रतिनिधित्व करती हैं।
  • गेंद (The Ball): वर्तमान शब्द (या टोकन) जिसे मॉडल को भविष्यवाणी करनी है।
  • लक्ष्य (The Goal): गेंद सबसे गहरी घाटी (न्यूनतम ऊर्जा वाली स्थिति) में लुढ़कना चाहती है। एआई की दुनिया में, "कम ऊर्जा की स्थिति" का अर्थ है एक ऐसा शब्द जो वाक्य के संदर्भ में बिल्कुल सटीक और तार्किक हो।

यह पेपर तर्क देता है कि केवल अगले शब्द की "भविकीवाणी" करने के बजाय, मॉडल वास्तव में भू-भाग का अन्वेषण (exploring terrain) करता है ताकि यह पता लगाया जा सके कि अगला शब्द उतरने के लिए सबसे स्थिर और तार्किक स्थान कौन सा है।

यह कैसे काम करता है: शब्दों की "ऊर्जा"

यह पेपर एनर्जी-बेस्ड मॉडलिंग (EBM) की अवधारणा पेश करता है। इसे इस तरह समझें:

  • उच्च ऊर्जा (High Energy): एक शब्द जो "गलत" या "बाधक" महसूस होता है (जैसे, यदि संदर्भ चिड़ियाघर के बारे में है, तो "The cat ate the pizza..."। यह पहाड़ी का एक ऊँचा बिंदु है)।
  • कम ऊर्जा (Low Energy): एक शब्द जो "सही" और स्वाभाविक महसूस होता है (जैसे, "The cat ate the mouse")। यह एक गहरी घाटी है।

NRGPT मॉडल को इस तरह बनाया गया है कि इसकी आंतरिक गणितीय संरचना इस परिदृश्य को उत्पन्न करती है। जब मॉडल को अगले शब्द को उत्पन्न करने की आवश्यकता होती है, तो यह केवल एक अनुमान नहीं लगाता; बल्कि यह एक ग्रेडिएंट डिसेंट (gradient descent) करता है। जर्मन में, इसका अर्थ है कि यह ऊपर की ओर छोटे कदम उठाता है और लगातार जाँच करता है: "क्या यह शब्द उस शब्द से कम ऊर्जा (बेहतर) वाला है जिस पर मैं वर्तमान में हूँ?" यह तब तक नीचे की ओर कदम बढ़ाता रहता है जब तक कि इसे एक स्थिर बिंदु न मिल जाए।

"न्यूनतम" परिवर्तन

लेखकों ने पुराने GPT आर्किटेक्चर को पूरी तरह से हटाया नहीं है। इसके बजाय, उन्होंने एक न्यूनतम संशोधन (minimal modification) किया है।

  • उन्होंने GPT के मानक निर्माण खंडों (parts) को लिया (वे हिस्से जो अटेंशन और फीड-फॉरवर्ड प्रोसेसिंग को संभालते हैं)।
  • उन्होंने गणित को इस तरह से फिर से लिखा ताकि ये ब्लॉक उन बलों (forces) की तरह कार्य करें जो गेंद को पहाड़ी से नीचे धकेलते हैं।
  • उन्होंने सिद्ध किया कि कुछ शर्तों के तहत, यह "लुढ़कती गेंद" की प्रक्रिया गणितीय रूप से मानक "ट्रैक पर चलती ट्रेन" की प्रक्रिया के समान है, बस इसे देखने का एक अलग नजरिया है।

उन्होंने क्या परीक्षण किया (प्रयोग)

टीम ने यह देखने के लिए तीन अलग-अलग प्रकार की चुनौतियों पर NRGPT का परीक्षण किया कि क्या "लुढ़कती गेंद" वाला दृष्टिकोण वास्तव में काम करता है:

  1. गणितीय पहेलियाँ (ListOps): उन्होंने मॉडल को संख्याओं और गणितीय ऑपरेशनों की सूचियाँ दीं (जैसे "4 और 13 के अधिकतम का योग")। NRGPT ने मानक मॉडलों के समान ही प्रदर्शन किया और दिखाया कि यह तर्क (logic) को संभाल सकता है।
  2. शेक्सपियर (Shakespeare): उन्होंने मॉडल को शेक्सपियर की शैली में लिखने के लिए कहा। NRGPT ने उत्कृष्ट कार्य किया और मानक मॉडलों की गुणवत्ता से मेल खाया, लेकिन एक ट्विस्ट के साथ: इसमें ओवरफिटिंग (overfitting) नहीं हुई।
    • उपमा: एक ऐसे छात्र की कल्पना करें जो किसी पाठ्यपुस्तक को इतनी सटीकता से याद कर लेता है कि यदि शब्द थोड़े भी बदल दिए जाएं, तो वह प्रश्न का उत्तर नहीं दे पाता। यही "ओवरफिटिंग" है। NRGPT ने शेक्सपियर के टेक्स्ट को केवल रटने के बजाय उनके सिद्धांत/अवधारणा को सीखा, जिससे यह एक तरह से अधिक मजबूत (robust) बना।
  3. वास्तविक दुनिया का टेक्स्ट (OpenWebText): उन्होंने इंटरनेट टेक्स्ट के एक विशाल डेटासेट पर इसका परीक्षण किया। NRGPT ने मानक मॉडलों के प्रतिस्पर्धी टेक्स्ट उत्पन्न किया, जिसमें कम "पैरामीटर्स" (कम मस्तिष्क शक्ति या मेमोरी) का उपयोग किया गया।

मुख्य निष्कर्ष और "अजीबोगरीब बातें"

  • एसिम्प्टोटिक स्टेबिलिटी (Asymptotic Stability): पेपर में "लुढ़कती गेंद" के बारे में एक दिलचस्प बात सामने आई। एक बार जब गेंद किसी घाटी में आकर रुक जाती है, तो वह हिलती नहीं है। लेखक इसे "एसिम्प्टोटिक स्टेबिलिटी" कहते हैं। इसका अर्थ है कि मॉडल स्वाभाविक रूप से एक स्थिर उत्तर में परिवर्तित हो जाता है और उतार-चढ़ाव को रोक देता है, जो कि एक अच्छी सैद्धांतिक विशेषता है।
  • ओवरफिटिंग के प्रति प्रतिरोध: शेक्सपियर डेटासेट पर, NRGPT मानक मॉडलों की तुलना में "याद करने के जाल" में उतनी आसानी से नहीं फंसा जब मॉडल बहुत बड़े हो गए।
  • लागत (The Costs): यहाँ एक ट्रेड-ऑफ है। हालांकि NRGPT कम "पैरामीटर्स" (मेमोरी) का उपयोग कर सकता है, लेकिन गेंद को पहाड़ी से नीचे लुढ़काने के लिए आवश्यक गणनात्मक चरण (FLOPs) मानक ट्रेन दृष्टिकोण की तुलना में थोड़े अधिक महंगे हो सकते हैं। यह पहाड़ से नीचे जाने वाले एक सीधे लिफ्ट के बजाय एक सुंदर, घुमावदार रास्ते जैसा है; आप अधिक देख सकते हैं, लेकिन इसमें थोड़ा अधिक प्रयास करना पड़ता है।

निष्कर्ष

यह पेपर निष्कर्ष निकालता है कि NRGPT दो अलग-अलग दुनियाओं को जोड़ने का एक सफल प्रयोग है: लोकप्रिय GPT डिज़ाइन और सैद्धांतिक एनर्जी-बेस्ड मॉडल्स।

यह सिद्ध करता है कि हम टेक्स्ट जनरेशन को केवल भविष्यवाणी के रूप में नहीं, बल्कि एक ऑप्टिमाइज़ेशन प्रक्रिया के रूप में देख सकते—जो कि सबसे स्थिर, तार्किक स्थिति की खोज है। हालांकि यह अभी भी हर एक मेट्रिक में सर्वश्रेष्ठ GPT मॉडलों को नहीं हरा पा रहा है, लेकिन यह हमें यह समझने का एक नया, गणितीय रूप से सुंदर तरीका प्रदान करता है कि ये शक्तिशाली एआई दिमाग कैसे काम करते हैं। यह सुझाव देता है कि एआई के लिए "सोचना" केवल एक बहुत ही जटिल ऊर्जा परिदृश्य में सबसे गहरे बिंदु को खोजने का मामला हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →