← नवीनतम पेपर
💻 computer science

Value-Aware Numerical Representations for Transformer Language Models

यह शोध पत्र एक मूल्य-जागरूक संख्यात्मक प्रतिनिधित्व प्रस्तुत करता है जो मानक टोकन इनपुट को एक मूल्य-सशर्त प्रीफ़िक्स टोकन के साथ संवर्धित करता है ताकि संख्यात्मक परिमाण को स्पष्ट रूप से एनकोड किया जा सके, जिससे अंकगणितीय और संख्यात्मक तर्क कार्यों में ट्रांसफॉर्मर भाषा मॉडलों की सुदृढ़ता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Andreea Dutulescu, Stefan Ruseti, Mihai Dascalu

प्रकाशित 2026-01-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andreea Dutulescu, Stefan Ruseti, Mihai Dascalu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Value-Aware Numerical Representations for Transformer Language Models" पेपर का सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

समस्या: मॉडल गणित में "अनपढ़" है

कल्पना कीजिए कि एक बहुत ही बुद्धिमान छात्र (AI) है जिसने लाखों किताबें पढ़ी हैं। यह छात्र कहानियाँ लिखने, सवालों के जवाब देने और यहाँ तक कि जटिल तर्क पहेलियों को सुलझाने में भी बहुत अच्छा है। हालाँकि, जब बुनियादी गणित की बात आती है, तो यह छात्र आश्चर्यजनक रूप से खराब प्रदर्शन करता है।

यदि आप छात्र से पूछें, "क्या 9.11, 9.9 से बड़ा है?", तो वह आत्मविश्वास से कह सकता है "हाँ।" क्यों? क्योंकि छात्र के लिए, संख्याएँ मात्रा नहीं हैं; वे केवल शब्द हैं।

  • अभी यह कैसे काम करता है: AI "14" संख्या को अक्षरों के एक क्रम के रूप में देखता है: "1" और "4"। यह उन्हें "बिल्ली" और "कुत्ता" जैसे शब्दों की तरह मानता है। इसे स्वाभाविक रूप से यह "पता" नहीं है कि 14, 9 से बड़ा है। यह केवल इस आधार पर अनुमान लगाता है कि उसने अपने प्रशिक्षण ग्रंथों में "14" और "9" को कितनी बार एक साथ देखा है।
  • परिणाम: जैसे-जैसे संख्याएँ लंबी या अधिक जटिल होती जाती हैं, AI भ्रमित हो जाता है, जिससे वह मूर्खतापूर्ण अंकगणितीय गलतियाँ करता है क्योंकि वह केवल अनुक्रम में अगले "शब्द" का अनुमान लगा रहा होता है, गणना नहीं कर रहा होता।

समाधान: "वैल्यू टैग" (Value Tag)

लेखक एक सरल लेकिन शक्तिशाली समाधान प्रस्तावित करते हैं। वे AI को एक "चीट शीट" देना चाहते हैं जो उसे अंकों को देखने से पहले ही उनकी वास्तविक वजन या आकार बता दे।

वे एक विशेष, अदृश्य टैग पेश करते हैं जिसे <num> कहा जाता है, जिसे किसी भी वाक्य में किसी भी संख्या से ठीक पहले रखा जाता है।

  • पुराना तरीका: "मेरे पास 14 सेब हैं।" (AI देखता है: "मेरे", "पास", "1", "4", "सेब" हैं।)
  • नया तरीका: "मेरे पास <num> 14 सेब हैं।"

यही जादू है: उस <num> टैग का एम्बेडिंग (आंतरिक कोड) कोई रैंडम शब्द नहीं है। यह गणितीय रूप से 14 संख्या के आधार पर गणना किया गया है। यह ऐसा है जैसे "14" शब्द के साथ एक भौतिक वजन जोड़ना ताकि AI महसूस कर सके कि वह कितना भारी है।

यह कैसे काम करता है (प्रशिक्षण का उदाहरण)

AI को एक शेफ (रसोइया) के रूप में सोचें जो खाना बनाना सीख रहा है।

  1. प्रशिक्षण के दौरान (अभ्यास रसोई):
    शेफ को एक रेसिपी दी जाती है जिसमें लिखा है, "14 ग्राम चीनी डालें।"

    • AI टैग <num> देखता है और एक विशेष मशीन तुरंत 14 का सटीक "फ्लेवर प्रोफाइल" (स्वाद का विवरण) निकालती है और उसे शेफ को सौंप देती है।
    • शेफ सीखता है: "जब मैं इस विशिष्ट फ्लेवर प्रोफाइल को देखता हूँ, तो मैं जानता हूँ कि '14' का वास्तव में क्या अर्थ है।"
    • AI वाक्य के पिछले शब्दों को देखकर उस फ्लेवर प्रोफाइल का अनुमान लगाना भी सीख जाता है, ताकि वह बिना मशीन के भी संख्या के वजन का अनुमान लगाने में बेहतर हो सके।
  2. परीक्षण के दौरान (असली रेस्टोरेंट):
    शेफ को एक नया व्यंजन बनाने के लिए कहा जाता है। वे टैग <num> देखते हैं लेकिन मशीन वहाँ नहीं है जो उन्हें फ्लेवर प्रोफाइल दे सके।

    • हालाँकि, क्योंकि उन्होंने बहुत अभ्यास किया है, शेफ अब संदर्भ के आधार पर यह याद रख सकता है कि "14" का स्वाद कैसा महसूस होता है।
    • वे इस आंतरिक स्मृति का उपयोग यह सही ढंग से समझने के लिए करते हैं कि 14, 9 से बड़ा है, और वे गलतियाँ नहीं करते हैं।

टैग के दो "फ्लेवर" (Flavors)

शोधकर्ताओं ने इस "फ्लेवर प्रोफाइल" को बनाने के दो अलग-अलग तरीके आज़माए:

  1. "फिक्स्ड ग्रिड" (MLP): एक रूलर (पैमाने) की कल्पना करें जिसमें निश्चित निशान हैं। आप हर संख्या को एक विशिष्ट ग्रिड में फिट होने के लिए मजबूर करते हैं। यह सरल है, लेकिन यदि कोई संख्या बहुत लंबी या अजीब है, तो उसे दबाया जा सकता है।
  2. "लचीला इंची टेप" (RNN): एक इंची टेप की कल्पना करें जो किसी भी लंबाई के अनुसार फैल सकता है। यह विधि संख्या को अंक-दर-अंक प्रोसेस करती है, जैसे कोई इंसान लंबी संख्या पढ़ता है। यह विभिन्न आकार की संख्याओं को संभालने में थोड़ा बेहतर साबित हुआ।

परिणाम: क्या यह काम करता है?

शोधकर्ताओं ने इसका परीक्षण एक विशेष गणित परीक्षा (जिसे NUPA कहा जाता है) पर किया, जिसे AI को बुनियादी गणित की गलतियाँ करने के लिए फँसाने के लिए डिज़ाइन किया गया था।

  • मानक AI: लगभग 68% उत्तर सही देता था। इसे लंबी संख्याओं और तुलनाओं में संघर्ष करना पड़ा।
  • "वैल्यू-अवेयर" AI: लगभग 72% उत्तर सही देता है।
  • अंतर: 4% छोटा लग सकता है, लेकिन AI की दुनिया में, यह एक बड़ी छलांग है। सबसे महत्वपूर्ण बात यह है कि नया AI यह समझने में बहुत बेहतर हो गया कि 7-अंकों वाली संख्या 3-अंकों वाली संख्या से बहुत अलग है, जबकि पुराना AI अक्सर संख्याएँ लंबी होने पर भ्रमित हो जाता था।

यह क्यों महत्वपूर्ण है

अधिकांश वर्तमान AI शोध गणित की समस्याओं को ठीक करने के लिए AI को "ज़्यादा सोचने" (तर्क की लंबी श्रृंखला उत्पन्न करने) के लिए प्रेरित करने की कोशिश करता है। यह पेपर तर्क देता है कि समस्या यह नहीं है कि AI पर्याप्त सोच नहीं रहा है; समस्या यह है कि AI जानता ही नहीं कि संख्या क्या है

AI को सीधे संख्यात्मक मान (परिमाण) की "समझ" देकर, उन्होंने त्रुटि के मूल कारण को ठीक कर दिया। यह एक बच्चे को ब्लॉक्स (गुटके) की तस्वीरें दिखाने के बजाय, उन्हें पकड़ने के लिए वास्तविक ब्लॉक्स देने जैसा है।

सारांश

  • समस्या: AI संख्याओं को शब्दों की तरह मानता है, जिससे गणित में गलतियाँ होती हैं।
  • समाधान: संख्याओं से पहले एक विशेष टैग जोड़ें जो संख्या का वास्तविक गणितीय "वजन" ले जाता है।
  • परिणाम: AI बुनियादी गणित और तुलनाओं में बहुत अधिक विश्वसनीय हो जाता है, जिसके लिए उसे शून्य से फिर से प्रशिक्षित करने या जटिल नए आर्किटेक्चर की आवश्यकता नहीं होती है। यह एक हल्का अपग्रेड है जो AI को संख्याओं को केवल प्रतीकों के रूप में नहीं, बल्कि मात्राओं के रूप में "देखने" में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →