← नवीनतम पेपर
💬 NLP

Language Models are Symbolic Learners in Arithmetic

यह शोध पत्र तर्क देता है कि भाषा मॉडल अंकगणित के वास्तविक एल्गोरिदम को नहीं सीखते हैं, बल्कि इसके बजाय वे लालची प्रतीकात्मक शिक्षार्थी (greedy symbolic learners) के रूप में कार्य करते हैं जो सरल, कम-टोकन वाले शॉर्टकट की एक पदानुक्रमित कैस्केड (cascade) को प्राप्त करके कार्यों में महारत हासिल करते हैं, एक ऐसी प्रक्रिया जिसका प्रमाण बहु-अंकों वाले गुणन में एक U-आकार का सटीकता पैटर्न है जो सरलतम इनपुट-आउटपुट मैपिंग की गुणवत्ता को दर्शाता है।

मूल लेखक: Chunyuan Deng, Zhiqi Li, Roy Xie, Ruidi Chang, Hanjie Chen

प्रकाशित 2026-01-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chunyuan Deng, Zhiqi Li, Roy Xie, Ruidi Chang, Hanjie Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य प्रश्न: क्या वे गणित के उस्ताद हैं या केवल पैटर्न पहचानने वाले?

कल्पना कीजिए कि आप एक ऐसे छात्र को देखते हैं जो एक विशाल गुणा की समस्या (जैसे 12,345×67,89012,345 \times 67,890) का अंतिम अंक तुरंत बता देता है, लेकिन बीच के अंकों पर अटक जाता है। आप पूछ सकते हैं: क्या वे वास्तव में समझते हैं कि गुणा कैसे काम करता है, या वे केवल उन पैटर्न के आधार पर अनुमान लगा रहे हैं जिन्हें उन्होंने पहले देखा है?

यह शोध पत्र तर्क देता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) दूसरे वाले ही हैं। वे गणित के "एल्गोरिदम" (वे चरण-दर-चरण नियम जो हम स्कूल में सिखाते हैं) को नहीं सीख रहे हैं। इसके बजाय, वे लालची शॉर्टकट लेने वालों (greedy shortcut-takers) की तरह काम कर रहे हैं। वे सही उत्तर पाने के लिए सबसे आसान, सरल तरीका खोजते हैं, और अंतर्निहित तर्क (logic) को सीखने के बजाय विशिष्ट प्रतीक-से-प्रतीक (symbol-to-symbol) के ट्रिक्स को याद कर लेते हैं।

जासूसी उपकरण: "सबग्रुप इंडक्शन" (Subgroup Induction)

इसे सिद्ध करने के लिए, लेखकों ने एक नया जासूसी उपकरण बनाया जिसे सबग्रुप इंडक्शन कहा जाता है।

गुणा की समस्या को एक विशाल पहेली की तरह समझें। इसे हल करने के लिए, आपको आमतौर पर इसमें शामिल सभी संख्याओं को देखने की आवश्यकता होती है। लेकिन यह उपकरण एक सरल प्रश्न पूछता है: "क्या हम इनपुट के एक बहुत छोटे, विशिष्ट हिस्से को देखकर ही उत्तर के केवल एक भाग को हल कर सकते हैं?"

  • उपमा (Analogy): कल्पना कीजिए कि आप केक का स्वाद पहचानने की कोशिश कर रहे हैं।
    • एल्गोरिदम का तरीका: आप पूरे केक को चखते हैं, मैदा, चीनी, अंडे और बेकिंग समय का विश्लेषण करते हैं, और स्वाद की गणना करते हैं।
    • शॉर्टकट का तरीका: आप बस वैनिला एक्सट्रैक्ट (vanilla extract) की खुशबू सूंघ लेते हैं। यदि आपको वैनिला की खुशबू आती है, तो आप अनुमान लगाते हैं "वैनिला केक"। आपको अंडों या ओवन के तापमान के बारे में जानने की आवश्यकता नहीं थी; आपने बस एक त्वरित, विश्वसनीय शॉर्टकट ढूंढ लिया।

शोध पत्र इन शॉर्टकट को "सबग्रूप्स" (Subgroups) कहता है। एक सबग्रूप एक छोटा सा मैपिंग है, जैसे "यदि अंतिम अंक 3 और 4 हैं, तो उत्तर का अंत जरूर 2 पर होगा।"

"U-आकार" की खोज

शोधकर्ताओं ने मॉडल्स को गुणा की समस्याओं पर प्रशिक्षित करके इसका परीक्षण किया। उन्होंने पाया कि मॉडल्स के प्रदर्शन में एक अजीब, सुसंगत पैटर्न था, जो ग्राफ पर एक U-आकार जैसा दिखता है:

  1. किनारे (उच्च सटीकता): मॉडल्स उत्तर के पहले और अंतिम अंकों की भविष्यवाणी करने में अद्भुत थे।
  2. मध्य (कम सटीकता): मॉडल्स उत्तर के बीच के अंकों की भविष्यवाणी करने में बहुत खराब थे।

ऐसा क्यों होता है?

  • किनारे आसान शॉर्टकट हैं: गुणा का अंतिम अंक, गुणा की जा रही संख्याओं के अंतिम अंकों पर निर्भर करता है। यह एक आदर्श, सरल शॉर्टकट है (जैसे वैनिला की खुशबू)। मॉडल्स इसे तुरंत सीख लेते हैं क्योंकि इसके लिए बहुत कम संख्याओं को देखने की आवश्यकता होती है।
  • मध्य कठिन है: बीच के अंक अन्य सभी संख्याओं और "कैरी ओवर" (carry over) मूल्यों के एक जटिल मिश्रण पर निर्भर करते हैं। यहाँ कोई सरल, छोटा शॉर्टकट नहीं है। बीच के अंक को सही करने के लिए, आपको एक साथ लगभग सब कुछ देखना होगा।

शोध पत्र दिखाता है कि मॉडल्स का प्रदर्शन वक्र इन शॉर्टकट की "गुणवत्ता" से पूरी तरह मेल खाता है। वे आसान, कम प्रयास वाले शॉर्टकट में महारत हासिल करते हैं। वे जटिल, उलझे हुए मध्य भागों को सीखना तभी शुरू करते हैं जब उन्हें अधिक प्रशिक्षण द्वारा मजबूर किया जाता है।

सीखने का "पेड़" (The Tree of Learning)

लेखक सीखने की प्रक्रिया को एक पेड़ पर चढ़ने के रूप में देखते हैं:

  • पेड़ का निचला हिस्सा: बहुत कम संख्याओं का उपयोग करने वाले सरल शॉर्टकट (सीखने में आसान, सिरों के लिए उच्च सटीकता)।
  • पेड़ का ऊपरी हिस्सा: कई संख्याओं का उपयोग करने वाले जटिल शॉर्टकट (सीखने में कठिन, मध्य भाग के लिए आवश्यक)।

मॉडल्स नीचे से शुरुआत करते हैं। वे पहले आसान जीत (easy wins) हासिल करते हैं। जैसे-जैसे उन्हें अधिक प्रशिक्षण मिलता है, वे कठिन और अधिक जटिल पैटर्न से निपटने के लिए धीरे-धीरे पेड़ पर ऊपर चढ़ते हैं। वे एक साथ "पूरा पेड़" नहीं सीखते; वे सबसे आसान वाले से शुरू करते हुए शाखा-दर-शाखा सीखते हैं।

"एन्ट्रॉपी" मीटर: कठिनाई को मापना

शोध पत्र एक दूसरा उपकरण भी पेश करता है जिसे सबग्रुप एन्ट्रॉपी (Subgroup Entropy) कहा जाता है। इसे एक "कन्फ्यूजन मीटर" (Confusion Meter) के रूप में समझें।

  • यदि किसी शॉर्टकट की एन्ट्रॉपी कम है, तो इसका मतलब है कि उत्तर बहुत अनुमानित है (जैसे, "3 गुना 4 हमेशा 12 होता है")।
  • यदि किसी शॉर्टकट की एन्ट्रॉपी अधिक है, तो इसका मतलब है कि उत्तर अराजक और बिना विवरण देखे अनुमान लगाना कठिन है।

शोधकर्ताओं ने पाया कि जब उन्होंने जटिल तर्क कार्यों (जैसे चेन-ऑफ-थॉट, जहाँ मॉडल चरण-दर-चरण सोचता है) को तोड़ दिया, तो वे रास्ते जिनमें सबसे कम कन्फ्यूजन (एन्ट्रॉपी) था, वे ही थे जिन्हें मॉडल्स ने सबसे अधिक बार सही ढंग से हल किया। यह पुष्टि करता है कि मॉडल्स प्रतिरोध के सबसे कम मार्ग (path of least resistance) को पसंद करते हैं—वे उत्तर तक पहुँचने के लिए सबसे आसान, सबसे अनुमानित चरणों को चुनते हैं।

निष्कर्ष (The Bottom Line)

शोध पत्र निष्कर्ष निकालता है कि भाषा मॉडल (Language Models) मानवीय अर्थों में "गणना" (compute) करना नहीं सीख रहे हैं। वे सिंबोलिक लर्नर्स (Symbolic Learners) हैं जो शॉर्टकट का एक पदानुक्रम (hierarchy) बनाते हैं।

  • वे गुणा की "रेसिपी" नहीं सीखते।
  • वे "यदि-तो" (if-then) ट्रिक्स का एक विशाल पुस्तकालय सीखते हैं, जो सबसे सरल (जैसे अंतिम अंक) से शुरू होकर, अधिक अनुभव के साथ धीरे-धीरे अधिक जटिल (जैसे मध्य अंक) की ओर बढ़ता है।

संक्षेप में: LLMs कुशल पैटर्न मैचर्स हैं जो शॉर्टकट पसंद करते हैं, न कि एल्गोरिथम विचारक। वे गणित को हमारे तरीके से हल करने के बजाय, प्रतीकों के माध्यम से सबसे आसान रास्ता खोजकर हल करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →