← नवीनतम पेपर
💬 NLP

Strategy Executability in Mathematical Reasoning: Leveraging Human-Model Differences for Effective Guidance

यह शोध पत्र सफल समाधानों में तर्क रणनीतियों (reasoning strategies) के उपयोग और मार्गदर्शन के रूप में लागू किए जाने पर उनकी निष्पादन क्षमता (executability) के बीच एक महत्वपूर्ण अंतर की पहचान करता है, जिससे सेलेक्टिव स्ट्रैटेजी रिट्रीवल (SSR) का प्रस्ताव मिलता है, जो मानव-मॉडल अंतरों का लाभ उठाकर रणनीतियों को चुनिंदा रूप से संयोजित करने और विविध बेंचमार्क में गणितीय तर्क की सटीकता में उल्लेखनीय सुधार करने वाला एक ढांचा है।

मूल लेखक: Weida Liang, Yiyou Sun, Shuyuan Nan, Chuang Li, Dawn Song, Kenji Kawaguchi

प्रकाशित 2026-02-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weida Liang, Yiyou Sun, Shuyuan Nan, Chuang Li, Dawn Song, Kenji Kawaguchi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन गणितीय पहेली को हल करने की कोशिश कर रहे हैं। आपके पास एक प्रतिभाशाली मानव विशेषज्ञ और एक सुपर-फास्ट कंप्यूटर रोबोट दोनों हैं। दोनों ही पहेली को सही ढंग से हल कर सकते हैं, लेकिन वे इसे पूरी तरह से अलग तरीकों से करते हैं।

मानव विशेषज्ञ कह सकता है, "इस समस्या के आकार को देखो, यह एक त्रिभुज की तरह है, इसलिए हमें एक विशेष त्रिभुज नियम का उपयोग करना चाहिए।"
रोबोट कह सकता है, "आइए बस सभी संख्याओं को एक विशाल फॉर्मूले में डाल दें और उत्तर प्राप्त करने के लिए गणित को क्रंच करें।"

समस्या:
आमतौर पर, जब हम किसी कंप्यूटर को समस्या हल करने में मदद करने की कोशिश करते हैं, तो हम उसे उन उदाहरणों के माध्यम से निर्देश देते हैं कि कैसे एक इंसान ने समान समस्याओं को हल किया था। हम यह मान लेते हैं, "यदि एक इंसान ने इसे इस तरह से किया है, तो कंप्यूटर भी इसकी नकल कर सकता है।"

लेकिन इस शोध पत्र ने एक बड़ा आश्चर्य खोजा है: सिर्फ इसलिए कि कोई रणनीति एक इंसान के लिए काम करती है, इसका मतलब यह नहीं है कि कंप्यूटर वास्तव में उसे कर सकता है।

इसे इस तरह समझें:

  • मानव रणनीति (Human Strategy) एक शेफ को दी गई ऐसी रेसिपी की तरह है जो कहती है, "एक चुटकी 'आत्मा' और 'अंतर्ज्ञान' डालें।" एक मानव शेफ जानता है कि इसका वास्तव में क्या अर्थ है। लेकिन यदि आप वही निर्देश एक रोबोट शेफ को देते हैं, तो वह भ्रमित हो जाता है। वह नहीं जानता कि "आत्मा" को कैसे मापा जाए। रणनीति मौजूद है, लेकिन रोबोट उसे निष्पादित (execute) नहीं कर सकता।
  • रोबोट रणनीति (Robot Strategy) एक ऐसी रेसिपी की तरह है जो कहती है, "ठीक 3.14 ग्राम नमक डालें।" रोबोट इसे पूरी तरह से कर सकता है। लेकिन यदि आप यह निर्देश एक मानव शेफ को देते हैं, तो वे सोच सकते हैं, "यह इतना विशिष्ट क्यों है? मुझे पहले इसे चखने की आवश्यकता है।"

लेखक इस अंतर को "रणनीति निष्पादन क्षमता" (Strategy Executability) कहते हैं। यह एक समाधान में मौजूद रणनीति और उस विशिष्ट मॉडल के बीच का अंतर है जिसका आप उपयोग कर रहे हैं, जिसे वह वास्तव में कर पाने में सक्षम है।

समाधान: "स्मार्ट गाइड" (चयनात्मक रणनीति पुनर्प्राप्ति - Selective Strategy Retrieval)
शोधकर्ताओं ने SSR (Selective Strategy Retrieval) नामक एक नया सिस्टम बनाया है। मानव उदाहरणों या रोबोट के उदाहरणों की अंधाधुंध नकल करने के बजाय, SSR एक स्मार्ट मैचमेकर (सुजान मिलानकर्ता) की तरह कार्य करता है।

SSR कैसे काम करता है, इसके लिए एक रूपक (metaphor) का उपयोग करें:

कल्पना कीजिए कि आप एक ट्रैवल एजेंट (AI मॉडल) हैं जो एक यात्री (गणित की समस्या) को एक गंतव्य (सही उत्तर) तक पहुँचाने की कोशिश कर रहे हैं। आपके पास दो गाइडबुक हैं:

  1. ह्यूमन गाइडबुक: सुंदर, उच्च-स्तरीय मानचित्रों और दर्शनीय मार्गों से भरी हुई।
  2. रोबोट गाइडबुक: टर्न-बाय-टर्न GPS दिशा-निर्देशों और ट्रैफिक डेटा से भरी हुई।

अतीत में, ट्रैवल एजेंट केवल एक गाइडबुक चुनते थे और उम्मीद करते थे कि सब ठीक होगा। कभी-कभी दर्शनीय मार्ग बहुत अस्पष्ट होता था जो GPS के लिए उपयुक्त नहीं था, और कभी-कभी GPS बहुत उबाऊ होता था जो यात्री के लिए उपयुक्त नहीं था।

SSR एक "सुपर ट्रैवल एजेंट" है।
निर्देश देने से पहले, SSR जाँच करता है:

  • "क्या यह ज्यामिति (geometry) की समस्या है? मानव गाइडबुक आकृतियों को पहचानने के लिए बेहतरीन है, लेकिन रोबोट गाइडबुक कोणों की गणना करने के लिए बेहतर है।"
  • "क्या यह बीजगणित (algebra) की समस्या है? रोबोट गाइडबुक के चरण-दर-चरण गणित यहाँ एकदम सटीक हैं।"

SSR केवल एक किताब नहीं चुनता। यह मिश्रण और मिलान (mix and match) करता है। यह कह सकता है, "शुरुआत करने के लिए मानव के बड़े विचार का उपयोग करें, लेकिन समाप्त करने के लिए रोबोट के चरण-दर-चरण गणित पर स्विच करें।" यह केवल उन निर्देशों को चुनता है जिनका पालन ट्रैवल एजेंट (AI) वास्तव में अभी करने में सक्षम है।

यह क्यों महत्वपूर्ण है
शोधकर्ताओं ने इसका परीक्षण कठिन गणित प्रतियोगिताओं (जैसे AIME) पर किया।

  • पुराना तरीका: AI को मानव उदाहरण देने से उसका स्कोर थोड़ा बढ़ गया, लेकिन कभी-कभी इससे चीजें खराब हो गईं क्योंकि AI मानव के "अंतर्ज्ञान" की नकल करने की कोशिश में भ्रमित हो गया।
  • SSR तरीका: निष्पादन योग्य रणनीतियों (वे जिन्हें AI वास्तव में कर सकता है) को चुनकर, AI की सटीकता काफी बढ़ गई। कुछ कठिन परीक्षणों पर, इसमें 13 अंक का सुधार हुआ, जो गणित प्रतियोगिताओं में एक बड़ी उपलब्धि है।

मुख्य निष्कर्ष
यह पेपर हमें सिखाता है कि नकल करना हमेशा सीखना नहीं होता। सिर्फ इसलिए कि एक इंसान किसी चीज़ को एक निश्चित तरीके से करता है, इसका मतलब यह नहीं है कि AI को भी बिल्कुल उसी तरह से करने की कोशिश करनी चाहिए।

AI को स्मार्ट बनाने के लिए, हमें यह समझने की आवश्यकता है कि AI कैसे सोचता है, न कि केवल यह कि इंसान कैसे सोचते हैं। हमें AI को ऐसे उपकरण देने की आवश्यकता है जिनका वह वास्तव में उपयोग कर सके, न कि ऐसे उपकरण जो कागज पर तो अच्छे दिखते हैं लेकिन उसके "मस्तिष्क" के लिए बहुत जटिल हैं।

संक्षेप में:

  • दूरी (The Gap): मनुष्य और AI समस्याओं को अलग-अलग तरह से हल करते हैं।
  • गलती (The Mistake): यह मान लेना कि AI मानव विधियों की पूरी तरह से नकल कर सकता है।
  • समाधान (The Fix): एक सिस्टम (SSR) जो AI जो वास्तव में कर सकता है उसके आधार पर मानव और रोबोट रणनीतियों का सही मिश्रण चुनता है।
  • परिणाम (The Result): अधिक स्मार्ट, अधिक विश्वसनीय AI गणित समाधान।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →