← नवीनतम पेपर
💻 computer science

Knowing What to Solve Before How: Preplan Empowered LLM Mathematical Reasoning

यह शोध पत्र PPC (Preplan-Plan-CoT) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो योजना बनाने से पहले समस्या के प्रकारों और उपकरणों को स्पष्ट करने के लिए एक स्पष्ट "प्रीप्लान" (preplan) चरण पेश करता है, जो बिना किसी इन्फरेंस ओवरहेड के कई बेंचमार्क पर LLM गणितीय तर्क प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Shaojie Wang, Liang Zhang

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shaojie Wang, Liang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन गणित की समस्या को हल करने की कोशिश कर रहे हैं, जैसे कि कोई जटिल पहेली। अतीत में, लार्ज लैंग्वेज मॉडल्स (LLMs) इन्हें सीधे काम में जुट जाने की कोशिश करते थे: "ठीक है, चलिए उत्तर तक पहुँचने के लिए चरण-दर-चरण गणना शुरू करते हैं।" इसे चेन-ऑफ-थॉट (Chain-of-Thought) कहा जाता है।

हालाँकि, जैसे-जैसे समस्याएँ कठिन होती जाती हैं, "सीधे काम शुरू करने" का यह दृष्टिकोण मॉडल को भटकने, गलत रास्ते लेने या ऐसे तरीकों पर समय बर्बाद करने की ओर ले जाता है जो पहेली के अनुकूल नहीं होते।

इसे ठीक करने के लिए, शोधकर्ताओं ने एक नई विधि आजमाई: प्लान-देन-सॉल्व (Plan-then-Solve)। उन्होंने मॉडल को बताया, "रुको! पहले एक योजना (Plan) लिखो, फिर काम करो।" इससे मदद मिली, लेकिन पेपर का तर्क है कि अभी भी एक हिस्सा गायब था। मॉडल यह तो प्लान कर रहा था कि गणित कैसे करना है, लेकिन वह वास्तव में यह समझने के लिए एक पल भी नहीं रुक रहा था कि समस्या वास्तव में उससे क्या मांग रही है।

यहाँ इस पेपर का समाधान सरल रूप में दिया गया है:

गायब चरण: द "प्रीप्लान" (The "Preplan")

लेखक एक नया चरण पेश करते हैं जिसे प्रीप्लान (Preplan) कहा जाता है। इसे दौड़ शुरू होने से पहले एक एथलीट से बात करने वाले कोच की तरह समझें।

  • पुराना तरीका (प्रश्न \rightarrow योजना \rightarrow समाधान): एथलीट शुरुआती बंदूक की आवाज़ सुनता है और तुरंत दौड़ना शुरू कर देता है, सोचते हुए, "मैं तेज़ दौड़ूँगा, फिर बाएँ मुड़ूँगा, फिर स्प्रिंट मारूँगा।" वे तेज़ तो दौड़ सकते हैं, लेकिन अगर वे गलत दिशा में दौड़ रहे हैं, तो गति का कोई महत्व नहीं रह जाता।
  • नया तरीका (प्रश्न \rightarrow प्रीप्लान \rightarrow योजना \rightarrow समाधान): एथलीट दौड़ के बारे में सोचने से पहले ही, कोच कहता है: "रुको। ट्रैक को देखो। यह एक गोलाकार ट्रैक है जिसमें एक खड़ी ढलान है। हवा हमारे खिलाफ चल रही है। हमें ढलान के लिए ऊर्जा बचाकर रखनी होगी, न कि शुरुआत में ही स्प्रिंट मारना है।"

यह "प्रीप्लान" कोई दौड़ (गणना) नहीं करता है। यह केवल मैदान (समस्या का प्रकार), सही गियर (उपकरण/अवधारणाएं) चुनता है, और जालों (कमियों) की पहचान करता है।

प्रीप्लान बनाने की समस्या

लेखकों ने पाया कि जब उन्होंने मॉडल को केवल यह "प्रीप्लान" लिखने के लिए कहा, तो मॉडल अक्सर नकल (चीटिंग) करने लगा।

  1. लीकेज (Leakage): ट्रैक का विश्लेषण करने के बजाय, मॉडल गलती से दौड़ के चरणों का वर्णन करने लगा ("पहले मैं 10 मीटर दौड़ूँगा...")। उसने विश्लेषण को छोड़ दिया और सीधे योजना पर चला गया।
  2. स्पॉइलर (Spoiler): मॉडल ने ट्रैक का विश्लेषण तो किया, लेकिन गुप्त रूप से विश्लेषण के भीतर ही गणित की समस्या को हल करने लगा ("पहाड़ी 50 मीटर ऊँची है, इसलिए मैं समय की गणना करूँगा...")। उसने काम को बहुत जल्दी करके सरप्राइज को खराब कर दिया।

इसे ठीक करने के लिए, टीम ने एक सख्त फ़िल्टर (सीटी बजाने वाले रेफरी की तरह) बनाया। यदि "प्रीप्लान" में कोई भी वास्तविक गणित या चरण-दर-चरण निर्देश शामिल थे, तो रेफरी सीटी बजा देता था, उत्तर को खारिज कर देता था, और मॉडल को फिर से प्रयास करने के लिए कहता था। इसने यह सुनिश्चित किया कि प्रीप्लान पूरी तरह से समस्या को समझने के बारे में था, न कि उसे हल करने के बारे में।

"फेथफुल" (Faithful) रिवॉर्ड सिस्टम

एक बार जब मॉडल ने एक अच्छा प्रीप्लान लिखना सीख लिया, तो शोधकर्ताओं को यह सुनिश्चित करना था कि मॉडल वास्तव में उस पर ध्यान दे। कभी-कभी, मॉडल उन छात्रों की तरह होते हैं जो एक बेहतरीन अध्ययन योजना लिखते हैं लेकिन फिर उसे अनदेखा कर देते हैं और कुछ और ही पढ़ते हैं।

इसे रोकने के लिए, उन्होंने एक विशेष रिवॉर्ड सिस्टम (वीडियो गेम स्कोरिंग सिस्टम की तरह) बनाया:

  • स्कोर: मॉडल को सही उत्तर पाने के लिए अंक मिलते हैं।
  • लॉयल्टी बोनस (Loyalty Bonus): मॉडल को अतिरिक्त अंक केवल तभी मिलते हैं यदि उसके द्वारा उठाए गए चरण (योजना) वास्तव में प्रीप्लान में दी गई सलाह का पालन करते हैं।
  • पेनल्टी (Penalty): यदि मॉडल ऐसा प्रीप्लान लिखता है जो गणित जैसा दिखता है (फ़िल्टर को धोखा देना), तो उसके अंक कट जाते हैं।

यह मॉडल को प्रीप्लान को एक वास्तविक मानचित्र की तरह मानने के लिए मजबूर करता है। यदि मानचित्र कहता है "उत्तर की ओर जाओ," तो मॉडल केवल यह सोचकर "दक्षिण की ओर" नहीं जा सकता कि वह किस्मत के भरोसे काम चला लेगा।

परिणाम

शोधकर्ताओं ने इस नई विधि (PPC) का परीक्षण चार अलग-अलग AI मॉडल्स और पांच कठिन गणित प्रतियोगिताओं पर किया।

  • बेहतर सटीकता: नया तरीका किसी भी पिछले तरीके की तुलना में सही उत्तर अधिक बार लाया, विशेष रूप से सबसे कठिन समस्याओं पर।
  • तेज़ सोच: आश्चर्यजनक रूप से, भले ही मॉडल को एक अतिरिक्त "प्रीप्लान" अनुभाग लिखना पड़ा, फिर भी इसने समस्या को हल करने के लिए कुल कम शब्दों का उपयोग किया। क्यों? क्योंकि इसने गलत तरीकों को आज़माने या गोल-गोल घूमने में समय बर्बाद नहीं किया। वह शुरुआत से ही जानता था कि उसे कहाँ जाना है।

संक्षेप में

पेपर का तर्क है कि कठिन समस्याओं को हल करने के लिए, आपको केवल "कैसे" में नहीं कूदना चाहिए। आपको पहले यह समझने के लिए एक क्षण लेना चाहिए कि "क्या" है। AI को समस्या के प्रकार का विश्लेषण करने और कमियों की पहचान करने के लिए मजबूर करके, AI एक बहुत अधिक स्मार्ट और कुशल समस्या समाधानकर्ता बन जाता है। यह एक घबराए हुए धावक और एक रणनीतिक मार्गदर्शक के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →