← नवीनतम पेपर
💬 NLP

Formalize Once, Edit the Rest: Efficient Lean-Based Answer Selection for Math Reasoning

यह शोध पत्र BASE को प्रस्तुत करता है, जो एक बेस-एंड-एडिट पाइपलाइन है जो एक विशेष रीराइटर मॉडल (LEASCRIBE) का लाभ उठाकर एक एकल संभावित उत्तर को औपचारिक रूप देता है और इन-प्लेस एडिटिंग के माध्यम से शेष K-1 औपचारिक कथनों को कुशलतापूर्वक व्युत्पन्न करता है, जिससे लीन-आधारित गणितीय तर्क में उत्तर चयन सटीकता में सुधार करते हुए कम्प्यूटेशनल लागतों को काफी कम किया जाता है।

मूल लेखक: Ji Feng, Zhouxing Shi

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ji Feng, Zhouxing Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो 8 अलग-अलग गणितीय निबंधों का एक ढेर ग्रेड कर रहे हैं, जो एक बुद्धिमान लेकिन कभी-कभी भ्रमित होने वाले छात्र (AI) द्वारा लिखे गए हैं। प्रत्येक निबंध एक ही समस्या को हल करने की कोशिश करता है, लेकिन वे सभी थोड़े अलग उत्तरों पर पहुँचते हैं। आपका काम यह पता लगाना है कि वास्तव में कौन सा सही है।

परंपरागत रूप से, यह जाँचने के लिए कि उत्तर सही है या नहीं, आप एक अत्यंत कठोर, मशीन-जांच योग्य रोबोट (जिसे Lean कहा जाता है) से प्रत्येक निबंध को एक-एक करके सत्यापित करने के लिए कह सकते हैं। लेकिन यहाँ एक पेच है: रोबोट द्वारा निबंध की जाँच करने से पहले, आपको छात्र की अव्यवस्थित, प्राकृतिक भाषा वाली लिखावट को रोबोट की सख्त, कंप्यूटर-कोड भाषा में अनुवादित करना होगा। यह अनुवाद प्रक्रिया धीमी, महंगी और बहुत अधिक कंप्यूटिंग शक्ति की मांग करने वाली है। यदि आपके पास 8 निबंध हैं, तो आपको 8 महंगी अनुवाद प्रक्रियाओं के लिए भुगतान करना होगा।

यह शोध पत्र एक नया तरीका पेश करता है जिसे BASE (Base-and-Edit) कहा जाता है, जो खेल बदल देता है। सभी 8 निबंधों को शुरू से अनुवादित करने के बजाय, BASE कुछ चतुर करता है:

1. "Base" की खोज

सबसे पहले, सिस्टम निबंधों को उनके आत्मविश्वास के क्रम में देखता है (उस निबंध से शुरू करते हुए जिसे छात्र सबसे अधिक सही मानता है)। यह उनमें से केवल एक को रोबोट की भाषा में अनुवादित करता है और रोबोट से पूछता है, "क्या यह समझ में आता है?"

  • यदि रोबोट कहता है, "यह एक वैध गणितीय कथन है," तो वह Base बन जाता है।
  • यदि वह "नहीं" कहता है, तो यह अगले निबंध को आज़माता है।
  • आमतौर पर, पहली या दूसरी कोशिश सफल हो जाती है। इसलिए, आप केवल एक महंगी अनुवाद प्रक्रिया के लिए भुगतान करते हैं।

2. "Edit" (जादुई ट्रिक)

अब, शेष 7 निबंधों को शुरू से अनुवादित करने के बजाय, BASE महसूस करता है कि वे पहले वाले के लगभग समान हैं। वे एक ही समस्या संरचना साझा करते हैं; बस अंत में उनका नंबर या उत्तर अलग होता है।

पहले अनुवादित निबंध को एक कुकी कटर (cookie cutter) के रूप में सोचें। अन्य 7 निबंध उसी कुकी के आकार के हैं, बस उनमें "फिलिंग" (उत्तर) अलग है।

  • सरल संपादन (Simple Edits): यदि उत्तर बिल्कुल उसी तरह लिखा गया है (जैसे, "5"), तो BASE बस संख्या को बदल देता है।
  • स्मार्ट संपादन (Smart Edits - LEANSCRIBE): कभी-कभी छात्र उत्तर को अजीब तरीके से लिखता है (जैसे, "13 के वर्गमूल का 3 गुना")। रोबोट ने इसे एक जटिल कोड ब्लॉक के रूप में अनुवादित किया होगा। BASE एक विशेष सहायक मॉडल जिसका नाम LEANSCRIBE है, का उपयोग यह पता लगाने के लिए करता है कि वह जटिल कोड ब्लॉक ठीक कहाँ है और उसे नए उत्तर के कोड के साथ कैसे बदला जाए। यह एक मास्टर शेफ की तरह है जो पूरी रेसिपी को खराब किए बिना ठीक जानता है कि किस सामग्री को बदलना है।

परिणाम: एक "पारेटो सुधार" (Pareto Improvement)

शोध पत्र दावा करता है कि यह विधि एक "पारेटो सुधार" है, जो एक फैंसी तरीका है यह कहने का कि: "हमें बेहतर परिणाम मिले जबकि हमने कम पैसा खर्च किया।"

  • सस्ता: 8 अनुवादों के लिए भुगतान करने के बजाय, वे 1 अनुवाद और 7 सस्ते संपादनों के लिए भुगतान करते हैं। यह लागत को लगभग 5 गुना (विशेष रूप से, औसतन 5.4x) कम कर देता है।
  • अधिक सटीक: आश्चर्यजनक रूप से, इस विधि ने शून्य से शुरू करके प्रत्येक की जाँच करने की तुलना में सही उत्तर अधिक बार खोजा। क्यों? क्योंकि "Base" का पुन: उपयोग करके जिसे रोबोट ने पहले ही स्वीकृत कर लिया था, यह सिस्टम उन गलतियों से बचता है जो एक नए, बिखरे हुए निबंध को शुरू से अनुवादित करने पर होती हैं। यह एक घर के प्रमाणित, मजबूत ब्लूप्रिंट का उपयोग करने और फिर केवल पेंट का रंग बदलने जैसा है, बजाय इसके कि हर बार एक नया घर बनाने की कोशिश की जाए।

मुख्य निष्कर्ष (The Bottom Line)

लेखकों ने एक ऐसा सिस्टम बनाया है जो एक ही गणितीय समस्या को बार-बार पुन: अनुवादित करने में समय बर्बाद करना बंद कर देता है। यह एक "अच्छा" संस्करण ढूंढता है, उसे लॉक करता है, और फिर बाकी के लिए बस उत्तर में मामूली बदलाव करता है। यह गणित के उत्तरों की जाँच करना AI के लिए तेज़, सस्ता और आश्चर्यजनक रूप से अधिक विश्वसनीय बनाता है।

उन्होंने क्या दावा नहीं किया:

  • उन्होंने यह नहीं कहा कि यह AI के गणित कौशल को ठीक करता है; यह केवल एक सूची में से सबसे अच्छा उत्तर चुनने में मदद करता है।
  • उन्होंने यह दावा नहीं किया कि यह हर प्रकार की समस्या के लिए काम करता है (केवल उन समस्याओं के लिए जहाँ उत्तर संरचनात्मक रूप से समान दिखते हैं)।
  • उन्होंने स्वीकार किया कि जबकि "अनुवाद" की जाँच की जाती है, अंतिम "प्रमाण" (चरण-दर-चरण तर्क) अभी भी वर्तमान रोबोटों के लिए जल्दी से करना कठिन है, इसलिए वे पहले यह जाँचने पर ध्यान केंद्रित करते हैं कि क्या उत्तर रोबोट की भाषा में सही दिखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →