← नवीनतम पेपर
💬 NLP

MathFimer: Enhancing Mathematical Reasoning by Expanding Reasoning Steps through Fill-in-the-Middle Task

यह शोध पत्र MathFimer को प्रस्तुत करता है, जो एक नवीन ढांचा है जो बड़े भाषा मॉडलों (large language models) की गणितीय तर्क क्षमता को एक "फिल-इन-द-मिडल" (Fill-in-the-middle) कार्य के माध्यम से लुप्त मध्यवर्ती चरणों को पुनर्गठित करने के लिए प्रशिक्षित करके बढ़ाता है, जिससे विस्तारित डेटासेट उत्पन्न होते हैं जो शक्तिशाली बाहरी मॉडलों या उच्च कम्प्यूटेशनल लागतों पर निर्भर किए बिना GSM8K और MATH जैसे बेंचमार्क पर प्रदर्शन में सुधार करते हैं।

मूल लेखक: Yuchen Yan, Yongliang Shen, Yang Liu, Jin Jiang, Xin Xu, Mengdi Zhang, Jian Shao, Yueting Zhuang

प्रकाशित 2026-02-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuchen Yan, Yongliang Shen, Yang Liu, Jin Jiang, Xin Xu, Mengdi Zhang, Jian Shao, Yueting Zhuang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ MathFimer पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) के माध्यम से विभाजित किया गया है।

🧩 मुख्य विचार: गणित के लिए "बीच का खाली स्थान भरना" (Fill-in-the-Middle)

कल्पना कीजिए कि आप एक रोबोट को केक बनाना सिखा रहे हैं। आप उसे एक रेसिपी देते हैं जिसमें लिखा है:

  1. शुरुआत: मैदा और चीनी मिलाएं।
  2. अंत: केक को ओवन में रखें।

रोबोट शुरुआत और अंत को देखता है, लेकिन उसे यह समझ नहीं आता कि मिलाने से बेकिंग तक पहुँचने के लिए कैसे जाना है। वह शायद कच्चे कटोरे को सीधे ओवन में डालने की कोशिश करेगा, या वह अंडे डालना भूल सकता है।

MathFimer एक नया टूल है जिसे रोबोट्स (AI मॉडल्स) को गणित के सवाल हल करना सिखाने के लिए डिज़ाइन किया गया है, और वह भी उन गायब "बीच के" चरणों (steps) को भरकर। यह केवल रोबोट को उत्तर नहीं देता; यह रोबोट को वहाँ तक पहुँचने के लिए एक विस्तृत, चरण-दर-चरण कहानी लिखना सिखाता है।


🚧 समस्या: गणित का "ब्लैक बॉक्स" (Black Box)

वर्तमान AI मॉडल्स गणित में अच्छे हैं, लेकिन वे अक्सर "आलसी" पाठ्यपुस्तकों से सीखते हैं। ये पाठ्यपुस्तकें कुछ इस तरह दिखा सकती हैं:

  • प्रश्न: "2 + 2 क्या है?"
  • उत्तर: "4।"

या, वे एक ऐसा समाधान दिखाते हैं जो "मान लीजिए X को हल करें" से सीधे "X = 5" पर कूद जाता है, और बीच की वास्तविक बीजगणित (algebra) को छोड़ देता है।

जब AI मॉडल्स इन "छूटे हुए" चरणों से सीखते हैं, तो वे उत्तर का अनुमान लगाने में तो अच्छे हो जाते हैं लेकिन यह समझाने में खराब हो जाते हैं कि वे वहाँ कैसे पहुँचे। यदि वे किसी छूटे हुए चरण में छोटी सी भी गलती करते हैं, तो पूरा उत्तर गलत हो जाता है, और उन्हें पता नहीं चलता कि क्यों।

इसे ठीक करने का पुराना तरीका:
पहले, बेहतर चरण प्राप्त करने के लिए, शोधकर्ताओं को छोटे मॉडल्स के लिए गायब चरणों को लिखने के लिए "अति-बुद्धिमान" (और बहुत महंगे) AI मॉडल्स को काम पर रखना पड़ता था। यह एक किंडरगार्टन क्लास को पढ़ाने के लिए नोबेल पुरस्कार विजेता गणितज्ञ को काम पर रखने जैसा था। यह काम करता है, लेकिन इसमें बहुत पैसा खर्च होता है और बहुत समय लगता है।


💡 समाधान: "फिल-इन-द-मिडल" (FIM) ट्रिक

इस पेपर के लेखकों के पास एक शानदार विचार था। उन्होंने देखा कि प्रोग्रामर AI को कोड लिखना कैसे सिखाते हैं। कोडिंग में, एक गेम है जिसे "Fill-in-the-Middle" कहा जाता है।

खेल:
आप AI को एक वाक्य की शुरुआत और एक वाक्य का अंत दिखाते हैं और उसे बीच का हिस्सा अनुमान लगाने के लिए कहते हैं।

  • शुरुआत: "एक समय की बात है, वहाँ एक..."
  • अंत: "...जो एक महल में रहता था।"
  • AI का काम: "...छोटा ड्रैगन..."

शोधकर्ताओं ने महसूस किया: हम गणित के साथ भी यही खेल खेल सकते हैं!

MathFimer कैसे काम करता है (3-चरणीय प्रक्रिया)

  1. सेटअप (पहेली):
    उन्होंने पहले से मौजूद हजारों गणित के सवाल लिए जिनके उत्तर पहले से ही मौजूद थे। उन्होंने एक समाधान लिया जो ऐसा दिखता था:
  • चरण 1: वेरिएबल्स (variables) को परिभाषित करें।
  • चरण 2: समीकरण (equation) सेट करें।
  • चरण 3: X के लिए हल करें।
  • चरण 4: उत्तर की जाँच करें।

फिर, उन्होंने चरण 2 और चरण 3 को छिपा दिया। उन्होंने AI को "शुरुआत" (चरण 1) और "अंत" (चरण 4) दिया और पूछा: "बीच में क्या जाएगा?"

  1. प्रशिक्षण (अभ्यास):
    उन्होंने एक विशिष्ट AI मॉडल (जिसे MathFimer-7B कहा जाता है) को इस खेल को बार-बार खेलने के लिए प्रशिक्षित किया। इसने शुरुआत और अंत को देखने और उनके बीच के तार्किक चरणों को बनाने के लिए खुद को तैयार किया।
  • उपमा: यह एक पुल बनाने वाले को प्रशिक्षित करने जैसा है। आप उन्हें नदी के दो किनारों (समस्या की शुरुआत और अंत) को दिखाते हैं और उनसे उन्हें सुरक्षित रूप से जोड़ने वाला पुल (गायब चरण) डिजाइन करने के लिए कहते हैं।
  1. अपग्रेड (विस्तार):
    एक बार जब मॉडल ने यह खेल सीख लिया, तो उन्होंने इसका उपयोग पुरानी गणित की पाठ्यपुस्तकों को "ठीक" करने के लिए किया। उन्होंने मौजूदा समाधानों को लिया जो बहुत छोटे थे और उनमें विस्तृत, गायब चरणों को डालने के लिए MathFimer का उपयोग किया।
  • परिणाम: एक छोटा, आलसी उत्तर जैसे "X = 5" एक विस्तृत कहानी बन गया: "पहले, हम 3 को दूसरी तरफ ले जाते हैं... फिर हम 2 से विभाजित करते हैं... इसलिए X, 5 है।"

🏆 यह एक बड़ी बात क्यों है

पेपर ने कई अलग-अलग गणित परीक्षणों (जैसे कि स्कूलों और प्रतियोगिताओं में उपयोग किए जाने वाले परीक्षण) पर इस नए तरीके का परीक्षण किया। यहाँ उन्हें क्या मिला:

  • बेहतर ग्रेड: इन "विस्तारित" उत्तरों पर प्रशिक्षित मॉडल्स ने काफी उच्च स्कोर प्राप्त किए। उन्होंने केवल अनुमान नहीं लगाया; वे तर्क को समझ गए।
  • सस्ता और तेज़: पुराने तरीके के विपरीत जिसमें चरणों को लिखने के लिए बहुत महंगे AI की आवश्यकता होती थी, MathFimer को एक मानक कंप्यूटर पर प्रशिक्षित किया जा सकता है। यह रोबोट को खुद को खुद सिखाने के लिए प्रशिक्षित करने जैसा है, बजाय इसके कि उन्हें सिखाने के लिए किसी मानव ट्यूटर को काम पर रखा जाए।
  • जादू की आवश्यकता नहीं: उन्हें कोई नया गणित आविष्कार करने की आवश्यकता नहीं थी। उन्होंने बस मौजूदा, सही उत्तरों को अधिक विस्तृत बनाया।

🌟 "मानवीय" उपमा

कल्पना कीजिए कि आप गाड़ी चलाना सीख रहे हैं।

  • पुराना तरीका: आपका इंस्ट्रक्टर कहता है, "स्टीयरिंग घुमाओ, और कार बाईं ओर मुड़ जाएगी।" आप क्रिया को याद कर लेते हैं, लेकिन यदि आप फिसलन भरी सड़क पर आते हैं, तो आप दुर्घटनाग्रस्त हो जाते हैं क्योंकि आप यह नहीं समझते कि कार क्यों मुड़ती है।
  • MathFimer का तरीका: आपका इंस्ट्रक्टर कहता है, "स्टीयरिंग घुमाओ। यह टायरों के कोण को बदल देता है। सड़क के खिलाफ घर्षण (friction) कार को बगल में धकेलता है। क्योंकि कार भारी है, इसलिए इसे मुड़ने में थोड़ा समय लगता है। इसीलिए आप बाईं ओर मुड़ते हैं।"

MathFimer AI को गणित का "घर्षण और भौतिकी" (friction and physics) देता है। यह "मुझे उत्तर पता है" और "मुझे पता है कि वहाँ कैसे पहुँचना है" के बीच के अंतर को भर देता है।

🚀 निष्कर्ष

MathFimer AI को गणित में स्मार्ट बनाने का एक चतुर, कम लागत वाला तरीका है। गणित के सवालों को "रिक्त स्थान भरने" वाली पहेलियों में बदलकर, यह AI मॉडल्स को अपनी सोचने की प्रक्रिया को पूरी विस्तार से लिखना सिखाता है। यह उन्हें अधिक विश्वसनीय, अधिक सटीक और जटिल समस्याओं को हल करने में बेहतर बनाता है, बिना किसी महंगे सुपर-कंप्यूटर की मदद के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →