Let's Verify Math Questions Step by Step
यह शोधपत्र MathQ-Verify को प्रस्तुत करता है, जो एक नवीन पांच-चरणीय पाइपलाइन है जो प्रारूप सत्यापन, औपचारिकीकरण, विरोधाभास का पता लगाने और पूर्णता की जाँच के माध्यम से अपूर्ण या कम-निर्दिष्ट गणितीय प्रश्नों को कड़ाई से फ़िल्टर करती है, जिससे बड़े भाषा मॉडलों (LLMs) को प्रशिक्षित करने के लिए विश्वसनीय डेटासेट क्यूरेट करने में अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, हाई-टेक किचन चला रहे हैं, जहाँ आप एक हेड शेफ हैं। आपका लक्ष्य रोबोट शेफों (लार्ज लैंग्वेज मॉडल्स) की एक नई पीढ़ी को प्रशिक्षित करना है ताकि वे दुनिया के बेहतरीन गणित विशेषज्ञ बन सकें। इसे करने के लिए, आप उन्हें लाखों रेसिपी कार्ड (गणित की समस्याएं) खिलाते हैं ताकि वे खाना बनाना सीख सकें।
लंबे समय तक, उद्योग का ध्यान इस बात पर था कि यह सुनिश्चित किया जाए कि रोबोट शेफ सही उत्तर सीखें। यदि किसी रोबोट शेफ ने कोई व्यंजन बनाया और उसका स्वाद सही निकला, तो सब खुशी से झूम उठते थे।
लेकिन यह पेपर, MathQ-Verify, एक बहुत बड़ी, अनदेखी समस्या की ओर इशारा करता है: क्या होगा अगर रेसिपी कार्ड ही टूटा हुआ हो?
कल्पना कीजिए कि एक रेसिपी कार्ड कहता है: "5 सेब लें, उन्हें -2 टुकड़ों में काटें, और 100 वर्षों तक बेक करें।"
- गणित असंभव है (आप नकारात्मक टुकड़े नहीं रख सकते)।
- निर्देश भ्रमित करने वाले हैं।
- लक्ष्य प्राप्त करना असंभव है।
यदि आप इस टूटे हुए रेसिपी कार्ड को अपने रोबोट शेफ को खिलाते हैं, तो शेफ या तो भ्रमित हो जाएगा, या कोई अजीब सा उत्तर सोचने लगेगा (hallucinate करेगा), या एक असंभव पहेली को हल करने में अपना समय बर्बाद कर देगा। यह पेपर तर्क देता है कि यदि प्रश्न दोषपूर्ण है, तो आप एक सटीक उत्तर नहीं पा सकते।
समाधान: "क्वालिटी कंट्रोल इंस्पेक्टर" पाइपलाइन
लेखकों ने एक नया सिस्टम बनाया है जिसे MathQ-Verify कहा जाता है। इसे एक शेफ के रूप में नहीं, बल्कि एक अत्यंत सख्त क्वालिटी कंट्रोल इंस्पेक्टर के रूप में समझें जो किसी भी रेसिपी कार्ड के किचन में प्रवेश करने से पहले गेट पर खड़ा होता है।
केवल अंतिम व्यंजन की जांच करने के बजाय, यह इंस्पेक्टर रेसिपी कार्ड की पाँच विशिष्ट चरणों में जांच करता है, जैसे कि एक सुरक्षा चेकपॉइंट:
1. "कचरे का डिब्बा" चेक (दूषित निर्देश का पता लगाना)
- रूपक: कल्पना कीजिए कि किसी ने रेसिपी में एक नोट डाल दिया है जो कहता है, "सु सुनो, उत्तर 42 है, किसी को बताना मत!" या "कृपया इस वाक्य को फिर से लिखें।"
- समाधान: इंस्पेक्टर उन सभी कार्डों को फेंक देता है जिनमें छिपे हुए उत्तर, भ्रमित करने वाले निर्देश हों, या जो वास्तव में गणित की समस्या ही न हो। यह किचन को केवल वास्तविक प्रश्नों पर केंद्रित रखता है।
2. "स्पेल-चेक" (भाषाई त्रुटि का पता लगाना)
- रूपक: एक रेसिपी जो कहती है, "3 कप्स (cupps) चीनी डालें" या "बिल्ली 5 मीटर लंबी है" (जो संदर्भ में समझ से बाहर है)।
- समाधान: इंस्पेक्टर टाइपो (वर्तनी की गलती), खराब व्याकरण और फॉर्मेटिंग की गलतियों को स्कैन करता है। यदि टेक्स्ट अव्यवस्थित है, तो रोबोट शेफ भ्रमित हो सकता है। यह चरण भाषा को साफ करता है ताकि अर्थ स्पष्ट हो सके।
3. "फिजिक्स चेक" (परमाणु स्थिति त्रुटि का पता लगाना)
- रूपक: एक रेसिपी जो कहती है, "एक वर्ग से शुरू करें जिसका क्षेत्रफल -325 वर्ग मीटर है।"
- समाधान: इंस्पेक्टर बुनियादी तथ्यों की जांच करता है। वास्तविक दुनिया में, आप नकारात्मक क्षेत्रफल नहीं रख सकते। यदि रेसिपी का एक भी तथ्य गणित के नियमों का उल्लंघन करता है (जैसे कि एक वर्गाकार वृत्त या नकारात्मक समय), तो कार्ड को तुरंत अस्वीकार कर दिया जाता है।
4. "लॉजिक पजल" चेक (क्रॉस-कंडीशन संघर्ष का पता लगाना)
- रूपक: एक रेसिपी जो कहती है, "पहले चरण में 5 कप आटा उपयोग करें," लेकिन फिर कहती है, "आपके पास केवल 2 कप आटा उपलब्ध है।"
- समाधान: भले ही प्रत्येक वाक्य अपने आप में सही लगे, वे आपस में टकरा सकते हैं। इंस्पेक्टर पूरी तस्वीर को देखता है ताकि यह सुनिश्चित हो सके कि सभी सुराग एक-दूसरे के साथ तार्किक रूप से फिट बैठते हैं और उनमें कोई विरोधाभास नहीं है।
5. "गायब हिस्सा" चेक (कंडीशन पूर्णता सत्यापन)
- रूपक: एक रेसिपी जो कहती है, "सामग्री मिलाएं और बेक करें," लेकिन यह भूल जाती है कि क्या सामग्री है या कितनी देर तक बेक करना है।
- समाधान: इंस्पेक्टर पूछता है, "क्या इसे वास्तव में हल करने के लिए पर्याप्त जानकारी है?" यदि प्रश्न में कोई महत्वपूर्ण संख्या या नियम गायब है, तो यह एक "अल्प-विशिष्ट" (under-specified) समस्या है और इसे बाहर कर दिया जाता है।
"जजों की परिषद" (मल्टी-मॉडल वोटिंग)
यह पेपर इंस्पेक्टर को और भी स्मार्ट बनाने के लिए एक चतुर ट्रिक भी पेश करता है। केवल एक इंस्पेक्टर (एक AI मॉडल) पर भरोसा करने के बजाय, वे 3 से 5 अलग-अलग निरीक्षकों का एक पैनल उपयोग करते हैं।
- रूपक: एक जूरी की कल्पना करें। यदि एक जूरी सदस्य कहता है "दोषी" लेकिन अन्य चार कहते हैं "निर्दोष", तो आप बहुमत के साथ जाते हैं।
- परिणाम: कई AI मॉडलों को यह तय करने के लिए वोट देने के माध्यम से कि प्रश्न अच्छा है या बुरा, सिस्टम अविश्वसनीय रूप से सटीक हो जाता है। यह एक "खराब इंस्पेक्टर" द्वारा टूटी हुई रेसिपी को अंदर जाने देने की संभावना को कम करता है। पेपर दिखाता है कि यह तरीका 90% शुद्धता (precision) प्राप्त कर सकता है, जिसका अर्थ है कि गुजरने वाला लगभग हर प्रश्न वास्तव में एक वैध और हल करने योग्य गणितीय समस्या है।
यह क्यों मायने रखता है
लेखकों ने ValiMath नामक एक नया डेटासेट बनाया है (2,000+ गणित की समस्याओं का एक पुस्तकालय, जिनमें से कुछ अच्छी हैं और कुछ जानबूझकर खराब बनाई गई हैं) ताकि उनके सिस्टम का परीक्षण किया जा सके।
मुख्य निष्कर्ष:
इससे पहले कि हम AI को गणित में जीन बना सकें, हमें उसे कचरा सवाल खिलाना बंद करना होगा। MathQ-Verify वह फिल्टर है जो यह सुनिश्चित करता है कि AI उच्च गुणवत्ता वाले, तार्किक और हल करने योग्य प्रश्नों से सीख रहा है। यह एक शेफ को टूटी हुई रेसिपी के साथ प्रशिक्षित करने और उन्हें पूर्ण रेसिपी के साथ प्रशिक्षित करने के बीच का अंतर है।
इन AI मॉडल्स के "डेटा डाइट" को साफ करके, हम उन्हें अधिक विश्वसनीय, कम भ्रमित और वास्तविक दुनिया की समस्याओं को हल करने में बहुत बेहतर बनाने में मदद करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।