CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions
यह शोध पत्र क्राउडमैथ (CrowdMath) का परिचय देता है, जो एमआईटी प्राइम्स-एओपीएस (MIT PRIMES–AoPS) कार्यक्रम से 164 विशेषज्ञ-एनोटेटेड सहयोगात्मक अनुसंधान चर्चाओं का एक डेटासेट है, जो गतिशील गणितीय प्रगति को समझने के लिए लार्ज लैंग्वेज मॉडल्स का बेंचमार्क करता है और यह प्रकट करता है कि हालांकि मॉडल स्थानीय चर्चा प्रवाह का अनुसरण कर सकते हैं, वे ओपन-प्रॉब्लम सॉल्विंग में व्यक्तिगत योगदान के कार्यात्मक महत्व को पहचानने में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप बुद्धिमान दोस्तों के एक समूह को एक विशाल, अनसुलझी पहेली को मिलकर सुलझाने की कोशिश करते हुए देख रहे हैं। वे किसी शांत पुस्तकालय में काम नहीं कर रहे हैं; वे एक डिजिटल फोरम पर विचारों को चिल्लाकर साझा कर रहे हैं। एक व्यक्ति एक रास्ता सुझाता है, दूसरा तर्क में एक दरार पकड़ लेता है, तीसरा उस दरार को ठीक करता है, और अंततः, दर्जनों बार होने वाले संवादों के बाद, वे पूरी तस्वीर बना लेते हैं।
यह शोध पत्र CROWDMATH पेश करता है, जो एक नया डेटासेट है जो ठीक इसी तरह की अव्यवस्थित, सहयोगात्मक पहेली सुलझाने की प्रक्रिया को दर्शाता है।
यहाँ शोधकर्ताओं द्वारा किए गए कार्यों का विवरण दिया गया है, सरल उपमाओं का उपयोग करते हुए:
1. वर्तमान "मैथ AI" के साथ समस्या
अभी, आर्टिफिशियल इंटेलिजेंस (AI) के गणित के लिए अधिकांश परीक्षण बहुविकल्पीय परीक्षाओं (multiple-choice exams) की तरह हैं। आप AI को एक स्पष्ट प्रश्न देते हैं (जैसे "2+2 क्या है?") और एक सही उत्तर। यदि AI सही उत्तर दे देता है, तो वह पास हो जाता है।
लेखकों का तर्क है कि यह एक शेफ को केवल यह पूछकर टेस्ट करने जैसा है कि क्या वह केक बना सकता है जब रेसिपी पहले से ही लिखी हुई हो। यह हमें यह नहीं बताता कि क्या शेफ उस स्थिति को संभाल सकता है जहाँ रेसिपी गायब है, सामग्री गलत है, या ओवन खराब हो गया है। वास्तविक गणित अनुसंधान एक सीधी रेखा नहीं है; यह गलत रास्तों, गलत मोड़ों और "अहा!" क्षणों से भरा एक घुमावदार रास्ता है जो समय के साथ घटित होते हैं।
2. नया डेटासेट: गणित के लिए एक "रियलिटी शो"
शोधकर्ताओं ने CrowdMath नामक एक कार्यक्रम से 164 वास्तविक जीवन के "स्टोरी आर्क्स" (कहानी के उतार-चढ़ाव) एकत्र किए, जहाँ हाई स्कूल के छात्र और स्नातक (undergraduates) ऑनलाइन कठिन गणितीय समस्याओं को हल करने के लिए मिलकर काम करते हैं।
इन स्टोरी आर्क्स को एक डिटेक्टिव शो के एपिसोड की तरह समझें:
- रहस्य (The Mystery): एक गणितीय समस्या जिसका कोई ज्ञात उत्तर नहीं है।
- सुराग (The Clues): लोगों द्वारा आंशिक विचार पोस्ट करना, प्रश्न पूछना, या त्रुटियों को पकड़ना।
- भटकाने वाले सुराग (The Red Herrings): गलत सिद्धांत जो कहीं नहीं ले जाते।
- समाधान (The Solution): अंतिम पोस्ट जो सब कुछ एक प्रमाण (proof) में बांध देता है।
टीम ने केवल टेक्स्ट को सहेजा नहीं; उन्होंने प्रत्येक पोस्ट को कहानी में उसकी "भूमिका" के साथ लेबल किया। क्या इस पोस्ट ने जांच शुरू की? क्या इसने प्रगति की? क्या इसने किसी और के तर्क में त्रुटि पाई? या क्या इसने मामले को सुलझाया?
3. AI का परीक्षण: "अगला एपिसोड" गेम
शोधकर्ताओं ने उपलब्ध छह सबसे स्मार्ट AI मॉडलों से इस डेटासेट का उपयोग करके दो खेल खेलने के लिए कहा:
गेम A: "आगे क्या होगा?" (Next-Post Prediction)
उन्होंने AI को बातचीत की शुरुआत दिखाई और उससे अगला संदेश अनुमान लगाने को कहा।
- परिणाम: AI इसमें आश्चर्यजनक रूप से अच्छा था (लगभग 83-88% सटीकता)। यह एक टीवी दर्शक की तरह था जो पात्रों को अच्छी तरह जानता है और अनुमान लगा सकता है, "ओह, जासूस अब एक सवाल पूछने वाला है।" AI ने बातचीत के प्रवाह को समझ लिया।
गेम B: "यह व्यक्ति वास्तव में क्या कर रहा है?" (Role Classification)
उन्होंने AI को एक विशिष्ट पोस्ट दिखाई और पूछा: "क्या यह व्यक्ति समस्या हल कर रहा है, गलती कर रहा है, या सिर्फ एक प्रश्न पूछ रहा है?"
- परिणाम: AI इसमें बुरी तरह संघर्ष कर गया (केवल लगभग 42% सटीकता)। वह एक आंशिक चरण (partial step) और एक अंतिम समाधान (final solution) के बीच अंतर नहीं कर सका।
- उपमा: यह एक फिल्म समीक्षक की तरह है जो कथानक के उतार-चढ़ाव का अनुमान तो लगा सकता है लेकिन वह यह नहीं बता सकता कि एक पात्र दरवाजा खोलने की कोशिश कर रहा है या वास्तव में दरवाजा खोल रहा है। AI शब्दों को देखता है, लेकिन वह योगदान के भार या महत्व को नहीं समझता है।
4. मुख्य निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि जबकि AI उन गणितीय समस्याओं को हल करने में बहुत अच्छा हो रहा है जिनका एक स्पष्ट "शुरुआत" और "अंत" होता है (जैसे कि एक पाठ्यपुस्तक का सवाल), यह समझने में अभी भी कमजोर है कि गणित वास्तव में कैसे खोजा जाता है।
वर्तमान AI मॉडल उत्कृष्ट छात्रों की तरह हैं जो किसी समस्या का समाधान रट सकते हैं लेकिन अनुसंधान भागीदार (research partners) बनने में बहुत खराब हैं। वे अभी तक यह नहीं बता सकते कि एक नया विचार एक बड़ी सफलता है या एक मृत अंत, या कोई टिप्पणी एक महत्वपूर्ण सुधार है या केवल एक सामान्य प्रश्न।
संक्षेप में: AI बातचीत का अनुसरण कर सकता है, लेकिन वह अभी तक खोज की यात्रा को नहीं समझता है। वह मंजिल को जानता है, लेकिन वहां तक पहुँचने के चरणों में खो जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।