Automated Scoring of Handwritten Mathematical Problem Posing Using Large Language Models
यह अध्ययन प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल जेमिनी 3.5 फ्लैश, एक संरचित रूब्रिक के साथ ज़ीरो-शॉट प्रॉम्प्टिंग दृष्टिकोण का उपयोग करते हुए, विशेष रूप से पूर्ण संख्या (whole number) समस्याओं के लिए और संशोधित ओसीआर (OCR) टेक्स्ट इनपुट का उपयोग करते समय, हस्तलिखित मिडिल स्कूल गणितीय समस्या-रचना कार्यों का विश्वसनीय स्वचालित स्कोरिंग प्राप्त कर सकता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शिक्षक हैं जिसके पास ग्रेड करने के लिए होमवर्क का एक पहाड़ है। आप जानते हैं कि छात्रों को अपने स्वयं के गणित के सवाल बनाने के लिए कहना सीखने की एक महाशक्ति है—यह रचनात्मकता और गहरी समझ विकसित करता है। लेकिन इन रचनात्मक, हस्तलिखित उत्तरों को ग्रेड करना एक बुरा सपना है। हर छात्र अलग तरह से लिखता है, कुछ असंभव परिदृश्य बना लेते हैं, और कुछ बस निरर्थक बातें लिखते हैं। इसमें बहुत समय लगता है, और यहाँ तक कि मानव शिक्षक भी इस पर असहमत हो सकते हैं कि एक "अच्छा" प्रश्न कैसा दिखता है। यहीं पर आर्टिफिशियल इंटेलिजेंस (AI) की भूमिका आती है, जो एक अथक ग्रेडिंग सहायक होने का वादा करता है। लेकिन यहाँ एक पेंच है: AI मुद्रित (printed) टेक्स्ट को पढ़ने में माहिर है, लेकिन क्या यह हाथ से लिखे गए गणित के उलझे हुए रेखाचित्रों को पढ़ सकता है और एक शानदार छात्र प्रश्न और एक भ्रमित करने वाले कचरे के बीच अंतर कर सकता है? यह प्रश्न शिक्षा और कंप्यूटर विज्ञान के मिलन बिंदु पर स्थित है, जो यह खोजता है कि क्या मशीनें छात्र की रचनात्मकता का मूल्यांकन करने के लिए एक गणित शिक्षक की तरह "सोचना" सीख सकती हैं।
इस अध्ययन के शोधकर्ताओं ने एक बहुत ही स्मार्ट AI, जिसे जेमिनी 3.5 फ्लैश (Gemini 3.5 Flash) कहा जाता है, को परखने का निर्णय लिया। वे देखना चाहते थे कि क्या यह AI 235 मिडिल स्कूल के छात्रों द्वारा बनाए गए हस्तलिखित गणित के सवालों को पढ़ सकता है और उन्हें मानव शिक्षकों की तरह सटीक रूप से ग्रेड दे सकता है। ऐसा करने के लिए, उन्होंने दो अलग-अलग परिदृश्यों वाला एक "टेस्ट टेस्ट" तैयार किया: एक पूर्ण संख्याओं (जैसे ड्राइविंग की दूरी) से संबंधित और दूसरा भिन्नों (fractions) से संबंधित (जैसे केक साझा करना)। उन्होंने AI को एक ही हस्तलिखित टेक्स्ट के दो संस्करण दिए: एक जिसे कंप्यूटर की आँखों द्वारा सीधे पढ़ा गया था (जो कभी-कभी खराब लिखावट के साथ गलतियाँ करता है) और दूसरा जिसे मानव विशेषज्ञों द्वारा सावधानीपूर्वक सुधारा गया था। उन्होंने AI को ग्रेडिंग के नियम दो अलग-अलग क्रमों में भी दिए—सबसे कम स्कोर से ऊपर की ओर बढ़ते हुए, या सबसे ऊपर से नीचे की ओर जाते हुए—यह देखने के लिए कि क्या निर्देशों के क्रम ने AI का निर्णय बदल दिया।
परिणाम "अच्छी खबर" और "सुधार की आवश्यकता" का मिश्रण थे। अध्ययन में पाया गया कि जब AI ने विशेषज्ञ-सुधारित टेक्स्ट का उपयोग किया, तो वह मानव शिक्षकों के साथ बहुत बेहतर ढंग से सहमत हुआ, बजाय इसके कि जब उसने कच्चे, अव्यवस्थित कंप्यूटर रीडिंग का उपयोग किया। हालांकि, गणित के प्रकार का बहुत महत्व था। AI ड्राइविंग कार्य वाले पूर्ण संख्याओं के सवालों को ग्रेड करने में केक कार्य वाले भिन्नों की तुलना में बहुत अधिक सटीक था। ऐसा लगता है कि AI भिन्नों की बारीकियों के साथ अधिक संघर्ष करता है, अक्सर उन उत्तरों को उच्च अंक देता है जो गणितीय रूप से सही थे लेकिन वास्तव में उस कहानी में फिट नहीं बैठते थे जो छात्र सुना रहा था। दिलचस्प बात यह है कि AI को निर्देश दिए जाने के क्रम से कोई फर्क नहीं पड़ा; चाहे AI रूब्रिक (grading rules) के नीचे से शुरू करे या ऊपर से, इसका प्रदर्शन समान रहा।
संक्षेप में, अध्ययन सुझाव देता है कि AI हस्तलिखित गणित के सवालों को ग्रेड करने के लिए एक विश्वसनीय सहायक हो सकता है, लेकिन यह अभी भी पूर्ण नहीं है। यह तब सबसे अच्छा काम करता है जब लिखावट स्पष्ट हो और गणित में पूर्ण संख्याएँ शामिल हों। शोधकर्ताओं ने पाया कि केवल AI को बेहतर टेक्स्ट खिलाने से (कंप्यूटर की पढ़ने की त्रुटियों को मनुष्यों द्वारा ठीक करके) एक उल्लेखनीय अंतर आया, लेकिन AI को अभी भी गणित के पीछे की "कहानी" को समझने के लिए मदद की आवश्यकता है, विशेष रूप से भिन्नों के मामले में। जबकि AI निर्देशों के क्रम से भ्रमित नहीं हुआ, वह गणितीय सामग्री की जटिलता से टकरा गया। लेखक निष्कर्ष निकालते हैं कि हालांकि AI के पास शिक्षकों की मदद करने की पर्याप्त क्षमता है, हमें इसके उपयोग के बारे में सावधान रहने की आवश्यकता है, विशेष रूप से भिन्नों जैसे अधिक जटिल विषयों के लिए, और हमें हमेशा यह दोबारा जांचना चाहिए कि कंप्यूटर छात्र की लिखावट को सही ढंग से पढ़ रहा है या नहीं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।