Toward a Benchmark for Controllable Simulation of Imperfect Students with Large Language Models
यह शोध पत्र शिक्षक शिक्षा में सहायता के लिए नियंत्रणीय, आंशिक कौशल महारत वाले छात्रों का अनुकरण करने हेतु बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) का उपयोग करने के लिए एक बेंचमार्क-उन्मुख ढांचे को प्रस्तुत करता है, यह प्रदर्शित करते हुए कि हालांकि दक्षताओं का चयनात्मक प्रतिधारण और दमन प्राप्त करने योग्य है, नियंत्रण की डिग्री उपयोग किए गए विशिष्ट मॉडल पर निर्भर करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक नए शिक्षक को प्रशिक्षित कर रहे हैं। अपने काम में कुशल होने के लिए, उन्हें उन छात्रों के साथ अभ्यास करने की आवश्यकता है जो विशिष्ट गलतियाँ करते हैं, कुछ चीजें भूल जाते हैं, और विशेष अवधारणाओं (concepts) के साथ संघर्ष करते हैं। वे केवल 'परफेक्ट जीनियस' के साथ अभ्यास नहीं कर सकते; उन्हें यह देखने की आवश्यकता है कि एक ऐसे छात्र को कैसे संभालना है जिसे जोड़ना (addition) आता है लेकिन वह घटाना (subtraction) भूल गया है।
यह शोध पत्र एक बड़ा सवाल पूछता है: क्या हम एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) का उपयोग एक "दोषपूर्ण" छात्र होने का नाटक करने के लिए कर सकते हैं?
यहाँ शोधकर्ताओं ने क्या किया, इसका विवरण सरल उपमाओं (analogies) का उपयोग करते हुए दिया गया है।
लक्ष्य: "गिरगिट" जैसा छात्र (The Chameleon Student)
आमतौर पर, जब हम गणित की समस्याओं को हल करने के लिए AI से पूछते हैं, तो हम चाहते हैं कि वह सटीक हो। हम चाहते हैं कि वह ए+ (A+) प्राप्त करे। लेकिन शिक्षक प्रशिक्षण के लिए, हमें चाहिए कि AI एक "सी-माइनस" (C-minus) छात्र बने जिसने विशेष रूप से भिन्न (fractions) को संभालना भूल गया है, लेकिन उसे ज्यामिति (geometry) करना याद है।
शोधकर्ता यह देखना चाहते थे कि क्या वे AI को यह बता सकते हैं: "ऐसा छात्र बनने का नाटक करो जिसे कौशल A और कौशल B पता है, लेकिन तुम कौशल C पूरी तरह से भूल चुके हो।"
चुनौती: यह कठिन क्यों है?
AI को एक ऐसी लाइब्रेरी की तरह समझें जिसने अब तक की लिखी गई हर गणित की किताब पढ़ ली है। वह सब कुछ जानता है।
- समस्या: यदि आप लाइब्रेरी से कहें कि वह "भिन्न" (fractions) को भूल जाए, तो उसे उस ज्ञान का उपयोग करने से रोकना कठिन है। यह वैसा ही है जैसे किसी व्यक्ति को, जिसे चॉकलेट बहुत पसंद है, यह कहने के लिए कहना कि वह बस आपके कहने पर अचानक उससे नफरत करने लगे। वह ज्ञान बहुत गहराई से "जड़ जमा चुका" (entrenched) होता है।
- डर: यदि आप AI को भिन्न (fractions) भूलने के लिए कहते हैं, तो क्या वह गलती से ज्यामिति (geometry) भी भूल जाएगा? या वह बस अंदाज़े लगाने लगेगा? शोधकर्ता यह जानना चाहते थे कि क्या वे केवल उस विशिष्ट कौशल को "सर्जिकल तरीके" से हटा सकते हैं जिसे वे चाहते थे कि AI "भूल" जाए।
प्रयोग: कौशलों का "मेन्यू" (The Menu of Skills)
शोधकर्ताओं ने चौथी और पांचवीं कक्षा के गणित के प्रश्नों का उपयोग करके एक परीक्षण बनाया। उन्होंने गणित के विषयों (जैसे "भिन्न" या "ज्यामिति") को एक मेन्यू के आइटम्स की तरह माना।
- प्रोफ़ाइल: उन्होंने AI के लिए एक "छात्र प्रोफ़ाइल" बनाई। यह एक सूची थी जहाँ उन्होंने उन कौशलों के लिए "हाँ" टिक किया जिन्हें AI को याद रखना चाहिए था और उन कौशलों के लिए "नहीं" जहाँ AI को भूल जाना चाहिए था।
- निर्देश: उन्होंने AI को यह बताने के तीन तरीके आजमाए:
- सिर्फ बताना: "तुम एक ऐसे छात्र हो जिसने भिन्न (fractions) भूल गए हैं।"
- सिर्फ दिखाना: AI को गलतियाँ करते हुए छात्रों के उदाहरण देना।
- हाइब्रिड (विजेता): AI को यह बताना कि उसे क्या भूलना है और उसे यह भी दिखाना कि उन विशिष्ट गलतियों को कैसे करना है।
परिणाम: क्या काम आया?
शोधकर्ताओं ने पाया कि AI वास्तव में एक दोषपूर्ण छात्र होने का नाटक कर सकता था, लेकिन यह इस बात पर निर्भर करता था कि उनसे कैसे पूछा गया और वे कौन सा AI इस्तेमाल कर रहे थे।
- "हाइब्रिड" दृष्टिकोण विजेता रहा: AI को कुछ भूलने के लिए सिर्फ बताना काफी नहीं था। AI को उदाहरण दिखाना भी काफी नहीं था। लेकिन जब उन्होंने दोनों किया (हाइब्रिड विधि), तो AI "दोषपूर्ण छात्र" की भूमिका के बहुत करीब पहुँच गया। यह ऐसा था जैसे किसी मेथड एक्टर को स्क्रिप्ट और बैकस्टोरी दोनों दे दी गई हों; प्रदर्शन बहुत अधिक विश्वसनीय हो गया।
- सभी AI समान नहीं हैं: उन्होंने तीन अलग-अलग AI मॉडल (Claude, DeepSeek, और GPT-4o) का परीक्षण किया।
- Claude सबसे अच्छा "अभिनेता" था। वह उन कौशलों को बिना बिगाड़े जिन्हें उसे बनाए रखना था, विशिष्ट चीजों को भूलने के निर्देशों का बहुत अच्छी तरह से पालन कर सका।
- DeepSeek गणित में बहुत अच्छा था लेकिन उसे नियंत्रित करना कठिन था। वह समस्याओं को सही ढंग से हल करने की कोशिश करता रहा, भले ही उसे असफल होने के लिए कहा गया था।
- GPT-4o बीच में कहीं था।
- कोई "पार्श्व क्षति" (Collateral Damage) नहीं: अच्छी खबर! जब AI को "भिन्न" (fractions) भूलने के लिए कहा गया, तो उसने गलती से "ज्यामिति" (geometry) नहीं भुला दी। यह भूलना स्थानीयकृत (localized) था। यह रसोई की लाइट बंद करने जैसा था बिना बेडरूम की लाइट बंद किए।
मुख्य निष्कर्ष (The Bottom Line)
यह शोध पत्र यह नहीं कहता कि हमने अभी तक क्लासरूम के लिए एक आदर्श वर्चुअल छात्र बना लिया है। यह कुछ अधिक विशिष्ट कहता है: हमने यह साबित कर दिया है कि हम एक 'बेंचमार्क' बना सकते हैं यह परीक्षण करने के लिए कि क्या एक AI चुनिously चीज़ों को भूल सकता है।
उन्होंने एक तरीका बनाया जिससे यह मापा जा सके कि क्या एक AI को नियंत्रित तरीके से अपूर्ण होने के लिए "मोड़ा" (steer) जा सकता है। यह एक महत्वपूर्ण पहला कदम है। शिक्षकों को प्रशिक्षित करने के लिए AI का उपयोग करने से पहले, हमें पहले यह साबित करना होगा कि AI वास्तव में विशिष्ट कमजोरियों वाले छात्र होने का नाटक कर सकता है, न कि केवल एक परफेक्ट रोबोट बनकर रह जाता है जो गलतियाँ करने से इनकार कर देता है।
संक्षेप में: शोधकर्ताओं ने यह देखने के लिए एक परीक्षण बनाया कि क्या वे एक AI को विशिष्ट विषयों पर "नासमझ" होने का नाटक करना सिखा सकते हैं। उन्होंने पाया कि सही निर्देशों के साथ, AI ऐसा कर सकता है, लेकिन यह एक जटिल कार्य है जो इस बात पर निर्भर करता है कि आप किस AI का उपयोग कर रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।