← नवीनतम पेपर
💬 NLP

LLM Prompt Evaluation for Educational Applications

यह अध्ययन शैक्षिक संवाद के लिए LLM प्रॉम्प्ट टेम्पलेट्स का मूल्यांकन करने हेतु Glicko2 रेटिंग सिस्टम का उपयोग करते हुए एक व्यवस्थित, टूर्नामेंट-शैली वाले मूल्यांकन ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि 'परसोना' (persona) और 'कॉन्टेक्स्ट मैनेजमेंट' (context management) रणनीतियों को संयोजित करने वाला एक प्रॉम्प्ट, अन्य की तुलना में शैक्षणिक रूप से संरेखित अनुवर्ती प्रश्न उत्पन्न करने में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Langdon Holmes, Adam Coscia, Scott Crossley, Joon Suh Choi, Wesley Morris

प्रकाशित 2026-01-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Langdon Holmes, Adam Coscia, Scott Crossley, Joon Suh Choi, Wesley Morris

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े शाब्दिक (literal) रोबोट को एक अच्छा रीडिंग ट्यूटर बनना सिखाने की कोशिश कर रहे हैं। आप रोबोट को सिर्फ यह नहीं कह सकते, "छात्र की मदद करो।" आपको रोबोट को यह बताने के लिए निर्देशों का एक बहुत ही विशिष्ट सेट, जिसे प्रॉम्ट (prompt) कहते हैं, लिखना होगा कि उसे कैसा व्यवहार करना है, उसका लहजा (tone) कैसा होना चाहिए और उसे किस तरह के प्रश्न पूछने चाहिए।

यह पेपर उन निर्देशों के लिए सबसे अच्छा 'नुस्खा' खोजने की एक कुकिंग प्रतियोगिता (cooking competition) की तरह है।

सेटिंग: एक डिजिटल रीडिंग क्लास

शोधकर्ता एक स्मार्ट वेबसाइट (जिसे STAIRS कहा जाता है) के साथ काम कर रहे थे जो छात्रों को कठिन पाठ्यपुस्तकों को पढ़ने में मदद करती है। जब एक छात्र एक पेज पढ़ता है और उसका सारांश (summary) लिखता है, तो सिस्टम यह जाँचता है कि क्या उसने वास्तव में उसे समझा है। यदि सारांश कमजोर है, तो सिस्टम हस्तक्षेप करता है। यह टेक्स्ट का एक कठिन हिस्सा चुनता है, छात्र को गहराई से सोचने में मदद करने के लिए एक प्रश्न पूछता है, और फिर—यही मुख्य बात है—बातचीत को जारी रखने के लिए एक फॉलो-अप प्रश्न (follow-up question) पूछता है।

बड़ा सवाल यह था: हमें AI के लिए निर्देशों (प्रॉम्ट) को कैसे लिखना चाहिए ताकि वह सबसे बेहतर संभव फॉलो-अप प्रश्न पूछ सके?

प्रतियोगी: छह अलग-अलग "व्यक्तित्व" (Personalities)

टीम ने निर्देशों के छह अलग-अलग सेट (प्रॉम्ट) बनाए। प्रत्येक सेट एक अलग शिक्षण दर्शन या "व्यक्तित्व" पर आधारित था:

  1. द बेसलाइन (The Baseline): पुराने, मानक निर्देश जिनका वे पहले उपयोग कर रहे थे। यह एक बुनियादी, बिना किसी तामझाम वाले नुस्खे जैसा था।
  2. द सोक्रेटिक गाइड (The Socratic Guide): AI एक दार्शनिक की तरह कार्य करता है, ऐसे प्रश्न पूछता है जो छात्र को यह सोचने पर मजबूर करते हैं कि वे कैसे सोच रहे हैं (metacognition)।
  3. द स्कैफोल्डिंग एक्सपर्ट (The Scaffolding Expert): AI एक निर्माण फोरमैन (construction foreman) की तरह कार्य करता है, जो सावधानीपूर्वक छात्र के पहले से ज्ञात ज्ञान पर निर्माण करता है और कमियों को चरण-दर-चरण भरता है।
  4. द कनेक्शन बिल्डर (The Connection Builder): AI टेक्स्ट को छात्र के व्यक्तिगत जीवन और पिछले अनुभवों से जोड़ने का प्रयास करता है।
  5. द कॉम्प्रिहेन्शन मॉनिटर (The Comprehension Monitor): AI एक सेल्फ-चेक टूल की तरह कार्य करता है, छात्र को यह मूल्यांकन करने में मदद करता है कि क्या वे वास्तव में सामग्री को समझते हैं।
  6. द स्ट्रैटेजिक रीडिंग कोच (The Strategic Reading Coach): AI एक कोच के रूप में कार्य करता है जो छात्र को रणनीतिक रूप से कैसे पढ़ा जाए, यह सिखाता है, ध्यान केंद्रित करता है कि वे अपनी सीखने की आदतों और आत्म-निर्देशन (self-direction) पर ध्यान दें।

टूर्नामेंट: उन्होंने विजेता का निर्णय कैसे किया

केवल अनुमान लगाने के बजाय, शोधकर्ताओं ने एक टूर्नामेंट आयोजित किया।

  • जज (Judges): उन्होंने आठ मानव न्यायाधीशों (प्रोफेसरों, पीएचडी छात्रों और स्नातक छात्रों का मिश्रण) को नियुक्त किया जो सिस्टम को अच्छी तरह जानते थे।
  • खेल: जजों को फॉलो-अप प्रश्नों के जोड़े दिखाए गए। एक प्रश्न "सोक्रेटिक गाइड" निर्देशों से आता था, दूसरा "स्कैफोल्डिंग एक्सपर्ट" निर्देशों से आता था, और इसी तरह।
  • कार्य: जजों को पसंदीदा प्रश्न चुनना था। उन्होंने स्कोर नहीं दिया; वे बस प्रत्येक जोड़े में विजेता के लिए वोट देते थे।
  • गणित: उन्होंने एक विशेष रेटिंग प्रणाली का उपयोग किया (वैसी ही जैसी शतरंज के खिलाड़ियों को रैंक करने के लिए उपयोग की जाती है) यह गणना करने के लिए कि एक प्रॉम्ट के दूसरे को हराने की संभावना कितनी है।

परिणाम: कौन जीता?

परिणाम स्पष्ट थे। स्ट्रैटेजिक रीडिंग कोच (Strategic Reading Coach) निर्विवाद चैंपियन था।

  • विजेता: "स्ट्रैटेजिक रीडिंग कोच" प्रॉम्ट लगभग हर बार जीत गया जब इसकी तुलना अन्य से की गई। इसकी पसंद चुने जाने की संभावना 81% से 100% थी।

  • क्यों जीता: यह प्रॉम्ट विशेष था क्योंकि इसने दो शक्तिशाली "पैटर्न" को जोड़ा था:

    1. पर्सोना (Persona): इसने AI को बताया, "आप एक रीडिंग कोच हैं।"
    2. कॉन्टेक्स्ट मैनेजर (Context Manager): इसने AI को बताया, "पूरी तरह से छात्र को उनकी अपनी रीडिंग रणनीति प्रबंधित करने में मदद करने पर ध्यान केंद्रित करें।"
      AI को यह बताने कि वह कौन है और उसकी सीमाएं क्या हैं, इससे सबसे सहायक फॉलो-अप प्रश्न तैयार हुए।
  • उपविजेता: "स्कैफोल्डिंग एक्सपर्ट" दूसरे स्थान पर आया। यह ज्ञान की कमियों को भरने में बहुत अच्छा था।

  • आश्चर्य: पुराना बेसलाइन प्रॉम्ट (जिसे वे बिना किसी फैंसी नई तकनीकों के उपयोग कर रहे थे) तीसरे स्थान पर आया। यह ठीक था, लेकिन नए, सावधानीपूर्वक डिज़ाइन किए गए प्रॉम्ट काफी बेहतर थे।

  • हारने वाले: वे प्रॉम्ट जो बिना किसी मजबूत कोचिंग पर्सोना के केवल "विचारों को जोड़ने" या "निगरानी करने" पर बहुत अधिक ध्यान केंद्रित करते थे, उनका प्रदर्शन उतना अच्छा नहीं रहा।

मुख्य निष्कर्ष

यह पेपर तर्क देता है कि हम शिक्षा में AI से बात करने का केवल अनुमान नहीं लगा सकते। हमें अपने निर्देशों का परीक्षण करने के लिए एक व्यवस्थित तरीका चाहिए।

इसे इस तरह सोचें: यदि आप एक बेहतर पुल बनाना चाहते हैं, तो आप केवल एक डिज़ाइन नहीं बनाते और उम्मीद नहीं करते कि वह टिक जाएगा। आप विभिन्न डिज़ाइनों का परीक्षण करते हैं। यह पेपर दिखाता है कि एक "टूर्नामेंट" चलाकर जहाँ मनुष्य सर्वश्रेष्ठ AI प्रतिक्रियाओं पर वोट करते हैं, शोधकर्ता वैज्ञानिक रूप से सिद्ध कर सकते हैं कि निर्देशों का कौन सा "नुस्खा" सबसे अच्छा काम करता है। इस विशिष्ट मामले में, वह नुस्खा जिसने AI को एक स्ट्रैटेजिक रीडिंग कोच में बदल दिया, छात्रों को सीखने में मदद करने का सबसे प्रभावी तरीका था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →