← नवीनतम पेपर
💻 computer science

Who Am I? History-Aware Profiles for Student Simulation in Tutoring Dialogues

यह शोध पत्र एक इतिहास-जागरूक ढांचे (history-aware framework) को प्रस्तुत करता है जो पिछले शिक्षण अंतःक्रियाओं से छात्र प्रोफाइल उत्पन्न करने के लिए सुदृढीकरण लर्निंग (reinforcement learning) का उपयोग करता है, जो स्वचालित ट्यूटरिंग मूल्यांकन के लिए छात्र प्रतिक्रियाओं के अनुकरण में लार्ज लैंग्वेज मॉडल्स की सटीकता में महत्वपूर्ण सुधार करता है।

मूल लेखक: Zhangqi Duan, Shuyan Huang, Alexander Scarlatos, Jaewook Lee, Simon Woodhead, Andrew Lan

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhangqi Duan, Shuyan Huang, Alexander Scarlatos, Jaewook Lee, Simon Woodhead, Andrew Lan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को गणित का ट्यूटर (शिक्षक) बनना सिखाने की कोशिश कर रहे हैं। रोबोट को अच्छा शिक्षक बनाने के लिए, पहले आपको उसे एक छात्र बनना सिखाना होगा। आपको एक "नकली छात्र" बनाना होगा जो एक वास्तविक मानव शिक्षार्थी की तरह व्यवहार करे, सोचे और गलतियाँ करे। इसे स्टूडेंट सिमुलेशन (छात्र अनुकरण) कहा जाता है।

पिछले प्रयासों के साथ समस्या यह थी कि वे खिलाड़ी के अतीत को देखे बिना "गेस हू?" (Guess Who?) खेलने जैसा था। रोबंतु यह अनुमान लगाने की कोशिश करते थे कि एक छात्र क्या कह सकता है, लेकिन उन्हें उस विशिष्ट छात्र का इतिहास पता नहीं था। उन्हें यह नहीं पता था कि कोई छात्र भिन्न (fractions) में अच्छा है लेकिन ज्यामिति (geometry) में कमजोर है, या वह कब निराश होकर छोटे उत्तर देने लगता है।

यह शोध पत्र इन नकली छात्रों को बनाने का एक नया तरीका पेश करता है, उन्हें उनके सीखने के पूरे इतिहास का एक मेमोरी बैंक (स्मृति बैंक) देकर। उन्होंने इसे कैसे किया, यहाँ सरल अवधारणाओं में दिया गया है:

1. दो-भागों वाली टीम: जीवनी लेखक (Biographer) और अभिनेता (Actor)

निर्माताओं ने एक प्रणाली बनाई जिसमें दो भाग मिलकर काम करते हैं:

  • जीवनी लेखक (प्रोफ़ाइल जनरेटर): कल्पना कीजिए कि एक लेखक है जो छात्र के गणित के प्रश्नों और चैट लॉग्स के पूरे इतिहास को पढ़ता है। यह लेखक केवल तथ्यों की सूची नहीं बनाता; वह एक छोटा, प्रभावशाली "चरित्र प्रोफ़ाइल" लिखता है। यह प्रोफ़ाइल सारांशित करता है कि छात्र क्या जानता है (जैसे, "जोड़ में उत्कृष्ट, ऋणात्मक संख्याओं में संघर्ष करता है") और वह कैसा व्यवहार करता है (जैसे, "भ्रमित होने पर 'मुझे समझ नहीं आया' कहता है और छोटे, अनौपचारिक वाक्यों का उपयोग करता है")।
  • अभिनेता (छात्र सिम्युलेटर): यह वह रोबोट है जो वास्तव में बोलता है। वह जीवनी लेखक के "प्रोफ़ाइल" को पढ़ता है और फिर उस भूमिका को निभाता है। यदि प्रोफ़ाइल कहती है कि छात्र ऋणात्मक संख्याओं को लेकर भ्रमित है, तो अभिनेता उससे संबंधित गलती करेगा। यदि प्रोफ़ाइल कहती है कि छात्र बातूनी है, तो अभिनेता एक लंबा वाक्य लिखेगा।

2. सीक्रेट सॉस: सुदृढीकरण सीखना (Reinforcement Learning - "कोच")

कठिन हिस्सा यह सुनिश्चित करना है कि जीवनी लेखक ऐसा प्रोफ़ाइल लिखे जो वास्तव में अभिनेता को अच्छी तरह से प्रदर्शन करने में मदद करे। यदि जीवनी लेखक एक अस्पष्ट प्रोफ़ाइल लिखता है, तो अभिनेता सामान्य उत्तर देगा।

इसे ठीक करने के लिए, लेखकों ने सुदृढीकरण सीखना (Reinforcement Learning) का उपयोग किया, जो एक सख्त कोच की तरह है।

  • जीवनी लेखक एक प्रोफ़ाइल लिखता है।
  • अभिनेता उस प्रोफ़ाइल के आधार पर छात्र की तरह बोलने का प्रयास करता है।
  • कोच जाँच करता है: "क्या अभिनेता वास्तविक छात्र की तरह लगा, जिसका इतिहास दिया गया था?"
  • यदि अभिनेता नकली लगा, तो कोच जीवनी लेखक को बताता है, "आपके प्रोफ़ाइल में कुछ महत्वपूर्ण कमी थी। फिर से प्रयास करें।"
  • समय के साथ, जीवनी लेखक वह परफेक्ट सारांश लिखना सीख जाता है जो अभिनेता को बिल्कुल वास्तविक छात्र की तरह दिखने में मदद करता है।

3. "दो-दृष्टिकोण" खोज (The "Two-View" Discovery)

इस शोध पत्र की सबसे बड़ी खोजों में से एक यह है कि इसे सही करने के लिए आपको दो अलग-अलग प्रकार के इतिहास की आवश्यकता होती है:

  • टेस्ट स्कोर दृश्य (प्रश्न-उत्तर): यह बताता है कि छात्र क्या जानता है (जैसे, उन्होंने 5 में से 3 प्रश्न सही किए)।
  • संवाद दृश्य (डायलॉग): यह बताता है कि छात्र कैसे व्यवहार करता है (जैसे, वह संकेत मांगता है, इमोजी का उपयोग करता है, या निराश होता है)।

शोध पत्र में पाया गया कि ये दो दृश्य एक व्यक्ति को सामने से और बगल से देखने जैसा है। पूर्ण चित्र समझने के लिए आपको दोनों की आवश्यकता है। यदि आप केवल टेस्ट स्कोर देखते हैं, तो आप उनके बात करने के तरीके को मिस कर देते हैं। यदि आप केवल चैट लॉग देखते हैं, तो आप गणित की उन विशिष्ट अवधारणाओं को मिस कर देते हैं जिनमें वे संघर्ष करते हैं। दोनों को मिलाने से बहुत अधिक वास्तविक "नकली छात्र" बनता है।

4. परिणाम

टीम ने एक गणित शिक्षण मंच के वास्तविक डेटा पर इस प्रणाली का परीक्षण किया। उन्होंने अपने "जीवनी लेखक + अभिनेता" टीम की तुलना अन्य तरीकों (जैसे केवल व्यक्तित्व के प्रकार के आधार पर अनुमान लगाना, या केवल पिछले चैट को याद रखना) से की।

परिणाम? उनकी विधि वास्तविक छात्र के अगले शब्द की भविष्यवाणी करने में काफी बेहतर थी। यह अनुमान लगाने में बेहतर थी कि:

  • छात्र उत्तर सही देगा या गलत।
  • यदि वह गलत हुआ, तो वह विशिष्ट गलती क्या करेगा।
  • वह अपनी प्रतिक्रिया को कैसे व्यक्त करेगा (छोटा बनाम लंबा, आत्मविश्वासी बनाम अनिश्चित)।

संक्षेप में

शोध पत्र कहता है: एक रोबोट बनाने के लिए जो छात्र होने का नाटक कर सके, आप केवल अनुमान नहीं लगा सकते। आपको एक ऐसी प्रणाली की आवश्यकता है जो छात्र के अतीत को पढ़े, उनकी ताकत और आदतों का एक स्मार्ट सारांश लिखे, और फिर उस सारांश का उपयोग करके भूमिका निभाए। इस प्रणाली को अपनी गलतियों से सीखने के लिए प्रशिक्षित करके, उन्होंने एक ऐसा "छात्र सिम्युलेटर" बनाया है जो पहले से बने किसी भी सिस्टम की तुलना में बहुत अधिक सटीक और वास्तविक है। यह डेवलपर्स को वास्तविक बच्चे से बात करने से पहले ही उनके AI ट्यूटर्स का परीक्षण करने और उन्हें बेहतर बनाने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →