Creating and Evaluating K-12 GenAI Assessment Graders Through Context Engineering
यह शोध पत्र रूब्रिक्स के विरुद्ध K-12 छात्रों के कार्यों को ग्रेडिंग करने में कॉन्टेक्स्ट-इंजीनियर्ड (context-engineered) LLMs की प्रभावशीलता का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि ये मॉडल गणित और विज्ञान में मानव रेटर्स के साथ मजबूत सहमति प्राप्त करते हैं और वर्णनात्मक फीडबैक के लिए अच्छी तरह से स्वीकार किए जाते हैं, लेकिन इनका सर्वोत्तम उपयोग हाइब्रिड सिस्टम के भीतर फॉर्मेटिव टूल्स के रूप में किया जाना चाहिए जो समेटिव स्कोरिंग के लिए शिक्षक की देखरेख को बनाए रखते हैं।