← नवीनतम पेपर
💬 NLP

CASTLE: A Comprehensive Benchmark for Evaluating Student-Tailored Personalized Safety in Large Language Models

यह शोधपत्र CASTLE प्रस्तुत करता है, जो लगभग 93,000 परिदृश्यों और तीन नवीन मेट्रिक्स से युक्त एक व्यापक द्विभाषी बेंचमार्क है, जो विविध शैक्षिक जोखिमों और छात्र विशेषताओं के बीच छात्र-अनुकूल व्यक्तिगत सुरक्षा प्रदान करने में वर्तमान बड़े भाषा मॉडलों की क्षमता का मूल्यांकन करने और उनकी महत्वपूर्ण कमियों को उजागर करने के लिए है।

मूल लेखक: Rui Jia, Ruiyi Lan, Fengrui Liu, Zhongxiang Dai, Bo Jiang, Jing Shao, Jingyuan Chen, Guandong Xu, Fei Wu, Min Zhang

प्रकाशित 2026-08-26
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Rui Jia, Ruiyi Lan, Fengrui Liu, Zhongxiang Dai, Bo Jiang, Jing Shao, Jingyuan Chen, Guandong Xu, Fei Wu, Min Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: CASTLE – लार्ज लैंग्वेज मॉडल्स में छात्र-अनुकूलित व्यक्तिगत सुरक्षा के मूल्यांकन के लिए एक व्यापक बेंचमार्क

1. समस्या विवरण

जबकि लार्ज लैंग्वेज मॉडल्स (LLMs) ने व्यक्तिगत शिक्षण को उन्नत किया है, उनकी अंतर्निहित पीढ़ी तंत्र अक्सर समान प्रॉम्प्ट्स के प्रति सजातीय (homogeneous) प्रतिक्रियाएं उत्पन्न करते हैं। यह "एक ही आकार सबके लिए" (one-size-fits-all) वाला दृष्टिकोण छात्रों की संज्ञानात्मक और मनोवैज्ञानिक विशेषताओं की पर्याप्त विषमता की अनदेखी करता है, जो कमजोर समूहों के लिए सुरक्षा जोखिम पैदा कर सकता है। मौजूदा सुरक्षा मूल्यांकन मुख्य रूप से संदर्भ-स्वतंत्र मेट्रिक्स (जैसे, तथ्यात्मक सटीकता, विषाक्तता, पूर्वाग्रह) पर निर्भर करते हैं जो विभिन्न छात्र विशेषताओं के बीच एक ही प्रतिक्रिया द्वारा उत्पन्न होने वाले भिन्न नुकसानों को पकड़ने में विफल रहते हैं। उच्च-दांव वाले शैक्षिक डोमेन में, सामान्य सुरक्षा दृष्टिकोण उन व्यक्तिगत जोखिमों की पहचान करने और उन्हें कम करने में संघर्ष करते हैं जो उपयोगकर्ता की पृष्ठभूमि से उत्पन्न होते हैं, जैसे कि कम-जोखिम वाले छात्र के लिए एक हानिरहित प्रतिक्रिया, ड्रॉपआउट (पढ़ाई छोड़ने) की प्रवृत्ति या गंभीर अवसाद वाले छात्र के लिए घातक व्यवहार को ट्रिगर कर सकती है।

2. कार्यप्रणाली

लेखक CASTLE (Comprehensive Assessment of Student-Tailored Learning and Evaluation) का प्रस्ताव करते हैं, जो व्यक्तिगत सुरक्षा जोखिमों को व्यवस्थित रूप से मापने के लिए शैक्षिक सिद्धांतों पर आधारित एक बेंचमार्क है।

2.1 डेटासेट निर्माण

CASTLE में 92,908 द्विभाषी परिदृश्य (53,483 चीनी, 39,425 अंग्रेजी) शामिल हैं जिन्हें एक बहु-चरणीय पाइपलाइन के माध्यम से निर्मित किया गया है:

  • सैद्धांतिक आधार: यह बेंचमार्क शास्त्रीय शैक्षिक मनोविज्ञान सिद्धांतों को एकीकृत करता है, जिसमें 'बिग फाइव पर्सनैलिटी ट्रेड्स', ड्वेक का 'एबिलिटी बिलीफ टाइप' (ग्रोथ बनाम फिक्स्ड माइंडसेट), फिट्स और पोस्नर के 'स्किल एक्विजिशन स्टेजेस', और ज़िमरमैन के 'सेल्फ-रेगुलेटेड लर्निंग फेजेस' शामिल हैं।
  • जोखिम वर्गीकरण (Risk Taxonomy): एक दो-स्तरीय वर्गीकरण चार श्रेणियों के तहत 15 शैक्षिक सुरक्षा जोखिम डोमेन को परिभाषित करता है:
    1. मनोवैज्ञानिक और भावनात्मक स्वास्थ्य (जैसे, शैक्षणिक दबाव का अत्यधिक बोझ, करियर चयन की दुविधा)।
    2. शैक्षणिक अखंडता और सक्षमता (जैसे, शैक्षणिक कदाचार, सीखने के मार्ग से बचना)।
    3. सामग्री और सूचना पूर्वाग्रह (जैसे, रूढ़िवादिता, मॉडल मतिभ्रम/hallucination जोखिम)।
    4. सीखने की निर्भरता और संज्ञान (जैसे, स्वतंत्र निर्णय की हानि, संज्ञानात्मक कठोरता)।
  • छात्र प्रोफाइल: प्रत्येक परिदृश्य में एक संरचित छात्र प्रोफाइल शामिल है जिसमें 14 गुण (attributes) हैं जो बैकग्राउंड (आयु, लिंग, सीखने का चरण), बिग फाइव पर्सनैलिटी, इमोशन (अवस्था, तीव्रता, हालिया फीडबैक), और एजुकेशन (एबिलिटी बिलीफ, स्किल, एक्विजिशन स्टेज, सेल्फ-रेगुलेशन) तक फैले हुए हैं।
  • जेनरेशन प्रक्रिया: मॉडल-विशिष्ट पूर्वाग्रह को कम करने के लिए एक चक्रीय मल्टी-LLM रणनीति (GPT-4o, Gemini-2.5-Flash, DeepSeek-V3, Claude-Haiku-4.5) का उपयोग करके डेटासेट बनाया गया था। मनोवैज्ञानिक वैधता और विशेषता निरंतरता (जैसे, आयु-ग्रेड बेमेल या असंगत इमोशन-परिदृश्य युग्मों को रोकना) सुनिश्चित करने के लिए सख्त लॉजिक-कन्स्ट्रेंट नियमों को लागू किया गया था।

2.2 मूल्यांकन मेट्रिक्स

CASTLE तीन मूल्यांकन आयाम पेश करता है, जिन्हें 1–5 लिकर्ट स्केल पर रेट किया जाता है:

  1. जोखिम संवेदनशीलता (Risk Sensitivity): क्वेरी में अंतर्निहित मनोवैज्ञानिक या संज्ञानात्मक जोखिमों का पता लगाने की मॉडल की क्षमता को मापता है।
  2. भावनात्मक सहानुभूति (Emotional Empathy): छात्र की भावनात्मक स्थिति को पहचानने और संबोधित करने की मॉडल की क्षमता का मूल्यांकन करता है।
  3. छात्र संरेखण (Student Alignment): मॉडल की प्रतिक्रिया और विशिष्ट छात्र गुणों (व्यक्तित्व, सीखने का चरण, आदि) के बीच मिलान का आकलन करता है।
    औसत सुरक्षा स्कोर (Average Safety Score) इन तीन आयामों का माध्य (mean) है।

2.3 प्रयोगात्मक सेटअप

इस बेंचमार्क का उपयोग 18 LLMs के मूल्यांकन के लिए किया गया था, जिनमें ओपन-सोर्स मॉडल (Qwen श्रृंखला, LLaMA3, Mistral, आदि), क्लोज्ड-सोर्स मॉडल (GPT-4o, GPT-5.2, Claude-Haiku-4.5, Gemini-2.5-Flash), और शिक्षा-विशिष्ट मॉडल (InnoSpark-7B, MuduoLLM-7B) शामिल हैं। मूल्यांकन नॉन-पर्सनलाइज्ड (केवल क्वेरी) और पर्सनलाइज्ड (क्वेरी + पूर्ण प्रोफाइल) सेटिंग्स के तहत किया गया था। मानव-AI विश्वसनीयता विश्लेषण ने पुष्टि की कि Claude-Haiku-4.5 एक मजबूत ऑटोमैटिक इवैल्यूएटर के रूप में कार्य करता है (मानव संदर्भों के विरुद्ध Spearman's ρ\rho = 0.83)।

3. प्रमुख योगदान

  1. वैचारिक ढांचा: पेपर व्यवस्थित रूप से शिक्षा में प्रचलित "वन-साइज़-फिट्स-ऑल" प्रतिमान की सीमाओं की पहचान करता है और स्टूडेंट-टेलरड पर्सनलाइज्ड सेफ्टी को एक नए मूल्यांकन परिप्रेक्ष्य के रूप में पेश करता है।
  2. CASTLE बेंचमार्क: 15 जोखिम डोमेन, 14 छात्र गुणों और 92k+ द्विभाषी परिदृश्यों को कवर करने वाला एक बड़े पैमाने का, सिद्धांत-आधारित बेंचमार्क निर्माण।
  3. मूल्यांकन मेट्रिक्स: बाइनरी सुरक्षा निर्णयों से आगे बढ़ने के लिए तीन विशिष्ट मेट्रिक्स (जोखिम संवेदनशीलता, भावनात्मक सहानुभूति, छात्र संरेखण) का प्रस्ताव।
  4. अनुभवजन्य निष्कर्ष: व्यक्तिगत सुरक्षा आश्वासन में महत्वपूर्ण कमियों को प्रकट करते हुए 18 अत्याधुनिक (state-of-the-art) LLMs का व्यापक मूल्यांकन।

4. परिणाम

  • समग्र प्रदर्शन: सभी मूल्यांकित मॉडलों ने नॉन-पर्सनलाइज्ड सेटिंग में 5 में से औसत सुरक्षा स्कोर 2.5 से कम प्राप्त किया। यहाँ तक कि सबसे मजबूत मॉडल, Claude-Haiku-4.5 ने भी केवल 2.42 प्राप्त किया।
  • वैयक्तिकरण का प्रभाव: संरचित छात्र प्रोफाइल को शामिल करने से सभी 15 डोमेन और सभी मॉडलों में सुरक्षा स्कोर में लगातार सुधार हुआ। हालांकि, वैयक्तिकरण के साथ भी, किसी भी मॉडल ने पूर्ण स्कोर प्राप्त नहीं किया, जो यह दर्शाता है कि वैयक्तिकरण जानकारी जोखिम जागरूकता में सुधार करती है लेकिन जटिल शैक्षिक वातावरण में सुरक्षा जोखिमों को पूरी तरह से समाप्त नहीं करती है।
  • डोमेन बनाम स्केल: डोमेन-विशिष्ट संरेखण (alignment) अकेले मॉडल स्केलिंग की तुलना में अधिक प्रभावी साबित हुआ। शिक्षा-आधारित मॉडल (जैसे, InnoSpark-7B) कई श्रेणियों में बड़े सामान्य-उद्देश्य वाले मॉडलों (जैसे, GPT-4o, Gemini-2.5-Flash) से बेहतर प्रदर्शन करते हैं।
  • सुदृढीकरण सीखना (RL): RL-अनुकूलित मॉडल (जैसे, QwQ-32B) अपने इंस्ट्रक्शन-ट्यून किए गए समकक्षों (जैसे, Qwen2.5-32B) की तुलना में बेहतर प्रदर्शन और व्यक्तिगत जानकारी का बेहतर उपयोग प्रदर्शित करते हैं, जो सुझाव देता है कि सुरक्षा के लिए पैरामीटर संख्या से अधिक प्रशिक्षण प्रतिमान मायने रखते हैं।
  • एट्रिब्यूट संवेदनशीलता: एब्लेशन अध्ययनों ने दिखाया कि इमोशन (भावना) और एजुकेशन (शिक्षा) गुणों ने सबसे अधिक सुरक्षा लाभ में योगदान दिया। स्पष्ट वैयक्तिकरण (संरचित प्रोफाइल) ने निहित वैयक्तिकरण (क्वेरी में सन्निहित संकेत) की तुलना में काफी उच्च सुरक्षा स्कोर दिए।
  • सेफ्टी गार्ड की सीमाएं: मौजूदा सामान्य-उद्देश्य वाले सुरक्षा गार्ड मॉडल (जैसे, Llama-Guard, WildGuard) ने CASTLE की 96% से अधिक प्रतिक्रियाओं को "सुरक्षित" के रूप में वर्गीकृत किया, जो बेंचमार्क द्वारा लक्षित सूक्ष्म, व्यक्तिगत शैक्षिक जोखिमों का पता लगाने में विफल रहे।

5. महत्व और दावे

पेपर का दावा है कि CASTLE व्यक्तिगत छात्र संदर्भों के अनुकूल सुरक्षा अनुसंधान के लिए एक आवश्यक आधार प्रदान करता है, जो वर्तमान सुरक्षा अनुसंधान में एक महत्वपूर्ण ब्लाइंड स्पॉट को संबोधित करता है। यह रेखांकित करता है कि:

  • वर्तमान LLMs स्पष्ट व्यक्तिगत संदर्भ के बिना छात्र-विशिष्ट जोखिमों की पहचान करने में संघर्ष करते हैं।
  • उच्च-दांव वाले शैक्षिक परिदृश्यों में सुरक्षित, अधिक सहानुभूतिपूर्ण प्रतिक्रियाएं उत्पन्न करने के लिए संरचित प्रोफाइल और स्पष्ट वैयक्तिकरण तंत्र आवश्यक हैं।
  • "वन-साइज़-फिट्स-ऑल" जेनरेशन प्रतिमान शिक्षा के लिए अपर्याप्त है, जहाँ संज्ञानात्मक और मनोवैज्ञानिक विषमता सुरक्षा परिणामों को निर्धारित करती है।

लेखक CASTLE को संदर्भ-जागरूक संरेखण तंत्र के विकास को प्रेरित करने वाले एक उपकरण के रूप में देखते हैं, यह नोट करते हुए कि हालांकि बेंचमार्क डिजाइन मूल्यांकन के लिए है, इसका उद्देश्य नैदानिक निदान या उच्च-दांव वाले निर्णय लेना नहीं है। भविष्य के कार्यों के लिए बेंचमार्क को मल्टी-टर्न इंटरैक्टिव सेटिंग्स और अधिक भाषाओं तक विस्तारित करने का सुझाव दिया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →