← नवीनतम पेपर
💻 computer science

GrandGuard: Taxonomy, Benchmark, and Safeguards for Elderly-Chatbot Interaction Safety

यह शोध पत्र ग्रैंडगार्ड (GrandGuard) को प्रस्तुत करता है, जो एक तीन-स्तरीय वर्गीकरण, 10,404-आइटम वाले बेंचमार्क और विशिष्ट सुरक्षा उपायों से युक्त पहला व्यापक ढांचा है, जो एलएलएम (LLM) इंटरैक्शन में बुजुर्गों से संबंधित उन विशिष्ट सुरक्षा जोखिमों की पहचान करने और उन्हें कम करने के लिए बनाया गया है जिन्हें मौजूदा सामान्य सुरक्षा उपाय अनदेखा कर देते हैं।

मूल लेखक: Changxuan Fan, Xi Yang, Yueyuan Zheng, Bin Zhou, Yuanping Wang, Wenbin Hu, Huihao Jing, Ki Sen Hung, Dazhao Du, Haoran Li, Janet Hui-wen Hsiao, Yangqiu Song

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Changxuan Fan, Xi Yang, Yueyuan Zheng, Bin Zhou, Yuanping Wang, Wenbin Hu, Huihao Jing, Ki Sen Hung, Dazhao Du, Haoran Li, Janet Hui-wen Hsiao, Yangqiu Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सहायक रोबोट मित्र है जो किसी भी प्रश्न का उत्तर दे सकता है। एक युवा, स्वस्थ व्यक्ति के लिए, "अंधेरे में ऊँची छत पर बल्ब कैसे बदलें?" पूछना एक सामान्य DIY (स्वयं करने वाला) प्रश्न है। रोबोट एक सीढ़ी का उपयोग करने के बारे में एक मददगार उत्तर दे सकता है।

लेकिन एक 80 वर्षीय व्यक्ति के लिए जिसके हाथ कांपते हैं या दृष्टि कमजोर है, वही प्रश्न एक गंभीर गिरने की घटना का कारण बन सकता है। रोबोट, यह जाने बिना कि उपयोगकर्ता वृद्ध है, वही "मददगार" उत्तर देता है, वह छिपे हुए खतरे को नहीं देख पाता।

यही वह समस्या है जिसे GRANDGUARD नामक शोध पत्र हल करने की कोशिश करता है। यह तर्क देता है कि वर्तमान AI सुरक्षा नियम एक सामान्य "छूना मना है" के बोर्ड की तरह हैं। वे स्पष्ट खतरों (जैसे "बम कैसे बनाएं?") को तो रोक देते हैं, लेकिन उन सूक्ष्म, आयु-विशिष्ट जालों को मिस कर जाते हैं जो केवल वृद्ध वयस्कों को नुकसान पहुँचा सकते हैं।

यहाँ सरल उपमाओं का उपयोग करके शोध पत्र के कार्य का विवरण दिया गया है:

1. "विशेष मानचित्र" (The Taxonomy)

इससे पहले कि आप किसी समस्या को ठीक कर सकें, आपको यह जानना होगा कि गड्ढे वास्तव में कहाँ हैं। शोधकर्ताओं ने विशेष रूप से वृद्ध वयस्कों के लिए खतरों का एक नया "मानचित्र" बनाया।

  • पुराना तरीका: सुरक्षा मानचित्र आमतौर पर बड़े, स्पष्ट राक्षसों (घृणास्पद भाषण, हिंसा) की तलाश करते हैं।
  • GRANDGUARD का तरीका: उन्होंने एक विस्तृत मानचित्र बनाया जिसमें 50 विशिष्ट "खतरे क्षेत्र" हैं जो केवल तब दिखाई देते हैं जब कोई वृद्ध वयस्क शामिल होता है।
    • उदाहरण: एक "वित्तीय खतरा क्षेत्र" केवल पैसे चुराने के बारे में नहीं है; यह एक AI द्वारा अनजाने में एक स्कैमर की मदद करने के बारे में है जो एक अकेले बुजुर्ग को पैसे भेजने के लिए बहला-फुसला सकता है।
    • उदाहरण: एक "शारीरिक खतरा क्षेत्र" केवल मैराथन दौड़ने के बारे में नहीं है; यह एक AI द्वारा सुझाव देने के बारे में है कि एक वरिष्ठ व्यक्ति अंधेरे में अकेले सीढ़ी पर चढ़ जाए।
    • उन्होंने यह मानचित्र समाचार रिपोर्टों, उन ऑनलाइन मंचों जहाँ लोग बुजुर्गों की देखभाल पर चर्चा करते हैं, और डॉक्टरों एवं देखभाल करने वालों के साक्षात्कार से वास्तविक कहानियों को सुनकर बनाया।

2. "तनाव परीक्षण" (The Benchmark)

एक बार जब उनके पास मानचित्र आ गया, तो उन्हें यह देखने की आवश्यकता थी कि क्या वर्तमान AI रोबोट इस मार्ग पर चल सकते हैं। उन्होंने 10,000 से अधिक प्रश्नों और उत्तरों के साथ एक विशाल टेस्ट ट्रैक बनाया।

  • उन्होंने शीर्ष AI मॉडलों (जैसे GPT-5, Claude और Gemini) से ऐसे प्रश्न पूछे जो एक युवा व्यक्ति के लिए हानिरहित दिखते हैं लेकिन एक वृद्ध व्यक्ति के लिए खतरनाक हैं।
  • परिणाम: रोबोट बुरी तरह विफल रहे। 50% से अधिक मामलों में, AI ने असुरक्षित सलाह दी।
    • "ज्ञान-क्रिया अंतराल" (The Knowledge-Action Gap): शोध पत्र में एक दिलचस्प बात मिली। जब उन्होंने AI से पूछा, "क्या यह प्रश्न एक वृद्ध व्यक्ति के लिए खतरनाक है?" तो AI अक्सर कहता, "हाँ, मैं जानता हूँ कि यह जोखिम भरा है।" लेकिन जब उन्होंने इसे प्रश्न का उत्तर देने के लिए कहा, तो इसने फिर भी खतरनाक सलाह दे दी। यह एक ड्राइवर की तरह था जो कहता है, "मुझे पता है कि वह सड़क बर्फीली है," लेकिन फिर भी तेज़ गति से गाड़ी चलाता रहता है।

3. "सुरक्षा रेलिंग" (The Solution)

चूंकि रोबोट परीक्षण में बार-बार विफल हो रहे थे, इसलिए शोधकर्ताओं ने AI के लिए एक "को-पायलट" के रूप में कार्य करने के लिए दो नए सुरक्षा सिस्टम बनाए।

  • गार्डरेल #1: विशेष जासूस (Fine-tuned Llama-Guard)
    उन्होंने एक मौजूदा सुरक्षा मॉडल को लिया और उसे अपने नए "मानचित्र" का उपयोग करके एक गहन प्रशिक्षण दिया। यह जासूस अब विशेष रूप से वृद्धों से संबंधित जोखिमों को पहचानने के लिए प्रशिक्षित है। यह एक सुरक्षा गार्ड को अपग्रेड करने जैसा है जो आमतौर पर केवल दुकान में चोरी करने वालों को देखता है, ताकि वह यह भी देख सके कि किसी वरिष्ठ व्यक्ति को घोटाले में फंसाया जा रहा है।

    • परिणाम: इस जासूस ने 96% खतरनाक प्रॉम्प्ट्स को पकड़ा।
  • गार्डरेल #2: नियम पुस्तिका (Policy-Enhanced Moderation)
    उन्होंने एक लचीला सेट भी बनाया जिसे बदला जा सकता है। कल्पना कीजिए कि एक अस्पताल प्रशासक कह सकता है, "इस विशिष्ट केयर होम के लिए, वित्तीय प्रश्नों के प्रति बहुत सख्त रहें," जबकि एक पारिवारिक देखभाल करने वाला कह सकता है, "गिरने के जोखिमों के प्रति बहुत सख्त रहें।" यह प्रणाली मनुष्यों को पूरे AI को फिर से प्रशिक्षित किए बिना कस्टम सुरक्षा नियम लिखने की अनुमति देती है।

    • परिणाम: इस प्रणाली ने 91% खतरनाक प्रॉम्प्ट्स को पकड़ा।

4. "सुरक्षा कोच" (The Agent)

अंत में, उन्होंने एक हल्का "कोच" बनाया जो उपयोगकर्ता और AI के बीच बैठता है।

  • जब कोई वृद्ध व्यक्ति कोई जोखिम भरा प्रश्न पूछता है, तो कोच पहले हस्तक्षेप करता है। वह AI के कान में फुसफुसाता है: "हे, यह उपयोगकर्ता वृद्ध है। अंधेरे में बल्ब बदलने के बारे में यह प्रश्न गिरने का जोखिम है। केवल निर्देश न दें; उन्हें दिन के उजाले का इंतजार करने या किसी सहायक को बुलाने का सुझाव दें।"
  • इस कोच ने यहाँ तक कि सबसे खराब प्रदर्शन करने वाले AI मॉडलों को भी नाटकीय रूप से सुधारने में मदद की, जिससे उनकी सुरक्षा दर 39% से बढ़कर 91% हो गई।

सारांश

शोध पत्र निष्कर्ष निकालता है कि हम केवल "एक ही आकार के सभी के लिए" (one-size-fits-all) वाले सुरक्षा नियमों का उपयोग नहीं कर सकते। जिस तरह एक कार को रेस ट्रैक बनाम स्कूल ज़ोन के लिए अलग-अलग सुरक्षा सुविधाओं की आवश्यकता होती है, उसी तरह AI को एक युवा वयस्क बनाम एक वृद्ध वयस्क के लिए अलग-अलग सुरक्षा नियमों की आवश्यकता होती है। GRANDGUARD वह मानचित्र, टेस्ट ट्रैक और गार्डरेल प्रदान करता है ताकि यह सुनिश्चित हो सके कि AI अनजाने में उन लोगों को नुकसान न पहुँचाए जिन्हें इसकी सबसे अधिक आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →