← नवीनतम पेपर
💻 computer science

KidsNanny: A Two-Stage Multimodal Content Moderation Pipeline Integrating Visual Classification, Object Detection, OCR, and Contextual Reasoning for Child Safety

KidsNanny एक लो-लेटेंसी, दो-चरणीय मल्टीमॉडल कंटेंट मॉडरेशन सिस्टम है जो मौजूदा मॉडलों की तुलना में बाल सुरक्षा खतरों का पता लगाने में बेहतर सटीकता और गति प्राप्त करने के लिए तेज़ विजुअल स्क्रीनिंग को टेक्स्ट-आधारित प्रासंगिक तर्क के साथ जोड़ता है, विशेष रूप से टेक्स्ट-एम्बेडेड जोखिमों को पहचानने में उत्कृष्ट है।

मूल लेखक: Viraj Panchal, Tanmay Talsaniya, Parag Patel, Meet Patel

प्रकाशित 2026-03-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Viraj Panchal, Tanmay Talsaniya, Parag Patel, Meet Patel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप बच्चों के लिए एक विशाल, 24/7 डिजिटल प्लेग्राउंड चला रहे हैं। हर सेकंड, हजारों फोटो और मीम्स अपलोड किए जा रहे हैं। आपका काम यह सुनिश्चित करना है कि कोई भी हानिकारक चीज़ गेट के अंदर न आ पाए। लेकिन यहाँ एक पेंच है: कुछ बुरी चीज़ें पहली नज़र में मासूम दिखती हैं, जबकि अन्य चीज़ें बहुत ही स्पष्ट रूप से बुरी होती हैं।

यह पेपर KidsNanny पेश करता है, जो एक नया "सुरक्षा गार्ड" सिस्टम है जिसे इस समस्या को हल करने के लिए डिज़ाइन किया गया है। एक विशाल, धीमे, सुपर-इंटेलिजेंट गार्ड को नियुक्त करने के बजाय जो एक साथ सब कुछ देखने की कोशिश करता है, KidsNanny एक दो-चरणीय टीम (two-stage team) का उपयोग करता है जो एक रिले रेस की तरह काम करती है।

यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए यहाँ दिया गया है:

समस्या: "धीमा दिग्गज" बनाम "अंधा मोड़" (The "Slow Giant" vs. The "Blind Spot")

मौजूदा सुरक्षा प्रणालियाँ दो समूहों में बँटी हुई हैं:

  1. तेज़ लेकिन अंधे गार्ड: ये उन सुरक्षा गार्डों की तरह हैं जो केवल तस्वीर के रंगों और आकारों को देखते हैं। वे बहुत तेज़ हैं लेकिन वे फोटो पर लिखे टेक्स्ट को नहीं पढ़ सकते। यदि किसी मीम में एक हानिरहित दिखने वाली बिल्ली है लेकिन उसके ऊपर एक खतरनाक संदेश लिखा है, तो वे इसे मिस कर देते हैं।
  2. धीमे दिग्गज (VLMs): ये सुपर-इंटेलिजेंट जासूसों की तरह हैं जो तस्वीर देख भी सकते हैं और टेक्स्ट पढ़ भी सकते हैं। वे बहुत बुद्धिमान हैं, लेकिन वे इतने धीमे हैं कि जब तक वे एक फोटो का विश्लेषण करना समाप्त करते हैं, तब तक हजारों नई चीजें प्लेग्राउंड में आ चुकी होती हैं। वे एक इमेज को चेक करने में सेकंडों का समय लेते हैं, जो रियल-टाइम के लिए बहुत धीमा है।

समाधान: किड्सनैनी रिले टीम (The KidsNanny Relay Team)

KidsNanny इस काम को दो विशिष्ट चरणों में विभाजित करता है ताकि दोनों दुनियाओं का सर्वश्रेष्ठ मिल सके: गति (Speed) और समझ (Smarts)

🏃 चरण 1: "स्पीड स्कैनर" (द विजुअल गेटकीपर)

  • यह क्या करता है: यह सुरक्षा की पहली पंक्ति है। यह एक तेज़ कंप्यूटर प्रोग्राम है जो इमेज को 11 मिलीसेकंड (जो पलक झपकने से भी तेज़ है!) में देखता है।
  • यह कैसे काम करता है: यह स्पष्ट रेड फ्लैग्स (जैसे कि अनुचित शरीर के अंग या हिंसक दृश्य) के लिए जाँच करता है, जिसके लिए एक "विज़न ट्रांसफॉर्मर" (इसे एक अत्यधिक प्रशिक्षित आँख के रूप में सोचें) का उपयोग किया जाता है। यह विशिष्ट चीजों (जैसे बंदूक या चाकू) का पता लगाने के लिए एक "ऑब्जेक्ट डिटेक्टर" का भी उपयोग करता है।
  • परिणाम: यदि यह कुछ स्पष्ट रूप से सुरक्षित देखता है, तो यह इमेज को तुरंत आगे जाने देता है। यदि यह कुछ संदिग्ध देखता है, तो यह केवल "बुरा!" नहीं कहता—बल्कि यह एक खरीद सूची (shopping list) बनाता है कि इसने क्या देखा (जैसे, "मुझे एक व्यक्ति, एक समुद्र तट और एक संदिग्ध वस्तु दिख रही है")।
  • जादू: यह भारी, रॉ इमेज फाइल के बजाय इस शब्दों की सूची को अगले चरण को भेजता है। यह बहुत सारा समय बचाता है।

🧠 चरण 2: "कॉन्टेक्स्ट डिटेक्टिव" (द टेक्स्ट एंड लॉजिक एक्सपर्ट)

  • यह क्या करता है: यह चरण केवल तभी जागता है जब स्टेज 1 कहता है, "हे, यह अजीब लग रहा है," या यदि सिस्टम इमेज में टेक्स्ट का पता लगाता है।
  • यह कैसे काम करता है:
    1. OCR (ऑप्टिकल कैरेक्टर रीडर): कल्पना कीजिए कि एक रोबोट फोटो पर लिखे हर शब्द को तुरंत पढ़ लेता है, भले ही वह किसी मीम या स्क्रीनशॉट पर लिखा गया हो।
    2. दिमाग (The Brain): यह स्टेज 1 से मिली "खरीद सूची" और इसके द्वारा पढ़े गए शब्दों को लेता है, और उन्हें एक स्मार्ट लैंग्वेज मॉडल (एक 7B LLM) में फीड करता है।
  • तर्क (Logic): पूरी तस्वीर का पुन: विश्लेषण करने के बजाय, दिमाग केवल नोट्स पढ़ता है: "ठीक है, इमेज एक समुद्र तट (सुरक्षित) दिखाती है, लेकिन टेक्स्ट कहता है 'आधी रात को मिलो' (खतरनाक)।" इसके बाद यह अंतिम निर्णय लेता है।
  • परिणाम: पूरी प्रक्रिया में लगभग 120 मिलीसेकंड लगते हैं। यह अभी भी अविश्वसनीय रूप से तेज़ है, लेकिन अब इसमें "डिटेक्टिव" की शक्ति है जिससे यह टेक्स्ट में छिपे खतरों को पकड़ सकता है।

यह बड़ी बात क्यों है? (परिणाम)

शोधकर्ताओं ने UnsafeBench (ट्रिकी इमेज का एक संग्रह) नामक डेटासेट का उपयोग करके अन्य शीर्ष सुरक्षा प्रणालियों के विरुद्ध KidsNanny का परीक्षण किया।

  1. गति: KidsNanny "धीमे दिग्गजों" (जैसे ShieldGemma-2 और LlavaGuard) की तुलना में 9 से 34 गुना तेज़ है। यह इंटरनेट को धीमा किए बिना रियल-टाइम में खराब कंटेंट को रोकने के लिए पर्याप्त तेज़ है।
  2. सटीकता: इसने तेज़-मात्र गार्डों की तुलना में अधिक खराब कंटेंट पकड़ा।
  3. "टेक्स्ट ट्रैप" टेस्ट: यह सबसे महत्वपूर्ण हिस्सा है। उन्होंने उन इमेज का परीक्षण किया जहाँ एकमात्र खतरा उन पर लिखा टेक्स्ट था (जैसे, एक प्यारा पिल्ला जिसकी फोटो के ऊपर ग्रूमिंग मैसेज लिखा गया है)।
    • "धीमे दिग्गजों" ने इनमें से कई को मिस कर दिया या वे भ्रमित हो गए।
    • KidsNanny ने उनमें से 100% को पकड़ा। क्योंकि इसमें एक समर्पित "टेक्स्ट रीडर" (OCR) है, इसने शब्दों में छिपे खतरे को मिस नहीं किया।

ट्रेड-ऑफ (The Trade-Off)

पेपर स्वीकार करता है कि KidsNanny परफेक्ट नहीं है।

  • यह एक "फर्स्ट-पार्टी" रिपोर्ट है: जिस टीम ने इस सिस्टम को बनाया है, उन्होंने ही इसका परीक्षण किया है। यह एक शेफ द्वारा अपने खुद के सूप को चखने जैसा है; यह स्वादिष्ट हो सकता है, लेकिन हमें पुष्टि करने के लिए एक बाहरी फूड क्रिटिक की आवश्यकता है।
  • छोटा सैंपल साइज: "टेक्स्ट-ओनली" खतरों के लिए परीक्षण में केवल 44 इमेज थीं। यह एक सेब खाकर पूरे नए डाइट का निर्णय लेने जैसा है। 100% सुनिश्चित होने के लिए उन्हें और अधिक डेटा की आवश्यकता है।

निचोड़ (The Bottom Line)

KidsNanny एक फास्ट स्कैनर की तरह है जो स्पष्ट कचरे को फ़िल्टर करता है, और फिर पेचीदा चीजों को एक स्मार्ट डिटेक्टिव के पास भेजता है जो बारीक अक्षरों को पढ़ता है। काम को अलग करके, वे यह प्रबंध करने में सफल रहे कि वे रियल-टाइम उपयोग के लिए पर्याप्त तेज़ और टेक्स्ट-आधारित खतरों को पकड़ने के लिए पर्याप्त स्मार्ट दोनों हों, जो ऑनलाइन बच्चों को सुरक्षित रखने के लिए एक बड़ी जीत है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →