← नवीनतम पेपर
💬 NLP

DeEscalWild: A Real-World Benchmark for Automated De-Escalation Training with SLMs

यह शोध पत्र DeEscalWild को प्रस्तुत करता है, जो ओपन-सोर्स वीडियो से क्यूरेट किए गए पुलिस-नागरिक संपर्क के 1,500 उच्च-सटीक परिदृश्यों का एक नवीन बेंचमार्क डेटासेट है, जो छोटे भाषा मॉडलों (SLMs) को बड़े सामान्य-उद्देश्य वाले मॉडलों की तुलना में बेहतर डी-एस्केलेशन प्रदर्शन प्राप्त करने में सक्षम बनाता है, जबकि वे वास्तविक दुनिया के कानून प्रवर्तन प्रशिक्षण के लिए पोर्टेबल, एज हार्डवेयर पर कुशलतापूर्वक कार्य करते हैं।

मूल लेखक: Md Hasebul Hasan, Krity Haque Charu, Eshwara Prasad Sridhar, Shuchisnigdha Deb, Mohammad A. Islam

प्रकाशित 2026-04-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Md Hasebul Hasan, Krity Haque Charu, Eshwara Prasad Sridhar, Shuchisnigdha Deb, Mohammad A. Islam

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए पुलिस अधिकारी को प्रशिक्षण दे रहे हैं। पारंपरिक रूप से, आप उन्हें एक मानव साथी के साथ अभ्यास करने के लिए कहेंगे जो एक क्रोधित नागरिक की भूमिका निभा रहा हो। लेकिन इंसान थक जाते हैं, वे एक ही समय में हज़ार अलग-अलग जगहों पर नहीं हो सकते, और कभी-कभी वे अपना "स्क्रिप्ट" भूल जाते हैं।

अब, कल्पना कीजिए कि आप एक सुपर-स्मार्ट, अथक वर्चुअल एक्टर बना सकते हैं जो एक हल्के वजन वाले वीआर (VR) हेडसेट के अंदर रहता है। यह अभिनेता वास्तविक समय में बहस कर सकता है, रो सकता है, घबरा सकता है या शांत हो सकता है, और बिल्कुल वैसे ही प्रतिक्रिया दे सकता है जैसे एक वास्तविक व्यक्ति उच्च-तनाव वाली स्थिति में देगा। यह "डी-एस्केलेशन ट्रेनिंग" (तनाव कम करने का प्रशिक्षण) का सपना है।

समस्या क्या है? इस अभिनेता को यथार्थवादी बनाने के लिए आवश्यक "मस्तिष्क" (जिसे लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) विशाल, ऊर्जा-खपत करने वाले सुपरकंप्यूटर की तरह हैं। उन्हें चलाने के लिए विशाल डेटा केंद्रों की आवश्यकता होती है। आप एक डेटा सेंटर को पुलिस अधिकारी की बेल्ट से नहीं बांध सकते या उसे वीआर हेडसेट के अंदर नहीं फिट कर सकते।

यहाँ, इस शोध पत्र के लेखक आए हैं, जिन्होंने DeEscalWild बनाया है। यह कहानी है कि उन्होंने क्या किया, जिसे सरल शब्दों में समझाया गया है:

1. गायब सामग्री: "वास्तविक" डेटा

एक कंप्यूटर को यह सिखाने के लिए कि वह इंसान की तरह बहस कैसे करे या कैसे शांत हो, आपको उसे हजारों वास्तविक बहसों को दिखाना होगा। लेकिन अधिकांश एआई (AI) प्रशिक्षण डेटा "किताबी अंग्रेजी" जैसा होता है—बहुत विनम्र, बहुत सटीक और नकली।

शोधकर्ताओं ने "जंगली दुनिया" (इंटरनेट) में जाकर यूट्यूब, टिकटॉक और फेसबुक से वास्तविक पुलिस संवादों के 5,000 अनएडिटेड वीडियो एकत्र किए। वे केवल शब्द नहीं चाहते थे; वे उस अराजकता को चाहते थे: चिल्लाना, हकलाना, स्लैंग (बोलचाल की भाषा), डर और गुस्सा।

  • उपमा: कल्पना कीजिए कि आप एक छात्र को गाड़ी चलाना सिखा रहे हैं। आप उन्हें यातायात नियमों पर एक पाठ्यपुस्तक (सिंथेटिक डेटा) दे सकते हैं, या आप उन्हें तूफान के दौरान भीड़भाड़ वाले समय में कार की पिछली सीट पर बैठा सकते हैं (वास्तविक "वाइल्ड" डेटा)। DeEscalWild वही तूफानी भीड़भाड़ वाला समय है।

2. फ़िल्टर: अराजकता को पाठ्यक्रम में बदलना

आप कंप्यूटर को केवल कच्चा इंटरनेट वीडियो नहीं खिला सकते; यह बहुत अव्यवस्थित है। टीम ने एक परिष्कृत "फिल्टरिंग मशीन" बनाई।

  • उन्होंने ट्रांसक्रिप्ट पढ़ने के लिए एआई का उपयोग किया।
  • उन्होंने मानवीय विशेषज्ञों से इसकी दोबारा जांच करवाई।
  • उन्होंने उबाऊ चीजों को (जैसे ट्रैफिक स्टॉप जहाँ सब कुछ बहुत विनम्र था) बाहर निकाल दिया और सबसे 1,500 सबसे तीव्र, नाटकीय परिदृश्यों को रखा।

परिणामस्वरूप 285,000 संवादों की एक विशाल लाइब्रेरी तैयार हुई। यह हर उस संभावित तरीके की लाइब्रेरी है जिससे एक बातचीत बिगड़ सकती है, और हर उस तरीके की जिससे उसे सुधारा जा सकता है।

3. बड़ी खोज: छोटा ही नया बड़ा है

आमतौर पर, एआई की दुनिया में, लोग सोचते हैं: "जितना बड़ा दिमाग होगा, उतना ही स्मार्ट होगा।" वे सबसे बड़े, सबसे महंगे मॉडल (जैसे जो विशाल सर्वरों पर चलते हैं) का उपयोग करने की कोशिश करते हैं।

लेकिन शोधकर्ताओं ने पूछा: "क्या होगा अगर हम बस एक छोटे दिमाग को बहुत अच्छी तरह से सिखा दें?"

उन्होंने एक बहुत ही छोटे, कुशल एआई मॉडल (जिसे SLM या स्मॉल लैंग्वेज मॉडल कहा जाता है) को लिया और उसे केवल इस विशिष्ट, उच्च-गुणवत्ता वाले पुलिस डेटा से प्रशिक्षित किया।

  • उपमा: एक सामान्य डॉक्टर के बारे में सोचें जो सब कुछ थोड़ा-थोड़ा जानता है लेकिन हार्ट सर्जरी में बहुत अच्छा नहीं है। अब, एक विशेषज्ञ की कल्पना करें जो केवल हार्ट सर्जरी करता है लेकिन उसने 1,000 वास्तविक मामलों पर अभ्यास किया है। वह विशेषज्ञ (छोटा, फाइन-ट्यून किया गया मॉडल) उस जनरल मॉडल (विशाल, जेनेरिक मॉडल) से बेहतर प्रदर्शन करेगा जो हर विषय का थोड़ा-थोड़ा ज्ञान रखता है।

4. परिणाम: छोटा मॉडल दिग्गज को हरा गया

उन्होंने अपने छोटे, विशिष्ट एआई का परीक्षण एक विशाल, प्रसिद्ध एआई (Gemini 2.5 Flash) के साथ किया।

  • विशाल एआई: यह विनम्र, सुरक्षित और एक रोबोट की तरह था जो मैनुअल पढ़ रहा हो। जब "अधिकारी" चिल्लाया, तो एआई ने कहा, "मैं आपकी चिंता समझता हूँ, ऑफिसर।" (बहुत नकली!)
  • छोटा, प्रशिक्षित एआई: यह संकट के समय एक वास्तविक व्यक्ति की तरह लगा। इसने पलटकर चिल्लाया, स्लैंग का उपयोग किया, रक्षात्मक हुआ और फिर धीरे-धीरे शांत हुआ। यह विशाल मॉडल की तुलना में अधिक यथार्थवादी था।

इससे भी बेहतर, छोटा मॉडल 10 गुना तेज़ था और इसे बिना इंटरनेट कनेक्शन के एक साधारण लैपटॉप या वीआर हेडसेट पर चलाया जा सकता था।

यह क्यों मायने रखता है

यह पेपर साबित करता है कि जीवन बचाने के लिए आपको सुपरकंप्यूटर की आवश्यकता नहीं है। सही डेटा को क्यूरेट करके और एक छोटे मॉडल को विशेष रूप से उस काम के लिए सिखाकर, हम बना सकते हैं:

  • पोर्टेबल प्रशिक्षण: पुलिस अधिकारी कहीं भी प्रशिक्षण ले सकते हैं, यहाँ तक कि फील्ड में भी, बिना वाई-फाई की आवश्यकता के।
  • गोपनीयता: डेटा डिवाइस पर ही रहता है; इसे क्लाउड पर नहीं भेजा जाता है।
  • बेहतर परिणाम: यदि अधिकारी एक सुरक्षित सिमुलेशन में वास्तविक, जटिल और भावनात्मक स्थितियों को संभालने का अभ्यास कर सकते हैं, तो वे वास्तविक स्थिति आने पर बेहतर निर्णय ले सकते हैं, जिससे सभी सुरक्षित रह सकते हैं।

संक्षेप में: शोधकर्ताओं ने एआई के लिए एक "वास्तविक दुनिया का जिम" बनाया, एक छोटे, फुर्तीले एथलीट को विश्व स्तरीय डी-एस्केलेशन विशेषज्ञ बनने के लिए प्रशिक्षित किया, और साबित किया कि यह हल्का चैंपियन भारी भरकम दिग्गजों को उनके अपने खेल में हरा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →