← नवीनतम पेपर
💬 NLP

Predict, Don't React: Value-Based Safety Forecasting for LLM Streaming

यह शोध पत्र StreamGuard को प्रस्तुत करता है, जो एक एकीकृत, मॉडल-अज्ञेय (model-agnostic) स्ट्रीमिंग गार्डरेल है जो भविष्य की हानिकारकता के पूर्वानुमान को मोंटे कार्लो रोलआउट्स (Monte Carlo rollouts) के माध्यम से एक फोरकास्टिंग समस्या के रूप में फ्रेम करके सुरक्षा मॉडरेशन में सुधार करता है, जिससे सटीक टोकन-स्तरीय एनोटेशन की आवश्यकता के बिना मौजूदा बाउंड्री-डिटेक्शन विधियों की तुलना में उच्च सटीकता और कम मिस रेट प्राप्त होता है।

मूल लेखक: Pride Kavumba, Koki Wataoka, Huy H. Nguyen, Jiaxuan Li, Masaya Ohagi

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pride Kavumba, Koki Wataoka, Huy H. Nguyen, Jiaxuan Li, Masaya Ohagi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइव रेडियो शो होस्ट कर रहे हैं। आपके पास एक अतिथि वक्ता (AI) है जो दर्शकों से वास्तविक समय में बात कर रहा है। आपका काम एक कंटेंट मॉडरेटर (सामग्री मॉडसेटर) का है।

पुराना तरीका: "स्टॉप साइन" दृष्टिकोण

पारंपरिक रूप से, मॉडरेटर्स एक ट्रैफिक पुलिसकर्मी की तरह काम करते थे जो एक लंबी सड़क के बिल्कुल अंत में खड़ा होता था। वे वक्ता को स्वतंत्र रूप से बोलने देते थे, और केवल तभी मॉडरेटर यह जाँचता था कि क्या वह सुरक्षित था जब वक्ता ने पूरा वाक्य या पैराग्राफ समाप्त कर लिया हो।

  • समस्या: यदि वक्ता कुछ भयानक कहना शुरू कर देता, तो मॉडरेटर उन्हें तब तक नहीं रोक पाता जब तक कि नुकसान हो ही न चुका होता। जब तक "रुकिए" (Stop) का संकेत उठाया जाता, तब तक जहरीले शब्द पहले ही दर्शकों तक पहुँच चुके होते।
  • "बाउंड्री" सुधार: कुछ नए सिस्टम अधिक तेज़ होने की कोशिश करते थे। वे एक ऐसे गार्ड की तरह काम करते थे जो वक्ता पर नज़र रखता है और ठीक उसी क्षण को पकड़ने की कोशिश करता है जब कोई बुरा शब्द आता है। जैसे ही बुरा शब्द आता है, वे माइक काट देते हैं। लेकिन यह पेचीदा है। यह एक चोर को ठीक उसी सेकंड पकड़ने जैसा है जब वह ताला खोलने की कोशिश करता है। यदि गार्ड एक सेकंड के भी छोटे हिस्से के लिए भी लेट हो जाता है, तो चोर बच निकलता है। साथ ही, इस तरीके के लिए बहुत विशिष्ट, महंगे प्रशिक्षण की आवश्यकता होती है ताकि यह पता लगाया जा सके कि बुरे शब्द कहाँ से शुरू होते हैं।

नया तरीका: स्ट्रीमगार्ड (StreamGuard) - "क्रिस्टल बॉल" दृष्टिकोण

यह पेपर StreamGuard को पेश करता है, जो एक नए प्रकार का मॉडरेटर के रूप में कार्य करता है जो केवल इस पर प्रतिक्रिया नहीं देता कि अभी क्या कहा जा रहा है। इसके बजाय, यह एक भविष्यवक्ता या मौसम पूर्वानुमानकर्ता की तरह कार्य करता है।

मुख्य विचार: "अनुमान लगाओ, प्रतिक्रिया मत दो"
यह प्रतीक्षा करने के बजाय कि वक्ता कुछ बुरा कहेगा, StreamGuard शुरुआती कुछ शब्दों को देखता है और पूछता है: "इस वाक्य की शुरुआत को देखते हुए, इसकी दिशा कहाँ होने की संभावना है?"

  • उपमा: कल्पना कीजिए कि वक्ता कहता है, "बम बनाने के लिए, सबसे पहले आपको..."
    • पुराना गार्ड: शायद सोचेगा, "हम्म, 'बम बनाने के लिए' बुरा है, लेकिन 'सबसे पहले आपको' सिर्फ व्याकरण है। मैं अगले शब्द का इंतज़ार करूँगा।"
    • StreamGuard: उस वाक्यांश को देखता है और सोचता है, "ओह नहीं। इसकी 99% संभावना है कि अगले शब्द विस्फोटकों को बनाने के निर्देश होंगे। मुझे माइक अभी काट देना चाहिए, इससे पहले कि खतरनाक हिस्सा बोला ही जाए।"

यह अनुमान लगाना कैसे सीखता है?

आप पूछ सकते हैं, "AI को कैसे पता चलता है कि वक्ता आगे क्या कहने वाला है?"

शोधकर्ताओं ने StreamGuard को मोंटे कार्लो रोलआउट्स (Monte Carlo Rollouts) का उपयोग करके प्रशिक्षित किया है। इसे एक सिमुलेशन गेम की तरह समझें:

  1. हर बार जब वक्ता एक वाक्य शुरू करता है, StreamGuard रुक जाता है और अपने दिमाग में एक हजार छोटे सिमुलेशन चलाता है।
  2. प्रत्येक सिमुलेशन में, वह कल्पना करता है कि वाक्य विभिन्न तरीकों से कैसे समाप्त हो सकता है।
  3. वह एक "जज" (एक सुरक्षा विशेषज्ञ AI) से पूछता है कि उन काल्पनिक अंतों में से प्रत्येक कितना खतरनाक होगा।
  4. वह परिणामों का औसत निकालता है। यदि अधिकांश काल्पनिक अंत खतरनाक हैं, तो StreamGuard तुरंत अलार्म बजा देता है, भले ही वर्तमान शब्द हानिरहित दिख रहे हों।

यह एक बड़ी बात क्यों है?

1. यह तेज़ और सुरक्षित है
क्योंकि यह भविष्य की भविष्यवाणी करता है, यह खराब कंटेंट होने से पहले ही उसे रोक सकता है। परीक्षणों में, इसने पिछले "बाउंड्री" सिस्टम की तुलना में अधिक खतरनाक प्रतिक्रियाओं को पकड़ा और उन्हें पहले ही रोक दिया। इसने "छूटे हुए" बुरे जवाबों की संख्या को काफी कम कर दिया।

2. यह पोर्टेबल है ("यूनिवर्सल ट्रांसलेटर")
पुराने सुरक्षा सिस्टम कस्टम-मेड चाबियों की तरह थे; वे केवल विशिष्ट तालों (विशिष्ट AI मॉडल और उनकी आंतरिक भाषाओं) के साथ काम करते थे।
StreamGuard एक यूनिवर्सल रिमोट की तरह है। क्योंकि यह भविष्य के टेक्स्ट के अर्थ की भविष्यवाणी करता है न कि विशिष्ट कोड प्रतीकों को गिनता है, यह पूरी तरह से काम करता है भले ही आप एक AI मॉडल (जैसे Llama) से बदलकर पूरी तरह से अलग मॉडल (जैसे Gemma या Qwen) पर स्विच कर दें। आपको हर नए AI के लिए इसे फिर से प्रशिक्षित करने की आवश्यकता नहीं है।

3. यह प्रवाह को नहीं तोड़ता
एक लाइव स्ट्रीम में, आप यह जाँचने के लिए शो को 5 सेकंड के लिए नहीं रोकना चाहते कि क्या एक वाक्य सुरक्षित है। StreamGuard इतना तेज़ है कि यह पलक झपकते ही (मिलीसेकंड में) निर्णय ले सकता है, जिससे बातचीत स्वाभाविक रूप से चलती रहती है और साथ ही दर्शकों को सुरक्षित भी रखती है।

निष्कर्ष

StreamGuard खेल को "देखो और फिर देखो" से बदलकर "आगे देखो" में बदल देता है।

आग लगने का इंतज़ार करने और फिर उसे बुझाने की कोशिश करने के बजाय, StreamGuard चिंगारियों को देखता है और भविष्यवाणी करता है कि आग आने वाली है, ताकि वह लपटों के प्रकट होने से पहले ही पानी छिड़क सके। यह AI बातचीत को सुरक्षित, तेज़ और सभी प्रकार के विभिन्न AI मॉडल के अनुकूल बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →