← नवीनतम पेपर
💬 NLP

Trust The Typical

यह शोध पत्र 'ट्रस्ट द टिपिकल' (T3) को पेश करता है, जो एक नवीन एलएलएम (LLM) सुरक्षा ढांचा है जो सुरक्षा को आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्शन समस्या के रूप में मानता है, जो हानिकारक प्रशिक्षण डेटा की आवश्यकता के बिना सुरक्षित प्रॉम्प्ट्स के वितरण को सीखकर, विविध खतरों और भाषाओं में कम इन्फरेंस ओवरहेड बनाए रखते हुए अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Debargha Ganguly, Sreehari Sankar, Biyao Zhang, Vikash Singh, Kanan Gupta, Harshini Kavuru, Alan Luo, Weicong Chen, Warren Morningstar, Raghu Machiraju, Vipin Chaudhary

प्रकाशित 2026-02-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Debargha Ganguly, Sreehari Sankar, Biyao Zhang, Vikash Singh, Kanan Gupta, Harshini Kavuru, Alan Luo, Weicong Chen, Warren Morningstar, Raghu Machiraju, Vipin Chaudhary

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Trust The Typical" (T3) पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

मुख्य विचार: परछाइयों का पीछा करना छोड़ें, रोशनी को पहचानना शुरू करें

कल्पना कीजिए कि आप एक पार्टी को सुरक्षित रखने की कोशिश कर रहे हैं। इसे करने का पुराना तरीका यह है कि एक ऐसा बाउंसर (द्वारपाल) नियुक्त किया जाए जिसके पास "बुरे लोगों" की एक विशाल और बढ़ती हुई सूची हो (जैसे विशिष्ट टैटू वाले लोग, विशिष्ट टोपी पहनने वाले, या विशिष्ट वाक्यांश बोलने वाले)। हर बार जब कोई नया बुरा आदमी ऐसी टोपी पहनकर आता है जिसे बाउंसर ने पहले नहीं देखा है, तो वे अंदर घुस जाते हैं। बाउंसर को अपनी सूची को लगातार अपडेट करना पड़ता है, लेकिन बुरे लोग हमेशा एक कदम आगे रहते हैं और नए भेष बनाना जानते हैं।

इस पेपर के लेखक तर्क देते हैं कि यह "चूहे-बिल्ली का खेल" अब टूट चुका है। यह याद करने के बजाय कि कोई व्यक्ति बुरा होने के कितने तरीके अपना सकता है, वे एक स्मार्ट दृष्टिकोण का सुझाव देते हैं: यह सीखें कि "सामान्य" क्या दिखता है ताकि कुछ भी अजीब होने पर वह तुरंत अलग दिखाई दे सके।

वे अपने इस नए सिस्टम को T3 (Trust The Typical) कहते हैं।

T3 कैसे काम करता है: "भीड़" का उदाहरण

एक विशाल, अदृश्य कमरे की कल्पना करें जो लाखों लोगों से भरा हुआ है।

  • सुरक्षित लोग: जब सामान्य, मददगार लोग AI से बात करते हैं, तो उनके शब्द कमरे के एक विशिष्ट, आरामदायक कोने में एक साथ आते हैं। वे सभी एक-दूसरे के करीब खड़े होते हैं, जिससे एक घनी, अनुमानित भीड़ बनती है। गणितीय शब्दों में, इसे "Typical Set" (विशिष्ट समूह) कहा जाता है।
  • बुरे तत्व: जब कोई व्यक्ति AI को धोखा देने की कोशिश करता है (एक "जेलब्रेक" या विषाक्त प्रॉम्प्ट), तो उन्हें नियमों को दरकिनार करने के लिए कुछ असामान्य कहना पड़ता है। क्योंकि वे चालाकी करने की कोशिश कर रहे होते हैं, वे भीड़ से दूर, खाली और अजीब कोनों में खड़े हो जाते हैं।

T3 इस बात की परवाह नहीं करता कि बुरा व्यक्ति क्या कह रहा है। यह बस इस बात को देखता है कि वह कहाँ खड़ा है। यदि आप सुरक्षित भीड़ के बीच में खड़े हैं, तो आप ठीक हैं। यदि आप अंधेरे कोने में अकेले खड़े हैं, तो T3 आपको एक संभावित खतरे के रूप में चिह्नित करता है।

यह एक बड़ी बात क्यों है

पेपर का दावा है कि T3 अन्य सुरक्षा उपकरणों की तीन प्रमुख समस्याओं को हल करता है:

1. इसे "वांटेड पोस्टर" सूची की आवश्यकता नहीं है

  • पुराना तरीका: आपको कभी भी बनाए गए हर बुरे वाक्यांश की सूची की आवश्यकता होती है। यदि कोई बुरा आदमी एक नया वाक्यांश बनाता है, तो आप उसे चूक जाते हैं।
  • T3 का तरीका: आपको केवल अच्छे वाक्यांशों की सूची की आवश्यकता है। T3 सीखता है कि "अच्छा" क्या दिखता है। यदि कुछ भी "अच्छे" पैटर्न में फिट नहीं बैठता, तो उसे ब्लॉक कर दिया जाता है। इसका मतलब है कि यह बिना दोबारा ट्रेनिंग के, पहले कभी न देखे गए हमलों को भी पकड़ सकता है।

2. यह अच्छे लोगों पर आरोप लगाने से रोकता है (फॉल्स पॉजिटिव्स)

  • समस्या: पुराने सुरक्षा उपकरण इतने डरे हुए होते हैं कि वे निर्दोष लोगों को भी ब्लॉक कर देते हैं। उदाहरण के लिए, यदि आप एक चिकित्सा प्रश्न पूछते हैं जो थोड़ा जटिल लगता है, तो एक पुराना टूल सोच सकता है, "यह एक खतरनाक अनुरोध लग रहा है!" और उत्तर देने से मना कर सकता है। इसे "ओवर-रिफ्यूज़ल" (अत्यधिक इनकार) कहा जाता है।
  • T3 का परिणाम: पेपर कहता है कि T3 बहुत अधिक सटीक है। इसने अन्य उपकरणों की तुलना में गलत अलार्म को 40 गुना तक कम कर दिया है। यह एक जटिल लेकिन सुरक्षित प्रश्न और वास्तव में खतरनाक प्रश्न के बीच अंतर जानता है क्योंकि यह सुरक्षित भाषा के "आकार" को समझता है।

3. यह हर जगह काम करता है (अनुवाद की आवश्यकता नहीं)

  • समस्या: आमतौर पर, यदि आप चाहते हैं कि कोई AI स्पेनिश, फ्रेंच या जापानी में सुरक्षित रहे, तो आपको प्रत्येक भाषा के लिए एक पूरा नया सुरक्षा सिस्टम प्रशिक्षित करना होगा।
  • T3 का परिणाम: लेखकों ने T3 को केवल अंग्रेजी के सुरक्षित टेक्स्ट पर प्रशिक्षित किया। आश्चर्यजनक रूप से, यह बिना किसी अतिरिक्त प्रशिक्षण के 14 से अधिक भाषाओं (जापानी और अरबी सहित) पर पूरी तरह से काम करता है। ऐसा लगता है कि "बुरी" भाषा चाहे किसी भी भाषा में बोली जाए, वह एक ही तरह से अजीब दिखती है।

"स्पीड टेस्ट": यह चीजों को धीमा नहीं करता है

सुरक्षा उपकरणों के साथ सबसे बड़ा डर यह होता है कि वे AI को धीमा कर देते हैं। कल्पना कीजिए कि एक कार है जिसमें एक गार्ड है जिसे कार चलाने से पहले हर यात्री की जांच करनी पड़ती है।

लेखकों ने T3 को सीधे उस इंजन में एकीकृत किया है जो कई AI सिस्टम को शक्ति देता है (जिसे vLLM कहा जाता है)। उन्होंने पाया कि T3 AI के शब्दों को लिखते समय ही उनकी सुरक्षा की जांच कर सकता है।

  • परिणाम: यह प्रक्रिया में 6% से भी कम अतिरिक्त समय जोड़ता है।
  • उदाहरण: यह एक ऐसे सुरक्षा गार्ड की तरह है जो ड्राइवर के साथ चलता है, सड़क की वास्तविक समय में जांच करता है, बिना कार को रोके या उसे महत्वपूर्ण रूप से धीमा किए।

जो पेपर नहीं कहता (महत्वपूर्ण सीमाएँ)

पेपर इस बारे में ईमानदार है कि T3 कहाँ संघर्ष कर सकता है:

  • "ग्रे एरिया" (धुंधला क्षेत्र) की समस्या: यदि "सुरक्षित" प्रशिक्षण डेटा में खुद कुछ बुरे शब्द शामिल हैं (जैसे बहस के डेटासेट जहाँ लोग अपशब्दों का उपयोग करते हैं लेकिन संदर्भ में अभी भी "सुरक्षित" हैं), तो T3 भ्रमित हो सकता है। यह पूरी तरह से इस पर निर्भर करता है कि प्रशिक्षण डेटा वास्तव में "सुरक्षित" हो। यदि प्रशिक्षण डेटा अव्यवस्थित है, तो सिस्टम भी अव्यवस्थित हो जाएगा।
  • यह जादू नहीं है: यह तब सबसे अच्छा काम करता है जब "सुरक्षित" और "असुरक्षित" के बीच एक स्पष्ट रेखा हो। यदि अंतर बहुत सूक्ष्म है (जैसे एक शब्द वाक्य को सहायक से हानिकारक बना देता है), तो इसे पहचानना कठिन हो सकता है, हालांकि इसने कठिन "जेलब्रेक" परीक्षणों में बहुत अच्छा प्रदर्शन किया।

सारांश

Trust The Typical AI को सुरक्षित रखने का एक नया तरीका है। यह याद करने के बजाय कि एक AI क्या बुरा कह सकता है, यह गहराई से सीखता है कि "अच्छा" क्या दिखता है ताकि कुछ भी "अजीब" या "चालाकी भरा" होने पर तुरंत पकड़ा जा सके। यह तेज़ है, हमलों के नए प्रकारों को पकड़ता है, निर्दोष उपयोगकर्ताओं के साथ कम गलतियाँ करता है, और बिना किसी अतिरिक्त प्रशिक्षण के कई भाषाओं में काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →