← नवीनतम पेपर
💬 NLP

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

BARRED एक ऐसा फ्रेमवर्क है जो डोमेन डायमेंशन डिकंपोजिशन और मल्टी-एजेंट डिबेट के माध्यम से हाई-फिडेलिटी सिंथेटिक ट्रेनिंग डेटा जेनरेट करता है, जिससे छोटे लैंग्वेज मॉडल्स को व्यापक मानवीय एनोटेशन के बिना कस्टम पॉलिसियों को लागू करने में स्टेट-ऑफ-द-आर्ट प्रोप्रायटरी LLMs और समर्पित गार्डरेल्स से बेहतर प्रदर्शन करने में सक्षम बनाया जा सके।

मूल लेखक: Arnon Mazza, Elad Levi

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arnon Mazza, Elad Levi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही व्यस्त, उच्च-जोखिम वाले ग्राहक सेवा केंद्र (customer service center) के प्रबंधक हैं। आपके एजेंटों के लिए एक विशिष्ट नियम पुस्तिका है: "कर्मचारी के GPS निर्देशांक कभी न प्रकट करें," या "चिकित्सा सलाह न दें," या "उपयोगकर्ताओं को एक ही संदेश तीन बार स्पैम न करने दें।"

समस्या यह है कि आपके वर्तमान "सुरक्षा गार्ड" (AI मॉडल) या तो बहुत सामान्य हैं (वे आपके विशिष्ट नियमों को नहीं समझते) या बहुत महंगे और धीमे हैं (वे हर संदेश की जांच करने में बहुत समय लेते हैं)। आपको एक कस्टम गार्ड की आवश्यकता है जो आपके विशिष्ट नियमों को पूरी तरह से जानता हो, लेकिन आपके पास उन्हें सिखाने के लिए पर्याप्त मानव समीक्षक नहीं हैं।

यहाँ आता है BARRED। BARRED को एक रोबोटिक प्रशिक्षण शिविर के रूप में सोचें जो केवल कुछ उदाहरणों और एक नियम विवरण का उपयोग करके, अपने स्वयं के छात्र और शिक्षक बनाकर एक आदर्श कस्टम गार्ड तैयार करता है।

यह कैसे काम करता है, इसके सरल चरणों में विवरण यहाँ दिया गया है:

1. ब्लूप्रिंट: समस्या को आयामों (Dimensions) में तोड़ना

कल्पना कीजिए कि आप किसी को सिखाने की कोशिश कर रहे हैं कि "घृणास्पद भाषण" (hate speech) क्या होता है। यदि आप केवल "घृणास्पद भाषण" कहते हैं, तो यह बहुत अस्पष्ट है।
BARRED पहले आपके नियम को लेता है और उसे आयामों (जैसे हीरे के विभिन्न कोणों) में तोड़ देता है।

  • उदाहरण: "संदेश दोहराने" के नियम के लिए, आयाम हो सकते हैं: कितनी बार? क्या शब्द बिल्कुल समान हैं? क्या यह थोड़ा सा अलग रूप है?
    यह सुनिश्चित करता है कि प्रशिक्षण डेटा उस हर संभव तरीके को कवर करे जिससे कोई उपयोगकर्ता नियम तोड़ने की कोशिश कर सकता है, न कि केवल स्पष्ट मामलों को।

2. फैक्ट्री: "चालाकी भरे" उदाहरण बनाना

एक बार जब आयाम सेट हो जाते हैं, तो BARRED एक फैक्ट्री लाइन शुरू करता है। यह केवल आसान उदाहरण (जैसे "नमस्ते, आप कैसे हैं?") नहीं बनाता। यह विशेष रूप से सीमावर्ती मामलों (boundary cases) की तलाश करता है—वे पेचीदा, ग्रे-एरिया वाले उदाहरण जहाँ एक बुद्धिमान मानव भी हिचकिचा सकता है।

  • उपमा: यदि आप एक गार्ड को नकली 20कानोटपहचाननेकेलिएसिखारहेहैं,तोआपउसेअसली20 का नोट पहचानने के लिए सिखा रहे हैं, तो आप उसे असली 20 और 5कानोटनहींदिखाते।आपउसेएकऐसा5 का नोट नहीं दिखाते। आप उसे एक ऐसा 20 दिखाते हैं जो लगभग असली दिखता है, लेकिन उसमें एक छोटा सा धब्बा है। ये वे "सीमावर्ती मामले" हैं जो गार्ड को तेज बनाते हैं।

3. कोर्टरूम: एक विषम बहस (The Asymmetric Debate)

यही असली जादू है। जब फैक्ट्री एक पेचीदा उदाहरण बनाती है, तो हमें यह कैसे पता चलेगा कि लेबल (जैसे, "यह एक उल्लंघन है") सही है? हम हर बार मानव से नहीं पूछ सकते।
इसलिए, BARRED एक कोर्टरूम बहस आयोजित करता है:

  • एडवोकेट (एक कठोर वकील): इस AI एजेंट को लेबल का बचाव करने के लिए नियुक्त किया गया है। यह तर्क देता है, "यह एक उल्लंघन है, और यहाँ इसका कारण दिया गया है!" यह अपना मन कभी नहीं बदलता।
  • जज (एक संदेही पैनल): अन्य AI एजेंटों का एक समूह एडवोकेट की दलीलों को सुनता है। वे संदेही होते हैं। वे तर्क में कमियां ढूंढते हैं।
  • फैसला: यदि जज बहस के कुछ दौर के बाद एडवोकेट से सहमत होते हैं, तो उदाहरण को "सत्य" के रूप में स्वीकार कर लिया जाता है। यदि वे असहमत होते हैं, तो उदाहरण को फैक्ट्री में वापस भेज दिया जाता है ताकि इसे परिष्कृत (refine) किया जा सके (यानी फिर से लिखा जाए) जब तक कि उसका तर्क पुख्ता न हो जाए।

यह प्रक्रिया सुनिश्चित करती है कि प्रशिक्षण डेटा केवल "भ्रमित" (hallucinated) बकवास नहीं है; इसे AI वकीलों की एक टीम द्वारा तनाव-परीक्षण (stress-tested) किया गया है।

4. परिणाम: एक छोटा, अत्यंत शक्तिशाली गार्ड

एक बार जब BARRED इन हजारों उच्च-गुणवत्ता वाले, बहस-सत्यापित उदाहरणों को उत्पन्न कर लेता है, तो यह एक छोटे, तेज़ AI मॉडल को प्रशिक्षित करने के लिए उनका उपयोग करता है।

  • जादू: पेपर का दावा है कि इस सिंथेटिक डेटा पर प्रशिक्षित यह छोटा मॉडल, आपके विशिष्ट नियमों का पालन करने में आपके भारी, महंगे AI मॉडलों (जैसे GPT-4 या विशेष सुरक्षा मॉडल) की तुलना में अधिक स्मार्ट हो जाता है, जिनके पास अरबों अधिक पैरामीटर हैं।
  • क्यों? क्योंकि छोटे मॉडल को विशेष रूप से उन सटीक, पेचीदा किनारों (edge-cases) के लिए प्रशिक्षित किया गया है जिन्हें उसे संभालना है, जबकि बड़े मॉडल एक साथ सब कुछ अच्छा करने की कोशिश करते हैं।

पेपर के दावों का सारांश

  • समस्या: कस्टम सुरक्षा नियमों को लागू करना कठिन है क्योंकि सामान्य मॉडल उन्हें मिस कर देते हैं, और बड़े मॉडल धीमे/महंगे होते हैं।
  • समाधान: BARRED केवल एक नियम विवरण और कुछ उदाहरणों का उपयोग करके एक कस्टम प्रशिक्षण डेटासेट बनाता है।
  • विधि: यह नियमों को आयामों में तोड़ता है, पेचीदा उदाहरण बनाता है, और डेटा को सत्यापित करने के लिए एक जिद्दी एडवोकेट और संदेही जजों के बीच "बहस" का उपयोग करता है।
  • परिणाम: इस डेटा पर प्रशिक्षित छोटे, तेज़ मॉडल, कस्टम कार्यों (जैसे गोपनीयता लीक, पुनरावृत्ति, या स्वास्थ्य अनुपालन की जांच) पर सटीकता में सबसे बड़े, सबसे महंगे मॉडलों को भी पीछे छोड़ देते हैं।

पेपर क्या दावा नहीं करता है:

  • यह दावा नहीं करता कि यह हर संभावित कार्य के लिए काम करता है (केवल वही जिन्हें उन्होंने टेस्ट किया: बातचीत नीतियां, एजेंट योजनाएं और स्वास्थ्य अनुपालन)।
  • यह दावा नहीं करता कि यह वास्तविक दुनिया में मानव निरीक्षण को पूरी तरह से बदल देगा, हालांकि यह विशाल मानव लेबलिंग टीमों की आवश्यकता को कम करता है।
  • यह वादा नहीं करता कि छोटे मॉडल भविष्य के सभी परिदृश्यों में पूर्ण होंगे, केवल यह कि वे अपने विशिष्ट प्रयोगों में बेसलाइन मॉडलों से बेहतर प्रदर्शन करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →