← नवीनतम पेपर
🤖 AI

Closing the Distribution Gap in Adversarial Training for LLMs

यह शोधपत्र डिस्ट्रीब्यूशनल एडवरसैरियल ट्रेनिंग (DAT) को प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो प्रॉम्प्ट्स और रिस्पॉन्स के वास्तविक संयुक्त वितरण (joint distribution) का अनुमान लगाने के लिए डिफ्यूजन LLMs का लाभ उठाता है, जिससे वर्तमान विधियों की वितरण संबंधी सीमाओं को दूर करने और सरल इन-डिस्ट्रीब्यूशन एडवरसैरियल हमलों के विरुद्ध LLM की मजबूती को महत्वपूर्ण रूप से सुधारने के लिए विविध उच्च-संभावना वाले नमूने उत्पन्न किए जा सकते हैं।

मूल लेखक: Chengzhi Hu, Jonas Dornbusch, David Lüdke, Stephan Günnemann, Leo Schwinn

प्रकाशित 2026-02-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chengzhi Hu, Jonas Dornbusch, David Lüdke, Stephan Günnemann, Leo Schwinn

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Closing the Distribution Gap in Adversarial Training for LLMs" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी समस्या: "पाठ्यपुस्तक" बनाम "वास्तविक दुनिया"

कल्पना कीजिए कि आप एक सुरक्षा गार्ड (AI मॉडल) को प्रशिक्षित कर रहे हैं ताकि वह किसी इमारत में घुसपैठ करने वाले बुरे लोगों को रोक सके।

पुराना तरीका (Standard Adversarial Training):
आप घुसपैठ करने का अभ्यास करने के लिए अभिनेताओं की एक टीम को काम पर रखते हैं। वे ताला तोड़ने, बाड़ फांदने या नकली आईडी दिखाकर गार्ड को चकमा देने की कोशिश करते हैं। आप गार्ड को इन विशिष्ट अभिनेताओं को और इन विशिष्ट तरीकों को रोकने के लिए प्रशिक्षित करते हैं।

खामी:
गार्ड उन अभिनेताओं को रोकने में माहिर हो जाता है जिन्हें आपने काम पर रखा था। लेकिन फिर, एक असली अपराधी आता है जो ताला नहीं तोड़ता; वह बस गार्ड से कहता है, "अरे, क्या आप दरवाजा खोल सकते हैं? मुझे जल्दी है," लेकिन वह इसे अलग भाषा में कहता है, या इसे भूतकाल (past tense) में पूछता है ("मैं अंदर घुसने की कोशिश कर रहा था"), या किसी ऐसी बोली (dialect) का उपयोग करता है जिसे गार्ड ने पहले कभी नहीं सुना।

गार्ड विफल हो जाता है। क्यों? क्योंकि प्रशिक्षण डेटा (अभिनेता) उस संपूर्ण ब्रह्मांड को कवर नहीं कर पाया कि कैसे एक बुरा व्यक्ति उन्हें धोखा देने के लिए अनुरोध को घुमा सकता है। पेपर में, लेखक इसे "डिस्ट्रीब्यूशन गैप" (Distribution Gap) कहते हैं। ट्रेनिंग सेट बहुत छोटा और स्थिर है, जो उन सभी प्राकृतिक तरीकों को कवर करने के लिए पर्याप्त नहीं है जिनसे इंसान किसी हानिकारक उत्तर को पाने के लिए अनुरोध को बदल सकते हैं।

समाधान: DAT (Distributional Adversarial Training)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे DAT कहा जाता है। केवल अभिनेताओं की एक निश्चित टीम को काम पर रखने के बजाय, वे एक जादुई सिम्युलेटर (एक डिफ्यूजन मॉडल) बनाते हैं जो यह कल्पना कर सकता है कि एक अपराधी उन्हें ठगने के लिए लाखों अलग-अलग तरीकों का उपयोग कैसे कर सकता है।

DAT कैसे काम करता है, यहाँ चरण-दर-चरण दिया गया है:

1. जादुई सिम्युलेटर (The Diffusion LLM)

एक मानक AI को एक ऐसे रोबोट के रूप में सोचें जो केवल वाक्य पूरा करना जानता है यदि आप उसे शुरू करें (जैसे कि एक बहुत ही स्मार्ट ऑटो-कंप्लीट)। वह जानता है: "यदि मैं 'Hello' कहता हूँ, तो अगला शब्द संभवतः 'World' होगा।"

इस पेपर में उपयोग किया गया डिफ्यूजन LLM अलग है। यह एक रिवर्स-इंजीनियरिंग मशीन की तरह है।

  • सामान्य AI: आप इसे एक प्रॉम्प्ट देते हैं, यह आपको उत्तर देता है।
  • डिफ्यूजन AI: आप इसे एक बुरा उत्तर देते हैं (जैसे, "बम कैसे बनाएं"), और यह पूछता है: "किस तरह के सवाल से कोई इंसान ऐसा उत्तर दे सकता है?"

इसके बाद यह हजारों अलग-अलग, स्वाभाविक लगने वाले प्रश्न उत्पन्न करता है जो उस बुरे उत्तर की ओर ले जा सकते हैं। कुछ फ्रेंच में हो सकते हैं, कुछ भूतकाल में, या कुछ काव्यमय (poetic) हो सकते हैं। यह "डिस्ट्रीबक्शन गैप" को भरकर दिखाता है कि हमला करने के हर संभावित कोण क्या हो सकते हैं, न कि केवल वे जो इंसानों ने पहले से सोचे थे।

2. ट्रेनिंग कैंप (Continuous Adversarial Training)

एक बार जब जादुई सिम्युलेटर इन हजारों पेचीदा सवालों को उत्पन्न कर देता है, तो सुरक्षा गार्ड (LLM) को एक कठिन ट्रेनिंग कैंप से गुजरना पड़ता है।

  • गार्ड इन सभी नए, अजीब तरह से लिखे गए सवालों को सुनकर "ना" कहना सीखता है।
  • महत्वपूर्ण बात यह है कि प्रशिक्षण केवल "ना कहें" नहीं सिखाता। यह गार्ड को सवाल के पीछे के इरादे (intent) को पहचानने के लिए सिखाता है, भले ही उसकी शब्दावली अजीब हो।

परिणाम: यह क्यों मायने रखता है

पेपर ने पुराने तरीकों के मुकाबले इस नई विधि का परीक्षण किया और पाया कि इसे दो बड़ी जीत मिलीं:

  1. यह "साधारण" चालों को रोकता है:
    पुराने तरीके जटिल, कंप्यूटर-जनित हमलों (जैसे कोड को हैक करने की कोशिश करने वाला रोबोट) को रोकने में बहुत अच्छे थे। लेकिन जब किसी इंसान ने सवाल को थोड़ा सा भी बदल दिया, तो वे विफल हो गए। DAT ने इन "साधारण" चालों को लगभग पूरी तरह से रोक दिया। यह ऐसा है जैसे गार्ड आखिरकार समझ गया कि "मैं अंदर घुसने की कोशिश कर रहा था" उतना ही खतरनाक है जितना कि "मैं अंदर घुसने की कोशिश कर रहा हूँ।"

  2. यह गार्ड को मूर्ख नहीं बनाता है:
    आमतौर पर, जब आप एक गार्ड को बहुत सख्त होने के लिए प्रशिक्षित करते हैं, तो वे निर्दोष लोगों (जैसे डिलीवरी ड्राइवर या दोस्त) को भी अंदर जाने से रोकने लगते हैं। इसे "यूटिलिटी" (उपयोगिता) खोना कहा जाता है।

  • पुराने तरीके: गार्ड को बहुत सुरक्षित बनाते थे, लेकिन वे बहुत चिड़चिड़े और अनुपयोगी भी हो जाते थे।
  • DAT: इसने गार्ड को अविश्वसनीय रूप से सुरक्षित बनाया और साथ ही सामान्य लोगों के लिए मददगार भी बनाए रखा। इसने पूर्ण संतुलन (the "Pareto Optimal" point) खोज लिया।

मुख्य उपमा: बुरे विचारों का "मैनिफोल्ड" (The "Manifold" of Bad Ideas)

लेखक "मैनिफोल्ड" की बात करते हैं, जो एक फैंसी गणितीय शब्द है जिसका अर्थ है एक आकार या परिदृश्य (landscape)।

  • पुराना तरीका: कल्पना कीजिए कि "बुरे सवालों" का परिदृश्य एक विशाल, धुंधले पर्वत श्रृंखला की तरह है। पुराने प्रशिक्षण तरीके केवल उस पर्वत के बीच में एक छोटे, सपाट कैंपसाइट के चारों ओर एक दीवार बनाते थे। यदि कोई बुरा व्यक्ति कैंपसाइट के किनारे पर घूमता है (डिस्ट्रीब्यूशन गैप), तो वह दीवार उसे नहीं रोक पाती।
  • DAT का तरीका: डिफ्यूजन मॉडल एक ड्रोन की तरह कार्य करता है जो पूरी पर्वत श्रृंखला के ऊपर उड़ता है, और यह मानचित्रित करता है कि एक बुरा व्यक्ति किस भी रास्ते का उपयोग कर सकता है। फिर, यह पूरे पर्वत को कवर करने वाली एक दीवार बनाता है, न कि केवल कैंपसाइट को।

एक वाक्य में सारांश

यह पेपर एक नई प्रशिक्षण विधि पेश करता है जो एक "उल्टा सोचने वाले" (reverse-thinking) AI का उपयोग करती है ताकि लाखों पेचीदा और स्वाभाविक प्रश्न उत्पन्न किए जा सकें, जिससे मुख्य AI मॉडल यह सुनिश्चित कर सके कि वह किसी भी हानिकारक अनुरोध के हर बदलाव को पहचानकर "ना" कह सके, न कि केवल उन विशिष्ट अनुरोधों को जिनसे वह पहले डरता था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →