Adaptive Instruction Composition for Automated LLM Red-Teaming
यह शोध पत्र अडैप्टिव इंस्ट्रक्शन कंपोज़िशन (Adaptive Instruction Composition) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो क्राउडसोर्स्ड हानिकारक प्रश्नों और युक्तियों को गतिशील रूप से संयोजित करने के लिए सुदृढीकरण लर्निंग-आधारित कॉन्टेक्स्टुअल बैंडिट (reinforcement learning-based contextual bandit) का उपयोग करता है, जिससे विविध और अत्यधिक प्रभावी एलएलएम (LLM) जेलब्रेक उत्पन्न होते हैं जो रैंडम और मौजूदा अडैप्टिव रेड-टीमिंग दृष्टिकोणों दोनों से बेहतर प्रदर्शन करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, बहुत विनम्र रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है, जिसे मददगार बनने के लिए प्रशिक्षित किया गया है, लेकिन साथ ही उसे कुछ भी खतरनाक या बुरा करने से मना करने के लिए भी प्रशिक्षित किया गया है। आपका काम एक "सुरक्षा परीक्षक" (रेड टीमर) बनना है ताकि आप यह देख सकें कि क्या आप इस रोबोट को अपने ही नियमों को तोड़ने के लिए छल (trick) सकते हैं।
आप जिस शोध पत्र (paper) के बारे में पूछ रहे हैं, वह इस परीक्षण को करने का एक नया, सुपर-स्मार्ट तरीका पेश करता है जिसे एडैप्टिव इंस्ट्रक्शन कंपोजिशन (AIC) कहा जाता है।
यहाँ इसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:
1. समस्या: "रैंडम शफल" बनाम "स्मार्ट डिटेक्टिव"
कल्पना कीजिए कि आप एक तिजोरी का एकदम सही ताला खोलने की कोशिश कर रहे हैं।
- पुराना तरीका (रैंडम कॉम्बिनेशन): आपके पास 50,000 अलग-अलग चाबियों और 13,000 अलग-अलग लॉक-पिकिंग टूल्स का एक विशाल बॉक्स है। पुराना तरीका (जिसे WildTeaming कहा जाता है) बस एक रैंडम चाबी और एक रैंडम टूल उठाता है, तिजोरी खोलने की कोशिश करता है, और यदि विफल रहता है, तो उन्हें फेंक देता है और दो नई रैंडम चीजें उठा लेता है। यह आँखों पर पट्टी बांधकर तीर चलाने जैसा है। यह काम कर सकता है, लेकिन यह धीमा है और कई पैटर्न मिस कर देता है।
- "ट्रायल एंड एरर" का तरीका: दूसरा तरीका खुद से सीखने की कोशिश करता है, जैसे कोई कुत्ता करतब सीख रहा हो। वह रोबोट को धोखा देने का तरीका खोजने के लिए अनुमान लगाने और जांचने की कोशिश करता है। लेकिन अक्सर, कुत्ता एक ही तरह के करतब को बार-बार करने में फंस जाता है क्योंकि उसे अलग-अलग विचारों को रचनात्मक रूप से मिलाने और जोड़ने का पता नहीं होता।
2. समाधान: "स्मार्ट शेफ" (AIC)
लेखकों ने एक नया फ्रेमवर्क बनाया है जिसे एडैप्टिव इंस्ट्रक्शन कंपोजिशन कहा जाता है। इसे एक स्मार्ट शेफ के रूप में सोचें जो एक परफेक्ट "जेलब्रेक" डिश (एक प्रॉम्प्ट जो रोबोट को धोखा दे सके) पकाने की कोशिश कर रहा है।
- सामग्री (Ingredients): शेफ के पास एक विशाल पेंट्री (डेटासेट) है जिसमें हजारों "हानिकारक प्रश्न" (सामग्री) और "ट्रिक्स" (मसाले) हैं।
- टेस्टर (Taste Tester): एक सख्त फूड क्रिटिक (इवैल्यूएटर) है जो डिश को चखता है और कहता है, "यह सुरक्षित है" या "इसने नियमों को तोड़ दिया!"
- सीखने की प्रक्रिया:
- स्मार्ट शेफ केवल रैंडम सामग्री नहीं चुनता है।
- वह एक न्यूरल बैंडिट (एक फैंसी गणितीय मस्तिष्क) का उपयोग करता है यह अनुमान लगाने के लिए कि कौन सा सामग्री का संयोजन फूड क्रिटिक को यह कहने के लिए मजबूर करेगा कि, "वाह, यह एक बड़ी सफलता है!"
- जादुई ट्रिक: यदि शेफ "प्रश्न A" + "ट्रिक B" का संयोजन आज़माता है और यह काम कर जाता है, तो शेफ केवल उस विशिष्ट संयोजन को याद नहीं रखता है। क्योंकि शेफ "फ्लेवर प्रोफाइल" (जिसे कॉन्ट्रास्टिव एम्बेडिंग्स कहा जाता है) को समझता है, वह महसूस करता है, "ओह, स्पाइसी प्रश्न और 'रोल-प्लेइंग' ट्रिक्स का मिश्रण अच्छा काम करता है।"
- इसलिए, अगली बार, वह "प्रश्न C" (जो A के समान स्वाद वाला है) + "ट्रिक D" (जो रोल-प्ले का एक नया प्रकार है) को आज़मा सकता है। वह केवल रेसिपी को नहीं, बल्कि पैटर्न को सीखता है।
3. यह दो लक्ष्यों को कैसे संतुलित करता है
शेफ को दो चीजों को संतुलित करना होता है:
- एक्सप्लोइटेशन (सुरक्षित दांव - Exploitation): वे व्यंजन बनाना जारी रखना जिन्हें क्रिटिक पसंद करता है (अधिक जेलब्रेक खोजना)।
- एक्सप्लोरेशन (जोखिम - Exploration): अजीब, नए संयोजन आज़माना यह देखने के लिए कि क्या वहां अन्य तरीके हैं जिनसे नियमों को तोड़ा जा सकता है जिन्हें अभी तक किसी ने नहीं खोजा है।
पेपर दिखाता है कि एक "डायल" (एक सेटिंग जिसे कहा जाता है) को एडजस्ट करके, आप शेफ को बता सकते हैं कि वह:
- आक्रामक (Aggressive) हो: "जमकर काम करो! अभी जितने हो सके उतने टूटे हुए नियम ढूंढो!" (ज्यादा स्पष्ट खामियों को खोजने के लिए बेहतरीन)।
- सूक्ष्म (Subtle) हो: "समय लो। नियमों को तोड़ने के विभिन्न तरीकों को खोजने की कोशिश करो, भले इसमें अधिक समय लगे।" (छिपी हुई, अजीब कमजोरियों को खोजने के लिए बेहतरीन)।
4. यह एक बड़ी बात क्यों है
- यह तेज़ है: यह रैंडम तरीके की तुलना में सफल ट्रिक्स को बहुत तेज़ी से खोज लेता है।
- यह स्मार्ट है: यह केवल याद नहीं करता; यह शब्दों के अर्थ को समझता है। यदि यह सीख जाता है कि "विलेन होने का नाटक करना" काम करता है, तो यह बिना बताए "वैज्ञानिक होने का नाटक करने" के तर्क को लागू कर सकता है।
- यह नए रोबोट्स पर भी काम करता है: पेपर ने एक प्रकार के रोबोट पर परीक्षण किया, फिर सीखे गए ट्रिक्स को एक दूसरे रोबोट पर आज़माया; शेफ के सबक अच्छी तरह से ट्रांसफर हुए, जिसका अर्थ है कि इसने केवल एक विशिष्ट मॉडल की खामियों को नहीं, बल्कि इन रोबोट्स के सोचने के सामान्य कमजोरियों को खोजा।
निचोड़ (The Bottom Line)
यह पेपर एक सुपर-एफिशिएंट सिक्योरिटी टेस्टर बनाने के बारे में है। रोबोट को बेमतलब चिल्लाकर यह देखने के बजाय कि क्या वह टूट जाता है, यह सिस्टम एक रणनीतिक गेम प्लेयर की तरह काम करता है। यह हर जीत और हार से सीखता है, अपनी रणनीतियों को बुद्धिमानी से मिलाता है, और तेज़ी से यह मैप कर देता है कि रोबोट के सुरक्षा घेरे (guardrails) कहाँ कमजोर हैं, जिससे डेवलपर्स को बुरे तत्वों द्वारा इनका फायदा उठाने से पहले उन छेदों को भरने में मदद मिलती है।
चेतावनी: पेपर स्वीकार करता है कि यह टूल शक्तिशाली है। यह एक ताला खोलने वाले (locksmith) को एक मास्टर की देने जैसा है जो किसी भी ताले को खोलने के लिए सीख सकती है। लेखक इस बात पर जोर देते हैं कि इसका उपयोग केवल सुरक्षा टीमों द्वारा रोबोट को ठीक करने के लिए किया जाना चाहिए, न कि मजे के लिए उन्हें तोड़ने के लिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।