← नवीनतम पेपर
🤖 machine learning

Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs

यह शोध पत्र प्रदर्शित करता है कि क्लॉड कोड (Claude Code) द्वारा संचालित एक ऑटोरिसर्च पाइपलाइन स्वायत्त रूप से नवीन व्हाइट-बॉक्स एडवरसैरियल अटैक एल्गोरिदम की खोज कर सकती है जो मौजूदा तरीकों से काफी बेहतर प्रदर्शन करते हैं, और अत्याधुनिक एलएलएम (LLM) सुरक्षा उपायों के विरुद्ध 100% तक अटैक सफलता दर प्राप्त करते हैं।

मूल लेखक: Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping, Maksym Andriushchenko

प्रकाशित 2026-03-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping, Maksym Andriushchenko

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक डिजिटल किले के दरवाजे पर खड़ा एक बहुत ही बुद्धिमान, बहुत ही जिद्दी रोबोट गार्ड (एक AI मॉडल) है। उसका काम किसी को भी बुरा काम करने के लिए कहने से रोकना है, जैसे कि वायरस लिखना या बम बनाने के निर्देश देना। यह गार्ड लगभग हर संदिग्ध चीज़ के लिए "नहीं" कहने के लिए प्रशिक्षित है।

वर्षों से, सुरक्षा शोधकर्ता इस गार्ड को चकमा देने की कोशिश कर रहे हैं। उन्होंने चालाक पहेलियाँ लिखने, भ्रमित करने वाली भाषा का उपयोग करने, या एक विशिष्ट तरीके से चिल्लाने की कोशिश की है ताकि गार्ड चूक जाए। इन तरकीबों को "जेलब्रेक" (jailbreaks) कहा जाता है।

लेकिन इस नए पेपर में मोड़ यह है: शोधकर्ताओं ने ये नई तरकीबें खुद नहीं लिखीं। उन्होंने एक रोबोट शोधकर्ता बनाया ताकि वह इन्हें लिख सके।

"क्लोडिनी" (Claudini) की कहानी

लेखकों ने क्लोडिनी नामक एक सिस्टम बनाया। इसे एक मास्टर कोडर के डिजिटल प्रशिक्षु (apprentice) के रूप में समझें।

  1. प्रशिक्षु (The Apprentice): प्रशिक्षु एक AI (विशेष रूप से, क्लॉड का एक संस्करण) है जिसे एक कंप्यूटर, पुराने तरीकों की एक लाइब्रेरी (मौजूदा हमले), और एक लक्ष्य दिया गया है: "गार्ड को चकमा देने का सबसे अच्छा तरीका खोजें।"
  2. लूप (The Loop): प्रशिक्षु केवल अनुमान नहीं लगाता। यह एक प्रयोगशाला में वैज्ञानिक की तरह काम करता है:
    • यह एक पुराने तरीके (जैसे, "GCG विधि") को देखता है।
    • यह उसमें सुधार करने की कोशिश करता है। शायद यह गति बदल दे, शायद यह एक अलग तरीके के साथ मिश्रण कर दे, शायद यह एक "रीसेट" बटन जोड़ दे यदि यह फंस जाता है।
    • यह गार्ड पर उस नए तरीके का परीक्षण करता है।
    • यदि नया तरीका बेहतर काम करता है, तो यह उसे रखता है। यदि नहीं, तो यह फिर से प्रयास करता है।
    • यह सैकड़ों बार ऐसा करता है, अपनी गलतियों से सीखता है, जबकि मानव शोधकर्ता केवल किनारे से देखते रहते हैं।

उपमा: मास्टर शेफ बनाम रेसिपी बुक

कल्पना कीजिए कि आपके पास एक कुकबुक है जिसमें "स्ट्रॉबेरी" जैसा स्वाद वाला केक बनाने की 30 अलग-अलग रेसिपी हैं।

  • पुराना तरीका: एक मानव शेफ कुकबुक को देखता है, सबसे अच्छी रेसिपी चुनता है, और चीनी या बेकिंग समय को थोड़ा सा बदलने की कोशिश करता है। वे थोड़ा बेहतर केक बना सकते हैं।
  • क्लोडिनी वाला तरीका: आप एक रोबोट शेफ को कुकबुक दे देते हैं। रोबोट शेफ उन सभी 30 रेसिपी को पढ़ता है। उसे एहसास होता है, "अरे, रेसिपी #5 में बेहतरीन मिक्सिंग है, लेकिन रेसिपी #12 में एकदम सही ओवन तापमान है।" वह उन्हें मिला देता है। फिर वह इसमें एक चुटकी नमक डालने की कोशिश करता है। फिर वह इसे 30 सेकंड अधिक बेक करने की कोशिश करता है।
  • परिणाम: रोबोट शेफ केवल रेसिपी में बदलाव नहीं करता; वह एक बिल्कुल नई, सुपर-केक का आविष्कार करता है जो किसी भी मानव शेफ ने कभी बनाने के बारे में नहीं सोचा था। इसका स्वाद इतना अच्छा है कि पुरानी रेसिपी इसके सामने जले हुए टोस्ट जैसी लगती हैं।

उन्होंने क्या खोजा?

रोबोट शोधकर्ता (क्लोडिनी) ने दो अद्भुत चीजें खोजीं:

1. इसने "गार्ड" को इंसानों की तुलना में बहुत बेहतर तरीके से तोड़ा।
जब उन्होंने एक विशिष्ट सुरक्षा गार्ड (GPT-OSS-Safeguard) के खिलाफ इसका परीक्षण किया, तो पुराने मानवीय तरीके केवल 10% समय काम करते थे। रोबोट के नए तरीके 40% समय काम करते थे। यह एक विशाल उछाल है। यह एक ताले खोलने वाले उपकरण (lockpick) की तरह है जो पहले 10 में से 1 बार दरवाजा खोलता था और अचानक 10 में से 4 बार खोलने लगा।

2. ये तरकीबें "सार्वभौमिक" (Universal) थीं।
यह सबसे डरावना (और सबसे प्रभावशाली) हिस्सा है। रोबोट ने एक विशिष्ट गार्ड को तोड़ने का तरीका सीखा। लेकिन फिर, उन्होंने उन्हीं तरकीपों को एक पूरी तरह से अलग गार्ड (Meta-SecAlign-70B) पर आज़माया, जिसे बहुत मजबूत बनाया गया था और जिसने पहले कभी रोबोट को नहीं देखा था।

  • मानव अपेक्षा: "ये तरकीबें बहुत विशिष्ट हैं; ये नए गार्ड पर काम नहीं करेंगी।"
  • वास्तविकता: रोबोट की तरकीबें 100% समय काम करती थीं। यह ऐसा था जैसे रोबोट ने केवल एक विशिष्ट ताला खोलने के बजाय, ताले तोड़ने के भौतिक विज्ञान (physics) को सीख लिया हो।

"आहा!" क्षण: इसने यह कैसे किया?

शोधकर्ताओं ने यह देखने के लिए कि रोबोट वास्तव में क्या कर रहा है, इसके अंदर झाँका। उन्हें उम्मीद थी कि यह किसी जादुई, एलियन गणित का आविष्कार करेगा। इसके बजाय, उन्हें कुछ सरल मिला: रोबोट मिश्रण (remixing) का उस्ताद था।

  • लेगो (Lego) की उपमा: कल्पना कीजिए कि आपके पास लेगो ब्रिक्स का एक बॉक्स है। कुछ ब्रिक्स "सेट A" (एक पुराना हमला तरीका) से हैं, और कुछ "सेट B" (एक अन्य हमला तरीका) से हैं।
  • रोबोट ने नए ब्रिक्स का आविष्कार नहीं किया। उसने बस महसूस किया, "यदि मैं सेट A से इंजन को सेट B के पहियों पर लगा दूँ, और फिर पूरे हिस्से को नीला रंग दूँ, तो यह तेज़ चलेगा।"
  • उसने इन मौजूदा विचारों को मिलाना और आपस में बदलना जारी रखा, "पेच" (सेटिंग्स जैसे गति और तापमान) को ट्यून किया, जब तक कि उसने एक ऐसा वाहन नहीं बनाया जो उस किसी भी वाहन से तेज़ चला जो इंसानों ने बनाया था।

यह क्यों मायने रखता है?

यह पेपर AI सुरक्षा की दुनिया के लिए एक चेतावनी है।

  • बुरी खबर: यदि एक रोबमा स्वचालित रूप से नए, सुपर-शक्तिशाली तरीके खोज सकता है जिससे AI सुरक्षा गार्डों को तोड़ा जा सके, तो हमारे वर्तमान सुरक्षा उपाय पर्याप्त मजबूत नहीं हो सकते हैं। हम केवल मानव विशेषज्ञों पर निर्भर नहीं रह सकते कि वे अगली चाल खोज लेंगे; रोबोट उसे पहले खोज लेगा।
  • अच्छी खबर: यह वास्तव में बचाव के लिए एक उपकरण है। यदि हम एक "रेड टीम" रोबोट (क्लोडिनी की तरह) बना सकते हैं जो लगातार हमारी सुरक्षा प्रणालियों को तोड़ने की कोशिश करता है, तो हम कमजोरियों को वास्तविक हमलावरों के आने से पहले ही ढूंढ सकते हैं। यह आपके घर में घुसने की कोशिश करने वाले रोबोट सुरक्षा गार्ड की तरह है ताकि आप चोर के आने से पहले छेद ठीक कर सकें।

निचोड़ (The Bottom Line)

यह पेपर दिखाता है कि AI अब AI अनुसंधान करने के लिए पर्याप्त स्मार्ट है। यह देख सकता है कि हम AI को तोड़ने की कोशिश कैसे करते हैं, यह समझ सकता है कि इसे और बेहतर तरीके से कैसे किया जाए, और ऐसे नए तरीके आविष्कार कर सकता है जो मानव टीम द्वारा समान समय में किए गए किसी भी प्रयास से कहीं अधिक श्रेष्ठ हैं।

दरवाजे पर खड़ा "गार्ड" स्मार्ट हो रहा है, लेकिन "चोर" (AI शोधकर्ता) अधिक स्मार्ट, अधिक तेज़ और अधिक रचनात्मक हो रहा है। बिल्ली और चूहे का खेल अब एक नए, स्वचालित स्तर पर पहुँच गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →