← नवीनतम पेपर
💻 computer science

RedEdit: Agentic Red-Teaming of Image Safety Classifiers via MCTS-Guided Photo-Editing

यह शोध पत्र RedEdit को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स एजेंटिक फ्रेमवर्क है जो एक विज़न-लैंग्वेज-मॉडल प्रस्तावक (proposer) और मोंटे कार्लो ट्री सर्च (Monte Carlo Tree Search) को प्रभावी ढंग से जोड़ता है ताकि न्यूनतम, अर्थपूर्ण रूप से संरक्षित फोटो संपादनों के माध्यम से इमेज सेफ्टी क्लासिफायर को सफलतापूर्वक बायपास किया जा सके, जिससे वर्तमान कंटेंट मॉडरेशन सिस्टम की महत्वपूर्ण कमजोरियों को उजागर किया जा सके।

मूल लेखक: Weilin Lin, Ziqi Lin, Zhenxing Zhou, Jianze Li, Tong Zhang, Hui Xiong, Li Liu

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weilin Lin, Ziqi Lin, Zhenxing Zhou, Jianze Li, Tong Zhang, Hui Xiong, Li Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, व्यस्त शहर का चौक है। इसे सुरक्षित रखने के लिए, शहर "सुरक्षा गार्ड" (जिन्हें "इमेज सेफ्टी क्लासिफायर" कहा जाता है) नियुक्त करता है जो लोगों द्वारा पोस्ट की जाने वाली हर तस्वीर को स्कैन करते हैं। उनका काम खतरनाक या आपत्तिजनक छवियों—जैसे हिंसा, आत्म-नुक्सान, या घृणास्पद भाषण—को पहचानना और उन्हें किसी के देखने से पहले ही ब्लॉक करना है।

लंबे समय तक, हमें लगा कि ये गार्ड बहुत सख्त हैं। लेकिन यह पेपर, RedEdit, एक सरल प्रश्न पूछता है: क्या होगा यदि कोई केवल तस्वीर में थोड़ा सा बदलाव करके, जैसे कि कोई इंसान फोटो ऐप का उपयोग करके करता है, गार्ड को चकमा देने की कोशिश करे?

यहाँ उस कहानी का विवरण दिया गया कि उन्होंने उत्तर कैसे खोजा, जिसे सरल रूप में समझाया गया है।

समस्या: "चालाकी भरी एडिटिंग" (The "Sneaky Edit")

वास्तविक जीवन में, लोग अक्सर तस्वीरों को बदलने के लिए सरल उपकरणों का उपयोग करते हैं: वे किसी छवि को घुमा सकते हैं (rotate), उसे ब्लैक एंड व्हाइट बना सकते हैं, वॉटरमार्क जोड़ सकते हैं, या रंग बदल सकते हैं। ये सामान्य संपादन (edits) हैं।

शोधकर्ताओं ने पाया कि ये साधारण, रोजमर्रा के बदलाव एक जादुई लबादे (magic cloak) की तरह काम कर सकते हैं। एक तस्वीर जो एक इंसान के लिए स्पष्ट रूप से "असुरक्षित" है, उसे थोड़ा सा बदलकर ऐसा बनाया जा सकता है कि कंप्यूटर गार्ड सोचे, "ओह, अब यह सुरक्षित लग रहा है!" और उसे जाने दे। बुरा कंटेंट अभी भी वहीं है (एक इंसान अभी भी देख सकता है कि यह खतरनाक है), लेकिन कंप्यूटर को मूर्ख बना दिया गया है।

समाधान: "डिजिटल जासूस" (The "Digital Detective" - RedEdit)

यह परीक्षण करने के लिए कि ये गार्ड कितने असुरक्षित हैं, लेखकों ने एक नया AI एजेंट बनाया जिसे RedEdit कहा जाता है। RedEdit को एक हैकर के रूप में नहीं, बल्कि एक सुपर-स्मार्ट, डिजिटल जासूस के रूपв में समझें जो सुरक्षा गार्ड के पास से एक "प्रतिबंधित" वस्तु को चुपके से ले जाने का रास्ता खोजने की कोशिश कर रहा है।

RedEdit इन दो विशेष कौशलों का उपयोग करता है:

  1. "अंतर्ज्ञान" (The "Intuition" - VLM Proposer):
    एक मानव विशेषज्ञ की कल्पना करें जो जानता है कि कौन से फोटो फिल्टर आमतौर पर सुरक्षा कैमरों को भ्रमित करते हैं। RedEdit के पास एक "दिमाग" (एक विजन-लैंग्वेज मॉडल) है जो तस्वीर को देखता है और कहता है, "हम्म, अगर मैं इस इमेज को 'सेपिया' (भूरापन लिए हुए) कर दूँ या इसे 90 डिग्री घुमा दूँ, तो गार्ड भ्रमित हो सकता है।" यह बिना सोचे-समझे अनुमान लगाने के बजाय कुछ स्मार्ट और लक्षित बदलावों का सुझाव देता है।

  2. "रणनीति बोर्ड" (The "Strategy Board" - MCTS Planner):
    यह सबसे महत्वपूर्ण हिस्सा है। कल्पना कीजिए कि यह शतरंज के खेल जैसा है। यदि आप एक चाल चलते हैं और वह विफल हो जाती है, तो एक अच्छा खिलाड़ी केवल उस हारने वाले रास्ते पर चलते नहीं रहता; वे पीछे हटते (backtrack) हैं और दूसरा रास्ता आज़माते हैं।
    RedEdit एक "मोंटे कार्लो ट्री सर्च" (MCTS) का उपयोग करके संभावनाओं का एक मानचित्र बनाता है।

  • यह एक बदलाव आज़माता है (जैसे, "इसे ग्रेस्केल बनाना")।
  • यह गार्ड की प्रतिक्रिया की जांच करता है।
  • यदि गार्ड इसे फिर भी पकड़ लेता है, तो RedEdit तुरंत पीछे हटता है (backtrack) है और एक अलग रास्ता आज़माता है (जैसे, "शायद मुझे एक बॉर्डर जोड़ना चाहिए")।
  • यह सबसे आशाजनक रास्तों की खोज करता है और खराब रास्तों को छोड़ देता है, और यह तब तक करता रहता है जब तक कि उसे एकदम सही संयोजन न मिल जाए।

बड़ी खोज

शोधकर्ताओं ने ज्ञात असुरक्षित छवियों (777 छवियों) के एक बड़े संग्रह पर RedEdit का परीक्षण किया। परिणाम चौंकाने वाले थे:

  • इसमें बहुत कम प्रयास लगता है: गार्ड को धोखा देने के लिए RedEdit को औसतन दो से भी कम संपादन (edits) करने की आवश्यकता पड़ी।
  • यह अविश्वसनीय रूप से प्रभावी है: इसने डिटेक्टर को 76.2% बार सफलतापूर्वक चकमा दिया।
  • खतरा बना हुआ है: संपादन के बाद भी, 93% छवियां एक इंसान को खतरनाक लगीं। "जादुई लबादे" ने कंप्यूटर को तो मूर्ख बना दिया, लेकिन कंटेंट अभी भी हानिकारक था।

"सार्वभौमिक कमजोरी" (The "Universal Weakness")

पेपर ने यह भी परीक्षण किया कि क्या यह ट्रिक अलग-अलग प्रकार के सुरक्षा गार्डों (विभिन्न AI मॉडल्स) पर काम करती है।

  • परिणाम: हाँ। वे संपादन जिन्होंने एक गार्ड को धोखा दिया, उन्होंने अक्सर दूसरों को भी धोखा दिया, भले ही उन गार्डों को अलग-अलग कंपनियों द्वारा बनाया गया हो।
  • उपमा: यह एक मास्टर की (master key) खोजने जैसा है जो कई अलग-अलग तालों को खोल सकती है। यह सुझाव देता है कि समस्या केवल एक विशिष्ट गार्ड के कमजोर होने की नहीं है; यह एक प्रणालीगत मुद्दा (systemic issue) है जहाँ सभी वर्तमान गार्ड साधारण फोटो संपादन के प्रति एक समान अंध बिंदु (blind spot) साझा करते हैं।

यह क्यों महत्वपूर्ण है

लेखक लोगों को कानून तोड़ने के लिए नहीं सिखा रहे हैं। इसके बजाय, वे खतरे का अलार्म बजा रहे हैं। उन्होंने पाया कि हमारी वर्तमान सुरक्षा प्रणालियाँ सरल, लो-टेक ट्रिक्स के खिलाफ आश्चर्यजनक रूप से नाजुक हैं।

संक्षेप में:

  • खतरा: बुरे तत्वों को सुरक्षा फिल्टरों को बायपास करने के लिए सुपर-कंप्यूटर की आवश्यकता नहीं है; उन्हें बस एक मानक फोटो एडिटर का उपयोग करके छोटे बदलाव करने की आवश्यकता है।
  • उपकरण: RedEdit इस प्रक्रिया को स्वचालित करने का एक उपकरण है ताकि यह दिखाया जा सके कि सिस्टम को तोड़ना कितना आसान है।
  • कार्यवाही का आह्वान: लेखक तकनीकी समुदाय से इस "लो-टेक" खतरे को अनदेखा करना बंद करने और ऐसे सुरक्षा सिस्टम बनाने के लिए कह रहे हैं जो इन सरल, रोजमर्रा के फोटो संपादन को संभाल सकें।

पेपर निष्कर्ष निकालता है कि हमें इस अनदेखे खतरे पर अधिक ध्यान देने की आवश्यकता है, क्योंकि अभी, एक साधारण "सेपिया फिल्टर" भी खतरनाक कंटेंट को दरारों से फिसलने देने के लिए पर्याप्त हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →