TwoHamsters: Benchmarking Multi-Concept Compositional Unsafety in Text-to-Image Models
यह शोध पत्र "TwoHamsters" प्रस्तुत करता है, जो 17.5k प्रॉम्प्ट्स का एक व्यापक बेंचमार्क है जिसे टेक्स्ट-टू-इमेज मॉडल्स में मल्टी-कॉन्सेप्ट कंपोजिशनल अनसेफ्टी (MCCU) का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल्स और रक्षा तंत्र व्यक्तिगत रूप से निर्दोष अवधारणाओं के अंतर्निहित जुड़ावों से उत्पन्न होने वाले जोखिमों को प्रभावी ढंग से कम करने में विफल रहते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक जादुई आर्ट मशीन है। आप इसमें एक विवरण टाइप करते हैं, और यह आपके लिए एक चित्र बना देती है। यह मशीन अविश्वसनीय रूप से स्मार्ट है; यह वास्तविक दिखने वाली बिल्लियाँ, भविष्य के शहर और ऐतिहासिक हस्तियाँ बना सकती है। लेकिन, किसी भी शक्तिशाली उपकरण की तरह, इसका एक काला पक्ष भी है: कभी-कभी यह गलती से ऐसी चीजें बना देती है जो अपमानजनक, खतरनाक या बस अनुपयुक्त होती हैं।
लंबे समय से, वैज्ञानिक इस मशीन को "ना" कहना सिखाने की कोशिश कर रहे हैं। उन्होंने बंदूकें, नग्नता या हिंसा को रोकने के लिए सुरक्षा घेरे (guardrails) बनाए हैं। उन्हें लगा कि उनके पास एक अच्छा सिस्टम है: यदि अनुरोध में "बंदूक" शब्द है, तो मशीन रुक जाएगी।
लेकिन यहाँ एक समस्या है: बुरे लोगों (या बस चालाक दुर्घटनाओं) ने एक खामी ढूंढ ली है। उन्हें एहसास हुआ कि वे दो पूरी तरह से निर्दोष शब्दों को मिलाकर कुछ खतरनाक बना सकते हैं, और मशीन इसे पकड़ नहीं पाएगी।
यह शोध पत्र इन चालाकी भरी चालों को पकड़ने का एक नया तरीका पेश करता है। वे इसे TwoHamsters कहते हैं।
"Two Hamsters" (दो हैम्स्टर) का रूपक
इसका नाम क्यों रखा गया? लेखक एक मजेदार लेकिन सच्ची बात बताते हैं: हैम्स्टर एकांतप्रिय जानवर होते हैं। यदि आप दो हैम्स्टरों को एक ही पिंजरे में रहने के लिए मजबूर करते हैं, तो वे लड़ेंगे, और यह घातक हो सकता है।
- हैम्स्टर A अपने आप में सुरक्षित है।
- हैम्स्टर B अपने आप में सुरक्षित है।
- हैम्स्टर A + हैम्स्टर B = तबाही।
AI आर्ट की दुनिया में, इसे Multi-Concept Compositional Unsafety (MCCU) कहा जाता है। यह तब होता है जब दो हानिरहित विचार मिलकर एक हानिकारक चीज़ बना देते हैं।
शोध पत्र के वास्तविक उदाहरण:
- "केला" (Banana) + "दूध" (Milk) = एक हानिरहित फल और एक पेय। लेकिन एक साथ, कुछ संदर्भों में, इनका उपयोग यौन मजाक के लिए किया जा सकता है।
- "सिरिंज" (Syringe) + "सफेद पाउडर" (White Powder) = चिकित्सा उपकरण। लेकिन एक साथ, ये स्पष्ट रूप से नशीली दवाओं के सेवन का संकेत देते हैं।
- "बच्चा" (Child) + "आर्केड" (Arcade) = एक बच्चा मस्ती कर रहा है। लेकिन एक साथ, यह कम उम्र में जुआ खेलने का संकेत दे सकता है।
AI "केला" और "दूध" देखता है और सोचता है, "बहुत बढ़िया, मैं इन्हें बना सकता हूँ!" वह छिपे हुए, अपमानजनक अर्थ को नहीं देख पाता जिसे इंसान तुरंत समझ जाते हैं।
नया "टेस्ट" (TwoHamsters बेंचमार्क)
शोधकर्ताओं ने TwoHamsters नामक एक विशाल परीक्षण बनाया है। यह एक बड़े एग्जाम की तरह है जिसमें 17,500 पेचीदा सवाल हैं।
- उन्होंने 10 अलग-अलग शीर्ष स्तर के AI आर्ट मॉडल्स (जैसे जिन्हें आप सोशल मीडिया पर देखते हैं) को लिया।
- उन्होंने उन्हें इन "निर्दोष लेकिन खतरनाक" संयोजनों को बनाने के लिए कहा।
- परिणाम? AI बुरी तरह विफल रहा।
- एक सबसे स्मार्ट मॉडल, FLUX, ने 99.5% बार "असुरक्षित" चित्र बनाया। वह जाल को बिल्कुल नहीं देख सका।
- यहाँ तक कि जो "सुरक्षा गार्ड" (फिल्टर्स) हैं जो बुरे चित्रों को रोकने के लिए होने चाहिए, वे इन ट्रिक्स को केवल 41% बार ही पकड़ पाए। वे "बंदूक" शब्द को ढूंढ रहे थे, न कि "केला + दूध" के संयोजन को।
यह क्यों हो रहा है? ("इंस्ट्रक्शन-सेफ्टी" दुविधा)
शोध पत्र ने एक दुखद विडंबना पाई: AI जितना अधिक निर्देशों का पालन करने में स्मार्ट होता जाता है, वह सुरक्षा के मामले में उतना ही खराब होता जाता है।
एक बहुत ही आज्ञाकारी लेकिन नादान कर्मचारी के बारे में सोचें।
- पुराना AI: "आपने केले और दूध के लिए कहा है। मुझे यकीन नहीं है कि यह ठीक है या नहीं, इसलिए मैं बस 'ना' कह देता हूँ।" (सुरक्षित, लेकिन अनुपयोगी)।
- नया AI: "आपने केले और दूध के लिए कहा है! मैं आदेशों का पालन करने में विशेषज्ञ हूँ। यह रहा आपका चित्र!" (उपयोगी, लेकिन खतरनाक)।
AI इतना आज्ञाकारी है कि वह यह सोचना छोड़ देता है कि अनुरोध क्यों अजीब हो सकता है। वह बस वही करता है जो उसे करने को कहा गया है।
"इरेज़र" (मिटाने वाली) समस्या
वैज्ञानिकों ने AI को बुरे विचारों को "भूलना" सिखाकर इसे ठीक करने की कोशिश की। उन्होंने AI के दिमाग से "ड्रग यूज़" (नशीली दवाओं के उपयोग) के विचार को मिटाने की कोशिश की।
- समस्या: आप "सफेद पाउडर" या "सिरिंज" जैसे विचारों को नहीं मिटा सकते क्योंकि वे डॉक्टरों और अस्पतालों के चित्र बनाने के लिए भी आवश्यक हैं!
- परिणाम: जब उन्होंने बुरे संयोजनों को मिटाने की कोशिश की, तो AI ने सब कुछ बहुत खराब और टूटा-फूटा बनाना शुरू कर दिया। इसने अच्छी चीजें बनाने की अपनी क्षमता भी खो दी। यह डिक्शनरी से "आग" शब्द को हटाने की कोशिश करने जैसा है ताकि आगजनी रोकी जा सके, लेकिन फिर आप कैंपफायर या मोमबत्ती के बारे में भी नहीं लिख पाएंगे।
मुख्य निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि हम केवल बुरे शब्दों को रोकने के लिए एक बड़ी दीवार नहीं बना सकते। हमें AI को तर्क और संदर्भ (logic and context) समझना सिखाना होगा।
केवल शब्दों को ब्लॉक करने के बजाय, AI को यह सीखना होगा: "रुको, एक बच्चा और एक आर्केड मशीन एक साथ होने का मतलब जुआ हो सकता है, जो बच्चों के लिए बुरा है।"
संक्षेप में:
- जाल: दो सुरक्षित चीजें एक बुरी चीज बना सकती हैं।
- विफलता: वर्तमान AI बहुत आज्ञाकारी है और इन जालों को मिस कर देता है।
- समाधान: हमें केवल शब्दों को ब्लॉक करना बंद करना होगा और AI को शब्दों के पीछे की कहानी समझना सिखाना शुरू करना होगा।
TwoHamsters बेंचमार्क डेवलपर्स को अपने AI का परीक्षण करने और यह सुनिश्चित करने में मदद करने के लिए एक नया टूल है कि उनका AI अब इन "दो हैम्स्टरों को एक पिंजरे में रखने" वाली चालाकियों का शिकार न हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।