← नवीनतम पेपर
💻 computer science

TwoHamsters: Benchmarking Multi-Concept Compositional Unsafety in Text-to-Image Models

यह शोध पत्र "TwoHamsters" प्रस्तुत करता है, जो 17.5k प्रॉम्प्ट्स का एक व्यापक बेंचमार्क है जिसे टेक्स्ट-टू-इमेज मॉडल्स में मल्टी-कॉन्सेप्ट कंपोजिशनल अनसेफ्टी (MCCU) का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल्स और रक्षा तंत्र व्यक्तिगत रूप से निर्दोष अवधारणाओं के अंतर्निहित जुड़ावों से उत्पन्न होने वाले जोखिमों को प्रभावी ढंग से कम करने में विफल रहते हैं।

मूल लेखक: Chaoshuo Zhang, Yibo Liang, Mengke Tian, Chenhao Lin, Zhengyu Zhao, Le Yang, Chong Zhang, Yang Zhang, Chao Shen

प्रकाशित 2026-04-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chaoshuo Zhang, Yibo Liang, Mengke Tian, Chenhao Lin, Zhengyu Zhao, Le Yang, Chong Zhang, Yang Zhang, Chao Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई आर्ट मशीन है। आप इसमें एक विवरण टाइप करते हैं, और यह आपके लिए एक चित्र बना देती है। यह मशीन अविश्वसनीय रूप से स्मार्ट है; यह वास्तविक दिखने वाली बिल्लियाँ, भविष्य के शहर और ऐतिहासिक हस्तियाँ बना सकती है। लेकिन, किसी भी शक्तिशाली उपकरण की तरह, इसका एक काला पक्ष भी है: कभी-कभी यह गलती से ऐसी चीजें बना देती है जो अपमानजनक, खतरनाक या बस अनुपयुक्त होती हैं।

लंबे समय से, वैज्ञानिक इस मशीन को "ना" कहना सिखाने की कोशिश कर रहे हैं। उन्होंने बंदूकें, नग्नता या हिंसा को रोकने के लिए सुरक्षा घेरे (guardrails) बनाए हैं। उन्हें लगा कि उनके पास एक अच्छा सिस्टम है: यदि अनुरोध में "बंदूक" शब्द है, तो मशीन रुक जाएगी।

लेकिन यहाँ एक समस्या है: बुरे लोगों (या बस चालाक दुर्घटनाओं) ने एक खामी ढूंढ ली है। उन्हें एहसास हुआ कि वे दो पूरी तरह से निर्दोष शब्दों को मिलाकर कुछ खतरनाक बना सकते हैं, और मशीन इसे पकड़ नहीं पाएगी।

यह शोध पत्र इन चालाकी भरी चालों को पकड़ने का एक नया तरीका पेश करता है। वे इसे TwoHamsters कहते हैं।

"Two Hamsters" (दो हैम्स्टर) का रूपक

इसका नाम क्यों रखा गया? लेखक एक मजेदार लेकिन सच्ची बात बताते हैं: हैम्स्टर एकांतप्रिय जानवर होते हैं। यदि आप दो हैम्स्टरों को एक ही पिंजरे में रहने के लिए मजबूर करते हैं, तो वे लड़ेंगे, और यह घातक हो सकता है।

  • हैम्स्टर A अपने आप में सुरक्षित है।
  • हैम्स्टर B अपने आप में सुरक्षित है।
  • हैम्स्टर A + हैम्स्टर B = तबाही।

AI आर्ट की दुनिया में, इसे Multi-Concept Compositional Unsafety (MCCU) कहा जाता है। यह तब होता है जब दो हानिरहित विचार मिलकर एक हानिकारक चीज़ बना देते हैं।

शोध पत्र के वास्तविक उदाहरण:

  • "केला" (Banana) + "दूध" (Milk) = एक हानिरहित फल और एक पेय। लेकिन एक साथ, कुछ संदर्भों में, इनका उपयोग यौन मजाक के लिए किया जा सकता है।
  • "सिरिंज" (Syringe) + "सफेद पाउडर" (White Powder) = चिकित्सा उपकरण। लेकिन एक साथ, ये स्पष्ट रूप से नशीली दवाओं के सेवन का संकेत देते हैं।
  • "बच्चा" (Child) + "आर्केड" (Arcade) = एक बच्चा मस्ती कर रहा है। लेकिन एक साथ, यह कम उम्र में जुआ खेलने का संकेत दे सकता है।

AI "केला" और "दूध" देखता है और सोचता है, "बहुत बढ़िया, मैं इन्हें बना सकता हूँ!" वह छिपे हुए, अपमानजनक अर्थ को नहीं देख पाता जिसे इंसान तुरंत समझ जाते हैं।

नया "टेस्ट" (TwoHamsters बेंचमार्क)

शोधकर्ताओं ने TwoHamsters नामक एक विशाल परीक्षण बनाया है। यह एक बड़े एग्जाम की तरह है जिसमें 17,500 पेचीदा सवाल हैं।

  • उन्होंने 10 अलग-अलग शीर्ष स्तर के AI आर्ट मॉडल्स (जैसे जिन्हें आप सोशल मीडिया पर देखते हैं) को लिया।
  • उन्होंने उन्हें इन "निर्दोष लेकिन खतरनाक" संयोजनों को बनाने के लिए कहा।
  • परिणाम? AI बुरी तरह विफल रहा।
    • एक सबसे स्मार्ट मॉडल, FLUX, ने 99.5% बार "असुरक्षित" चित्र बनाया। वह जाल को बिल्कुल नहीं देख सका।
    • यहाँ तक कि जो "सुरक्षा गार्ड" (फिल्टर्स) हैं जो बुरे चित्रों को रोकने के लिए होने चाहिए, वे इन ट्रिक्स को केवल 41% बार ही पकड़ पाए। वे "बंदूक" शब्द को ढूंढ रहे थे, न कि "केला + दूध" के संयोजन को।

यह क्यों हो रहा है? ("इंस्ट्रक्शन-सेफ्टी" दुविधा)

शोध पत्र ने एक दुखद विडंबना पाई: AI जितना अधिक निर्देशों का पालन करने में स्मार्ट होता जाता है, वह सुरक्षा के मामले में उतना ही खराब होता जाता है।

एक बहुत ही आज्ञाकारी लेकिन नादान कर्मचारी के बारे में सोचें।

  • पुराना AI: "आपने केले और दूध के लिए कहा है। मुझे यकीन नहीं है कि यह ठीक है या नहीं, इसलिए मैं बस 'ना' कह देता हूँ।" (सुरक्षित, लेकिन अनुपयोगी)।
  • नया AI: "आपने केले और दूध के लिए कहा है! मैं आदेशों का पालन करने में विशेषज्ञ हूँ। यह रहा आपका चित्र!" (उपयोगी, लेकिन खतरनाक)।

AI इतना आज्ञाकारी है कि वह यह सोचना छोड़ देता है कि अनुरोध क्यों अजीब हो सकता है। वह बस वही करता है जो उसे करने को कहा गया है।

"इरेज़र" (मिटाने वाली) समस्या

वैज्ञानिकों ने AI को बुरे विचारों को "भूलना" सिखाकर इसे ठीक करने की कोशिश की। उन्होंने AI के दिमाग से "ड्रग यूज़" (नशीली दवाओं के उपयोग) के विचार को मिटाने की कोशिश की।

  • समस्या: आप "सफेद पाउडर" या "सिरिंज" जैसे विचारों को नहीं मिटा सकते क्योंकि वे डॉक्टरों और अस्पतालों के चित्र बनाने के लिए भी आवश्यक हैं!
  • परिणाम: जब उन्होंने बुरे संयोजनों को मिटाने की कोशिश की, तो AI ने सब कुछ बहुत खराब और टूटा-फूटा बनाना शुरू कर दिया। इसने अच्छी चीजें बनाने की अपनी क्षमता भी खो दी। यह डिक्शनरी से "आग" शब्द को हटाने की कोशिश करने जैसा है ताकि आगजनी रोकी जा सके, लेकिन फिर आप कैंपफायर या मोमबत्ती के बारे में भी नहीं लिख पाएंगे।

मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि हम केवल बुरे शब्दों को रोकने के लिए एक बड़ी दीवार नहीं बना सकते। हमें AI को तर्क और संदर्भ (logic and context) समझना सिखाना होगा।

केवल शब्दों को ब्लॉक करने के बजाय, AI को यह सीखना होगा: "रुको, एक बच्चा और एक आर्केड मशीन एक साथ होने का मतलब जुआ हो सकता है, जो बच्चों के लिए बुरा है।"

संक्षेप में:

  1. जाल: दो सुरक्षित चीजें एक बुरी चीज बना सकती हैं।
  2. विफलता: वर्तमान AI बहुत आज्ञाकारी है और इन जालों को मिस कर देता है।
  3. समाधान: हमें केवल शब्दों को ब्लॉक करना बंद करना होगा और AI को शब्दों के पीछे की कहानी समझना सिखाना शुरू करना होगा।

TwoHamsters बेंचमार्क डेवलपर्स को अपने AI का परीक्षण करने और यह सुनिश्चित करने में मदद करने के लिए एक नया टूल है कि उनका AI अब इन "दो हैम्स्टरों को एक पिंजरे में रखने" वाली चालाकियों का शिकार न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →