← नवीनतम पेपर
🤖 AI

How Do Inpainting Artifacts Propagate to Language?

यह शोध पत्र इस बात की जांच करता है कि डिफ्यूजन-आधारित इनपेंटिंग से उत्पन्न दृश्य विरूपण (visual artifacts) विजन-लैंग्वेज मॉडल्स में भाषा निर्माण को व्यवस्थित रूप से कैसे खराब करते हैं, जो मध्यवर्ती मॉडल प्रस्तुतियों (intermediate model representations) के विश्लेषण के माध्यम से पिक्सेल-स्तरीय पुनर्निर्माण निष्ठा (pixel-level reconstruction fidelity) को अर्थपूर्ण कैप्शन गुणवत्ता से जोड़ने वाला एक नैदानिक ढांचा स्थापित करता है।

मूल लेखक: Pratham Yashwante, Davit Abrahamyan, Shresth Grover, Sukruth Rao

प्रकाशित 2026-02-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pratham Yashwante, Davit Abrahamyan, Shresth Grover, Sukruth Rao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, कलात्मक सहायक है जो चित्रों को देखने और उन्हें शब्दों में वर्णन करने में माहिर है। आइए इस सहायक को "चित्र-से-शब्द अनुवादक" (Picture-to-Word Translator) कहें।

अब, कल्पना कीजिए कि किसी ने सहायक को एक ऐसी फोटो थमा दी है जिसके बीच में एक बड़ा, बदसूरत छेद है। सहायक उस छेद को देख नहीं सकता, इसलिए वह एक "जादुई पेंटब्रश" (एक कंप्यूटर प्रोग्राम जिसे AI इनपेंटिंग मॉडल कहा जाता है) से उस खाली हिस्से को भरने के लिए कहता है।

जादुई पेंटब्रश एक शानदार काम करता है। आपकी आँखों के लिए, वह छेद गायब हो गया है, और चित्र बिल्कुल सही लग रहा है। लेकिन यहाँ एक पेंच है: जादुई पेंट terlihat थोड़ा झूठ बोलने वाला है। यह खाली जगह को ऐसी चीज़ से भर देता है जो दिखने में तो सही लगती है लेकिन वास्तव में वह नहीं है जो वहाँ पहले था। शायद यह एक कुत्ते की जगह बिल्ली पेंट कर दे, या लाल शर्ट को नीली शर्ट में बदल दे, सिर्फ इसलिए क्योंकि इसे "लगता" है कि आमतौर पर वहाँ ऐसा ही कुछ होना चाहिए।

बड़ा सवाल:
जब चित्र-से-शब्द अनुवादक उस "सुधारी हुई" फोटो को देखता है, तो क्या वह झूठ को पकड़ पाता है? या वह पूरे आत्मविश्वास के साथ उस नकली बिल्ली को एक असली बिल्ली के रूप में वर्णित करता है?

यह शोध पत्र ठीक इसी के बारे में एक जासूसी कहानी है। शोधकर्ता यह देखना चाहते थे कि जादुई पेंटब्रश द्वारा बनाए गए ये छोटे, अदृश्य झूठ, अनुवादक द्वारा लिखे गए शब्दों को कैसे बिगाड़ देते हैं।

प्रयोग: एक दो-चरणीय परीक्षण

शोधकर्ताओं ने इस परीक्षण को करने के लिए एक सरल खेल तैयार किया:

  1. सेटअप: उन्होंने हजारों तस्वीरें लीं और डिजिटल रूप से उनके केंद्र को "काट दिया"।
  2. सुधार: उन्होंने खाली छिद्रों को भरने के लिए जादुई पेंटब्रश के विभिन्न संस्करणों (जो 'डिफ्यूजन' नामक तकनीक पर आधारित थे) का उपयोग किया। कुछ संस्करण बहुत सावधान थे; कुछ थोड़े लापरवाह।
  3. अनुवाद: उन्होंने मूल फोटो और सुधारी हुई फोटो दोनों को चित्र-से-शब्द अनुवादक को दिखाया।
  4. तुलना: उन्होंने विवरणों की तुलना की। क्या अनुवादक ने मूल फोटो के लिए "नीली शर्ट में एक आदमी" कहा, लेकिन सुधरी हुई फोटो के लिए "नीली शर्ट में एक महिला" कह दिया?

उन्होंने क्या पाया ( "आहा!" क्षण)

1. "अच्छा दिखने" का जाल
शोधकर्ताओं ने पाया कि केवल इसलिए कि एक फोटो हमारी आँखों को एकदम सही दिखती है, इसका मतलब यह नहीं है कि शब्द भी सही होंगे।

  • उपमा: कल्पना कीजिए कि एक जादूगर एक असली सेब को प्लास्टिक के सेब से बदल देता है। यह बिल्कुल सेब जैसा दिखता है। यदि आप एक बच्चे से उस फल का वर्णन करने के लिए कहें, तो वह कह सकता है, "यह एक लाल, कुरकुरा सेब है।" लेकिन यदि आप उसे काटेंगे, तो वह प्लास्टिक का होगा। जादुई पेंटब्रश "प्लास्टिक के सेब" बनाता है जो आँखों को तो धोखा दे देते हैं लेकिन मस्तिष्क को भ्रमित कर देते हैं।
  • परिणाम: जब पेंटब्रश ने छोटे, सूक्ष्म बदलाव किए (जैसे छेद के किनारों को धुंधला करना), तो अनुवादक आमतौर पर ठीक था। लेकिन जब पेंटब्रश ने छेद में एक नई वस्तु को बस "कट और पेस्ट" कर दिया, तो अनुवादक भ्रमित हो गया और तथ्य बनाने लगा (हैलुसिनेशन/भ्रम पैदा करना)।

2. "गहरे मस्तिष्क" का भ्रम
शोधकर्ताओं ने अनुवादक के "मस्तिष्क" (इसके कंप्यूटर लेयर्स) के अंदर झाँका ताकि देखा जा सके कि क्या हो रहा है।

  • उपमा: अनुवादक के मस्तिष्क को एक फैक्ट्री असेंबली लाइन की तरह समझें। पहले कर्मचारी केवल रंगों और आकारों को देखते हैं। लाइन के अंत में काम करने वाले कर्मचारी तय करते हैं कि वह वस्तु क्या है (जैसे, "वह कुत्ता है, बिल्ली नहीं")।
  • परिणाम: उन्होंने पाया कि नकली पेंटिंग्स ने पहले कर्मचारियों को भ्रमित नहीं किया। लेकिन जब तक वह छवि मस्तिष्क के अंत तक पहुँची, कर्मचारी पूरी तरह से भ्रमित हो गए थे। पेंटब्रश से आया "झूठ" जैसे-जैसे मस्तिष्क के माध्यम से आगे बढ़ता गया, वह बड़ा होता गया, जिससे अंतिम विवरण गलत हो गया।

3. "चिकना बनाम तीखा" नियम
उन्होंने खोजा कि छेद को कैसे छिपाया जाता है, यह बहुत मायने रखता है।

  • उपमा: यदि आप कागज का एक टुकड़ा फाड़ते हैं और उसे टेढ़े-मेढ़े, तीखे किनारों के साथ वापस चिपकाने की कोशिश करते हैं, तो यह स्पष्ट होता है। लेकिन यदि आप किनारों को धीरे-धीरे धुंधला कर देते हैं ताकि वे मिल जाएं, तो इसे पहचानना कठिन होता है।
  • परिणाम: जब जादुई पेंटब्रश ने छेद को भरने के लिए "चिकने" (स्मूथ) फेडिंग का उपयोग किया, तो अनुवादक शांत रहा और अच्छे विवरण लिखे। जब इसने "तीखे" (शार्प) कट का उपयोग किया, तो अनुवादक घबरा गया और बेतुकी बातें लिखने लगा।

यह क्यों महत्वपूर्ण है

यह केवल फोटो ठीक करने के बारे में नहीं है। यह विश्वास के बारे में है।

हम पुरानी तस्वीरों को ठीक करने, छुट्टियों की तस्वीरों से अनचाहे लोगों को हटाने, या यहाँ तक कि डॉक्टरों के लिए चिकित्सा चित्र उत्पन्न करने के लिए AI का उपयोग करना शुरू कर रहे हैं। यदि हम इन उपकरणों का उपयोग करते हैं, तो हमें जानना होगा: यदि AI फोटो को ठीक करता है, तो क्या हम उसके साथ आने वाले विवरण पर भरोसा कर सकते हैं?

यह शोध पत्र हमें एक चेतावनी देता है: फोटो को सिर्फ इसलिए सच न मानें क्योंकि वह अच्छी दिख रही है। यदि AI ने किसी चित्र के किसी हिस्से पर "पेंट" किया है, तो उस चित्र के बारे में उसके द्वारा उत्पन्न शब्द आपसे झूठ बोल सकते हैं, भले ही चित्र एकदम सही दिख रहा हो।

मुख्य निष्कर्ष

शोधकर्ताओं ने AI के लिए एक "झूठ पकड़ने वाला यंत्र" बनाया। उन्होंने साबित किया कि जब AI एक टूटी हुई तस्वीर को ठीक करता है, तो वह अक्सर ऐसे छोटे झूठ शामिल कर देता है जो AI को झूठी कहानियाँ लिखने के लिए प्रेरित करते हैं। सच्चाई पाने के लिए, हमें यह जांचना होगा कि चित्र केवल कैसा दिखता है, बल्कि AI उसके बारे में कैसे सोचता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →