MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation
MaskAttn-SDXL, SDXL के लिए एक प्लग-इन मॉड्यूल है जो क्रॉस-अटेंशन लॉजिट्स (cross-attention logits) में टोकन-कंडीशन्ड स्पेशियल गेटिंग (token-conditioned spatial gating) को इंजेक्ट करके नियंत्रित क्षेत्र-स्तरीय टेक्स्ट-टू-इमेज जनरेशन को बढ़ाता है, ताकि बैकबोन आर्किटेक्चर को बदले बिना या अतिरिक्त पर्यवेक्षण की आवश्यकता के बिना अप्रासंगिक एट्रिब्यूट बाइंडिंग्स को दबाया जा सके और कंपोजिशनल विश्वसनीयता में सुधार किया जा सके।