← नवीनतम पेपर
💻 computer science

Untwisting RoPE: Frequency Control for Shared Attention in DiTs

यह शोध पत्र विश्लेषण करता है कि कैसे रोटरी पोजीशनल एम्बेडिंग्स (RoPE) के उच्च-आवृत्ति घटक शेयर्ड-अटेंशन डिफ्यूजन मॉडल्स में अवांछित संदर्भ प्रतिलिपि (reference copying) का कारण बनते हैं और एक फ्रीक्वेंसी मॉड्यूलेशन विधि प्रस्तावित करता है जो चुनिंदा रूप से अटेंशन को नियंत्रित करने में सक्षम है, जिससे संदर्भ सामग्री को दोहराए बिना प्रभावी स्टाइल ट्रांसफर संभव हो पाता है।

मूल लेखक: Aryan Mikaeili, Or Patashnik, Andrea Tagliasacchi, Daniel Cohen-Or, Ali Mahdavi-Amiri

प्रकाशित 2026-02-06
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Aryan Mikaeili, Or Patashnik, Andrea Tagliasacchi, Daniel Cohen-Or, Ali Mahdavi-Amiri

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक मास्टर पेंटर (AI मॉडल) है और आप चाहते हैं कि वह एक बैल (bull) की संदर्भ फोटो के स्टाइल (शैली) का उपयोग करके एक जिराफ की नई तस्वीर बनाए। आप चाहते हैं कि जिराफ को उसी ब्रशस्ट्रोक, रंगों और "वाइब" के साथ चित्रित किया जाए जैसा कि बैल की तस्वीर में है, लेकिन आप यह भी नहीं चाहते कि जिराफ अचानक सींग उगने लगे या बैल में बदल जाए।

यह बिल्कुल वही समस्या है जिसे "Untwisting RoPE" नामक शोध पत्र (paper) हल करने की कोशिश करता है।

समस्या: "कॉपी-पेस्ट" ग्लिच (खराबी)

यह पेपर बताता है कि आधुनिक AI इमेज जनरेटर (जिन्हें डिफ्यूजन ट्रांसफॉर्मर कहा जाता है) एक विशेष गणितीय उपकरण का उपयोग करते हैं जिसे RoPE (रोटरी पोजीशनल एम्बेडिंग) कहते हैं, ताकि वे किसी छवि में चीजों की स्थिति को समझ सकें। RoPE को एक GPS निर्देशांक (coordinates) की तरह समझें जो AI को बताता है, "यह पिक्सेल ऊपर-बाएँ है, वह नीचे-दाएँ है।"

जब शोधकर्ताओं ने AI को जिराफ पेंट करते समय "बैल" की फोटो देखने के लिए प्रेरित किया (एक तकनीक जिसे Shared Attention कहा जाता है), तो कुछ गलत हो गया। केवल स्टाइल को कॉपी करने के बजाय, AI ने कंटेंट (विषय-वस्तु) को ही कॉपी-पेस्ट करना शुरू कर दिया।

  • परिणाम: AI ने एक ऐसा जिराफ बनाया जो आकार और स्थिति में बिल्कुल बैल जैसा दिखता था, बस उसके रंग अलग थे। वह एक "बैल-जिराफ" हाइब्रिड बन गया।
  • कारण: पेपर ने पाया कि RoPE अलग-अलग "फ्रीक्वेंसी" (आवृत्तियों) से बना है, जैसे गिटार के तार।
    • हाई-फ्रीक्वेंसी स्ट्रिंग्स (High-Frequency Strings): ये सटीक स्थान के प्रति बहुत संवेदनशील होते हैं। ये चिल्लाकर कहते हैं, "हे! यह पिक्सेल ठीक यहाँ है!"
    • लो-फ्रीक्वेंसी स्ट्रिंग्स (Low-Frequency Strings): ये अधिक सहज होते हैं। ये कहते हैं, "यह पिक्सेल आसपास के किसी सामान्य क्षेत्र में है।"

इस "बैल-से-जिराफ" प्रयोग में, हाई-फ्रीक्वेंसी स्ट्रिंग्स बहुत तेज़ थे। उन्होंने बैल के सींग को देखकर AI को मजबूर किया कि, "सींग स्थिति X पर है, इसलिए मुझे जिराफ में भी स्थिति X पर सींग रखना होगा।" AI सटीक स्थानों से मेल खाने के चक्कर में इतना जुनूनी हो गया कि वह केवल कलात्मक शैली को कॉपी करना ही भूल गया।

समाधान: वॉल्यूम कम करना

लेखकों ने महसूस किया कि उन्हें GPS (RoPE) को फेंकने की ज़रूरत नहीं है; उन्हें बस इसके विभिन्न हिस्सों के वॉल्यूम को एडजस्ट करने की ज़रूरत है।

उन्होंने संदर्भ फोटो को देखते समय हाई-फ्रीक्वेंसी स्ट्रिंग्स को चयनात्मक रूप से म्यूट (शांत) करने और लो-फ्रीक्वेंसी स्ट्रिंग्स को तेज़ करने की विधि पेश की।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक वीडियो से डांस सीखने की कोशिश कर रहे हैं।
    • पुराना तरीका (High-Frequency Dominance): आप डांसर के पैरों की सटीक स्थिति को इतनी गहराई से देखते हैं कि आप जम जाते हैं और उनके पैर की स्थिति को बिल्कुल उसी जगह कॉपी करने की कोशिश करते हैं, भले ही आप एक अलग स्टाइल में नाच रहे हों। आप अंततः एक क्लोन की तरह दिखने लगते हैं।
    • नया तरीका (Frequency Control): आप "सटीक पैर रखने के निर्देश" का वॉल्यूम कम कर देते हैं और "समग्र लय और प्रवाह" के निर्देशों का वॉल्यूम बढ़ा देते हैं। अब, आप वीडियो की समान ऊर्जा और स्टाइल के साथ नाच सकते हैं, लेकिन आपके पैर अपने स्वयं के डांस मूव्स के अनुसार चलेंगे (जिराफ प्रॉम्प्ट के अनुरूप)।

यह क्या हासिल करता है

RoPE को "अनट्विस्ट" (अनट्विस्टिंग) करके, यह पेपर दिखाता है कि AI अंततः यह कर सकता है:

  1. स्टाइल को समझना: यह संदर्भ के ब्रशस्ट्रोक, रंग और मूड को देखता है।
  2. सटीक स्थिति को अनदेखा करना: यह संदर्भ की आकृति को पिक्सेल-दर-पिक्सेल मैच करने के लिए मजबूर करना बंद कर देता है।
  3. अद्वितीय चित्र बनाना: आप एक जिराफ, एक कार, या एक महल बना सकते हैं जो सभी बैल के समान कलात्मक शैली साझा करते हैं, बिना किसी के भी गलती से बैल में बदले।

यह क्यों महत्वपूर्ण है

इससे पहले, यदि आप इन उन्नत AI मॉडल्स में स्टाइल ट्रांसफर करना चाहते थे, तो आपको या तो:

  • शेयरिंग को बंद करना पड़ता था: जिसके परिणामस्वरूप छवियां स्टाइल से बिल्कुल मेल नहीं खाती थीं।
  • शेयरिंग को लापरवाही से चालू करना पड़ता था: जिसके परिणामस्वरूप छवियां संदर्भ की हूबहू नकल बन जाती थीं।

यह पेपर एक "वॉल्यूम नॉब" प्रदान करता है जो आपको सही संतुलन सेट करने देता है: स्टाइल चालू, कंटेंट कॉपी करना बंद। यह बिना किसी विशाल AI मॉडल को फिर से प्रशिक्षित (retrain) किए काम करता है, जिससे यह इन मॉडल्स के स्पेस और स्टाइल के बारे में सोचने के तरीके में एक बड़े ग्लिच के लिए एक त्वरित और प्रभावी समाधान बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →