← नवीनतम पेपर
💻 computer science

Test-Time Conditioning with Representation-Aligned Visual Features

यह शोध पत्र रिप्रेजेंटेशन-अलाइन्ड गाइडेंस (REPA-G) का परिचय देता है, जो एक इन्फरेंस-टाइम फ्रेमवर्क है जो डिफ्यूजन मॉडल जनरेशन को प्री-ट्रेंड सेल्फ-सुपरवाइज्ड मॉडल्स से निकाले गए विशिष्ट विजुअल फीचर्स की ओर निर्देशित करता है, जिससे बिना रिट्रेनिंग के टेक्सचर, सिमेंटिक्स और मल्टी-कॉन्सेप्ट कंपोजिशन पर बहुमुखी और सटीक नियंत्रण सक्षम होता है।

मूल लेखक: Nicolas Sereyjol-Garros, Ellington Kirby, Victor Letzelter, Victor Besnier, Nermin Samet

प्रकाशित 2026-02-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nicolas Sereyjol-Garros, Ellington Kirby, Victor Letzelter, Victor Besnier, Nermin Samet

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार को "खरगोश" की तस्वीर पेंट करना सिखाने की कोशिश कर रहे हैं।

पुराना तरीका (टेक्स्ट प्रॉम्प्ट्स):
आप एक लंबा, विस्तृत विवरण लिख सकते हैं: "एक ज्वालामुखी पर बैठा हुआ एक सफेद रोएँदार खरगोश, जिसमें फटी हुई काली जमीन और चमकता हुआ लावा है।" लेकिन रोबोट भ्रमित हो सकता है। क्या खरगोश सफेद है या ग्रे? क्या लावा लाल है या नारंगी? टेक्स्ट एक धुंधले नक्शे की तरह है; यह निर्देश तो देता है, लेकिन रोबोट को विवरणों का अनुमान लगाना पड़ता है।

नया तरीका (REPA-G):
विवरण लिखने के बजाय, आप बस रोबोट को एक असली खरगोश की फोटो और एक असली ज्वालामुखी की फोटो दिखाते हैं। रोबोट केवल तस्वीरों को देखता ही नहीं है; वह उनके अंदर मौजूद "गुप्त DNA" को देखता है।

यह पेपर REPA-G (रिप्रजेंटेशन-अलाइन्ड गाइडेंस) नामक एक नई विधि पेश करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग यहाँ दिया गया है:

1. छवियों की "गुप्त भाषा"

अधिकांश AI मॉडल छवियों को बनाने के लिए गलतियों का अनुमान लगाने और उन्हें सुधारने (जैसे एक मूर्तिकार पत्थर को छीलकर मूर्ति बनाता है) के माध्यम से सीखते हैं। हाल ही में, शोधकर्ताओं ने एक तरीका खोजा जिससे वे इन मॉडलों को एक "गुप्त भाषा" सिखा सकते हैं, उन्हें छवियां दिखाकर और एक स्मार्ट, प्री-ट्रेन्ड टीचर (जैसे DINOv2) के आंतरिक फीचर्स से मेल खाने के लिए कहकर।

इस "गुप्त भाषा" को एक यूनिवर्सल ट्रांसलेटर के रूप में सोचें। जब AI एक खरगोश को देखता है, तो वह केवल पिक्सेल नहीं देखता; वह एक गणितीय कोड में "खरगोश होने के विचार" (concept of rabbit-ness) को समझता है। पेपर दिखाता है कि यदि आप AI को यह कोड बोलना सिखाते हैं, तो वह केवल पेंट करना सीखने की तुलना में दुनिया को बहुत बेहतर समझता है।

2. आखिरी क्षण में जहाज को मोड़ना (Steering the Ship)

आमतौर पर, एक बार जब एक AI मॉडल प्रशिक्षित हो जाता है, तो आप इसे बिना दोबारा प्रशिक्षित किए आसानी से बदल नहीं सकते। यह एक कार बनाने जैसा है और फिर यह महसूस करना कि आप एक नाव चाहते थे; आपको एक नई कार बनानी होगी।

REPA-G अलग है। यह बिल्कुल आखिरी क्षण में (इन्फरेंस या जनरेशन के दौरान) काम करता है।

  • उपमा: कल्पना कीजिए कि AI को कोहरे से भरे समुद्र (शोर से छवि बनाने की प्रक्रिया) में एक जहाज की तरह यात्रा कर रहा है।
  • पुराना तरीका: आप बंदरगाह छोड़ने से पहले ही मंजिल तय कर देते हैं (ट्रेनिंग)।
  • REPA-G का तरीका: आप जहाज चलते समय भी उसे मोड़ सकते हैं। यदि आपको एक खरगोश चाहिए, तो आप एक "खरगोश सिग्नल" (एक असली खरगोश की फोटो से प्राप्त फीचर) दिखाते हैं। जहाज उस सिग्नल की ओर एक चुंबकीय खिंचाव महसूस करता है और खुद को उससे मेल खाने के लिए मोड़ लेता है।

3. नियंत्रण के तीन स्तर

यह पेपर दिखाता है कि आप एक मानचित्र पर ज़ूम इन और ज़ूम आउट करने की तरह, विभिन्न स्तरों की सटीकता के साथ AI को नियंत्रित कर सकते हैं:

  • "औसत" सिग्नल (व्यापक नियंत्रण - Broad Control): आप AI को खरगोश की एक पूरी तस्वीर दिखाते हैं और कहते हैं, "मेरे लिए कुछ ऐसा बनाओ जो इसके जैसा महसूस हो।" AI सामान्य वाइब (एक खरगोश) को पकड़ लेता है, लेकिन उसकी मुद्रा (pose) या बैकग्राउंड बदल सकता है। यह "एक कुत्ता बनाओ" कहने जैसा है और बदले में आपको गोल्डन रिट्रीवर, पूडल या बीगल मिल सकता है।
  • "मास्क्ड" सिग्नल (आकार नियंत्रण - Shape Control): आप एक खरगोश की तस्वीर लेते हैं, बैकग्राउंड को एक काले मास्क से ढक देते हैं, और AI को केवल खरगोश का आकार दिखाते हैं। AI फिर उसी सटीक आकार में एक खरगोश बनाता है, लेकिन उसे कहीं भी रख सकता है (समुद्र तट पर, अंतरिक्ष में, या ज्वालामुखी पर)। यह एक कुकी कटर (cookie cutter) का उपयोग करने जैसा है; आकार निश्चित है, लेकिन आटा कुछ भी हो सकता है।
  • "पूर्ण" सिग्नल (सटीक प्रतिलिपि - Exact Copy): आप AI को पूरी तस्वीर दिखाते हैं, और वह उस सटीक छवि के विशिष्ट टेक्सचर और विवरणों को फिर से बनाने की कोशिश करता है।

4. मिश्रण और मिलान (Composition)

सबसे शानदार बात यह है कि आप इन सिग्नल्स को मिला सकते हैं।

  • उपमा: कल्पना कीजिए कि आप एक "सर्फबोर्ड पर बाघ" चाहते हैं।
  • आप AI को बाघ की एक फोटो दिखाते हैं (बाघ के फीचर्स पाने के लिए)।
  • आप AI को सर्फबोर्ड या लहर की एक फोटो दिखाते हैं (बैकग्राउंड के फीचर्स पाने के लिए)।
  • AI इन दोनों "गुप्त कोड्स" को आपस में मिला देता है। वह केवल लहर पर बाघ को चिपकाता नहीं है; वह समझता है कि बाघ उस वातावरण में फिट बैठता है, जिससे एक प्राकृतिक दिखने वाली छवि बनती है।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

  • पुनः प्रशिक्षण की आवश्यकता नहीं: आपको AI मॉडल को फिर से बनाने की आवश्यकता नहीं है। आप बस इस स्टीयरिंग ट्रिक का उपयोग करते हैं।
  • टेक्स्ट से बेहतर: पेपर का तर्क है कि एक लंबी पैराग्राफ लिखने की तुलना में एक तस्वीर (या उसका "गुप्त कोड") दिखाना बहुत अधिक सटीक है। टेक्स्ट अस्पष्ट है; एक फीचर मैप एक सीधा निर्देश है।
  • उच्च गुणवत्ता: जब उन्होंने प्रसिद्ध इमेज डेटासेट्स (ImageNet और COCO) पर इसका परीक्षण किया, तो परिणाम पिछले तरीकों की तुलना में अधिक स्पष्ट, विविध और निर्देशों का बेहतर पालन करने वाले थे।

सारांश में:
REPA-G एक रोबोट कलाकार को असली तस्वीरों से बने चुंबकीय स्टीयरिंग व्हील देने जैसा है। एक अस्पष्ट विवरण के आधार पर आपके मन की बात का अनुमान लगाने के बजाय, आप रोबोट को एक "चुंबक" (एक फोटो से प्राप्त फीचर) थमाते हैं, और रोबोट का आंतरिक दिशा-सूचक यंत्र अंतिम छवि को उस चुंबक की ओर खींच लेता है, जिससे बिल्कुल वही बनता है जिसकी आपने कल्पना की थी—बिना रोबोट को दोबारा बनाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →