← नवीनतम पेपर
💻 computer science

Universal Few-Shot Spatial Control for Diffusion Models

यह शोध पत्र यूनिवर्सल फ्यू-शॉट कंट्रोल (UFC) का प्रस्ताव करता है, जो एक बहुमुखी एडेप्टर है जो पूर्व-प्रशिक्षित डिफ्यूजन मॉडल्स को केवल कुछ ही एनोटेटेड उदाहरणों का उपयोग करके उच्च प्रदर्शन के साथ नवीन स्थानिक अनुकूलन कार्यों (spatial conditioning tasks) में सामान्यीकरण करने में सक्षम बनाता है, जिससे मौजूदा विधियों की अनुकूलन क्षमता और प्रशिक्षण लागत की सीमाओं को दूर किया जा सके।

मूल लेखक: Kiet T. Nguyen, Chanhyuk Lee, Donggyun Kim, Dong Hoon Lee, Seunghoon Hong

प्रकाशित 2026-01-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kiet T. Nguyen, Chanhyuk Lee, Donggyun Kim, Dong Hoon Lee, Seunghoon Hong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई कलाकार (एक AI) है जो आपके शब्दों के आधार पर चित्र बनाने में अविश्वसनीय रूप से कुशल है। यदि आप कहते हैं, "एक चटाई पर बिल्ली," तो वह एक सुंदर बिल्ली बनाता है। लेकिन यदि आप बहुत विशिष्ट होना चाहते हैं—जैसे "एक बिल्ली बिल्कुल यहाँ बैठी है, उस दिशा में देख रही है, और उसके कानों का आकार विशेष है"—तो कलाकार भ्रमित हो जाता है। केवल शब्द उस तरह के सूक्ष्म नियंत्रण के लिए पर्याप्त सटीक नहीं होते।

आमतौर पर, इस कलाकार को निर्देश देने का एक नया तरीका सिखाने के लिए (जैसे कि एक विशिष्ट आउटलाइन या डेप्थ मैप बनाना), आपको शिक्षकों की एक पूरी नई टीम रखनी पड़ती है और हजारों उदाहरणों के साथ महीनों प्रशिक्षण देना पड़ता है। यह महंगा और धीमा है। यदि आप कल कलाकार को एक नया प्रकार का निर्देश (जैसे कि एक 3D वायरफ्रेम) सिखाना चाहते हैं, तो आपको पूरे प्रशिक्षण की प्रक्रिया को फिर से शुरू करना होगा।

पेपर का समाधान: "यूनिवर्सल फ्यू-शॉट कंट्रोल" (UFC)

यह पेपर एक नया तरीका पेश करता है जिसे UFC कहा जाता है, जो कलाकार के लिए एक "सुपर-ट्यूटर" (महा-शिक्षक) की तरह काम करता है। एक नया कौशल सीखने के लिए हजारों उदाहरणों की आवश्यकता के बजाय, UFC एक नए प्रकार के स्थानिक नियंत्रण (spatial control) को केवल 30 उदाहरणों (एक बहुत छोटी संख्या) के साथ सीख सकता है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करके यहाँ दिया गया है:

1. "सादृश्य" की ट्रिक (मैचिंग मैकेनिज्म)

कल्पना कीजिए कि आप कलाकार को एक ब्लूप्रिंट (एक नया कंडीशन जिसे उसने पहले कभी नहीं देखा है) के आधार पर घर बनाना सिखाना चाहते हैं। आपके पास हजारों ब्लूप्रिंट नहीं हैं। आपके पास केवल घरों के 30 फोटो और उनके ब्लूप्रिंट हैं।

ब्लूप्रिंट के नियमों को शून्य से याद करने के बजाय, UFC आपके क्वेरी (वह नया ब्लूप्रिंट जिसे आप उपयोग करना चाहते हैं) को देखता है और पूछता है: "मेरे 30 उदाहरण ब्लूप्रिंट्स में से कौन सा हिस्सा इस नए वाले जैसा दिखता है?"

  • यह इमेज और ब्लूप्रिंट को छोटे-छोटे पहेली के टुकड़ों (पैचेस) में तोड़ देता है।
  • यह आपके नए ब्लूप्रिंट के पहेली के टुकड़ों को 30 उदाहरणों के पहेली के टुकड़ों से मिलाता है।
  • फिर यह कहता है, "ठीक है, इस नए ब्लूप्रिंट के इस हिस्से के लिए, मैं उदाहरण #5 से 'घर बनाने की शैली' उधार लूंगा। उस हिस्से के लिए, मैं उदाहरण #12 से उधार लूंगा।"

सादृश्य के आधार पर इन उधार ली गई "शैलियों" को जोड़कर, यह कलाकार के लिए एक आदर्श मार्गदर्शिका बनाता है, बिना ब्लूप्रिंट के नियमों को शून्य से सीखे। यह एक छोटी सी डिब्बी में मौजूद संदर्भ टुकड़ों से सबसे अच्छी तरह फिट होने वाले टुकड़ों को खोजने जैसा है।

2. "क्विक-चेंज" एडेप्टर (फ्यू-शॉट लर्निंग)

आमतौर पर, AI को नया कार्य सिखाने के लिए उसके पूरे मस्तिष्क को फिर से प्रशिक्षित करने की आवश्यकता होती है। UFC अलग है। इसमें एक छोटा, हटाने योग्य "एडेप्टर" (जैसे कि एक विशेष लेंस जिसे आप कैमरे पर क्लिप कर सकते हैं) है।

  • लेंस: यह एडेप्टर लचीला होने के लिए प्री-ट्रेन किया गया है।
  • समायोजन: जब आप इसे एक नया कार्य देते हैं (जैसे "डेप्थ मैप के आधार पर ड्रा करें"), तो यह अपने सेटिंग्स के एक बहुत ही छोटे अंश को ही बदलता है (जैसे फोकस रिंग को एडजस्ट करना) उन 30 उदाहरणों का उपयोग करके।
  • परिणाम: यह तुरंत उस विशिष्ट नए कार्य के लिए विशेषज्ञ बन जाता है, जबकि अपने सभी मूल कलात्मक कौशल को बरकरार रखता है।

उन्होंने क्या पाया

शोधकर्ताओं ने इस "सुपर-ट्यूटर" का परीक्षण छह अलग-अलग प्रकार के स्थानिक नियंत्रणों (जैसे किनारे, गहराई, मानव मुद्राएं और सतह के कोण) पर किया, जिन्हें AI ने पहले कभी नहीं देखा था।

  • गति और दक्षता: उन्होंने AI को एक नया कार्य सिखाने के लिए केवल 30 उदाहरणों का उपयोग किया। कुछ मामलों में, उन्होंने पारंपरिक तरीकों द्वारा आवश्यक डेटा के केवल 0.1% का उपयोग किया।
  • प्रदर्शन: इतने कम डेटा के बावजूद, AI का नियंत्रण लगभग उतना ही अच्छा था जितना कि हजारों उदाहरणों पर प्रशिक्षित होने पर होता। यह एक ऐसा घर बना सका जो डेप्थ मैप के साथ पूरी तरह मेल खाता था या एक व्यक्ति जो पोज़ स्केलेटन के साथ पूरी तरह मेल खाता था।
  • बहुमुखी प्रतिभा: यह दो अलग-अलग प्रकार के AI "मस्तिष्क" (आर्किटेक्चर) पर काम कर गया, जिससे यह साबित हुआ कि यह एक सार्वभौमिक उपकरण है, न कि केवल एक विशेष मॉडल के लिए एक ट्रिक।

मुख्य निष्कर्ष (द बॉटम लाइन)

UFC को एक यूनिवर्सल ट्रांसलेटर के रूप में सोचें जो केवल कुछ वाक्यों (30 उदाहरणों) को सुनकर एक नई भाषा (स्थानिक स्थिति) तुरंत सीख सकता है और उन्हें उस शब्दकोश से तुलना करके सही शब्द ढूंढ सकता है जिसे वह पहले से जानता है। यह AI कलाकारों को बड़े, महंगे प्रशिक्षण शिविरों की आवश्यकता के बिना, नए प्रकार के चित्रों के लिए सटीक और जटिल निर्देशों का पालन करने की अनुमति देता है।

यह पेपर क्या दावा नहीं करता है:

  • यह दावा नहीं करता कि यह स्टाइल ट्रांसफर (किसी फोटो को वैन गॉग जैसा बनाना) के लिए काम करता है।
  • यह दावा नहीं करता कि यह धुंधली तस्वीरों को ठीक करने या वस्तुओं को हटाने (इनपेंटिंग) के लिए काम करता है।
  • यह दावा नहीं करता कि यह बिना किसी प्रशिक्षण के काम करता है (इसे एडेप्टर को "फाइन-ट्यून" करने के लिए उन 30 उदाहरणों की अभी भी आवश्यकता है)।
  • यह दावा नहीं करता कि यह मेडिकल इमेजिंग या क्लिनिकल उपयोग के लिए काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →