← नवीनतम पेपर
💻 computer science

LumiCtrl : Learning Illuminant Prompts for Lighting Control in Personalized Text-to-Image Models

LumiCtrl टेक्स्ट-टू-इमेज मॉडल्स को व्यक्तिगत बनाने की एक नवीन विधि है जो भौतिकी-आधारित संवर्धन (physics-based augmentation), एज-गाइडेड प्रॉम्प्ट डिसेंटैंगलमेंट (edge-guided prompt disentanglement) और मास्क पुनर्निर्माण हानि (masked reconstruction loss) के माध्यम से एक एकल वस्तु छवि से इल्यूमिनेंट प्रॉम्प्ट्स सीखकर सटीक लाइटिंग नियंत्रण सक्षम करती है, जिसके परिणामस्वरूप मौजूदा बेसलाइन की तुलना में बेहतर इल्यूमिनेंट फिडेलिटी और सौंदर्य गुणवत्ता प्राप्त होती है।

मूल लेखक: Muhammad Atif Butt, Kai Wang, Javier Vazquez-Corral, Joost Van De Weijer

प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muhammad Atif Butt, Kai Wang, Javier Vazquez-Corral, Joost Van De Weijer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई कला शिक्षक (एक AI) है जो आपकी बताई गई किसी भी चीज़ को बनाने में अविश्वसनीय रूप से कुशल है। आप कह सकते हैं, "एक गोल्डन रिट्रीवर बनाओ," और वह ऐसा कर देगा। लेकिन एक समस्या है: यह शिक्षक लाइटिंग (प्रकाश) को लेकर थोड़ा जिद्दी है।

यदि आप उसे एक गर्म, आरामदायक लिविंग रूम में बैठे कुत्ते की फोटो दिखाते हैं और उससे उसी कुत्ते को "ठंडी, नीली चांदनी" में बनाने के लिए कहते हैं, तो वह शिक्षक अक्सर आपके अनुरोध को अनदेखा कर देता है। वह उसी आरामदायक, गर्म लिविंग रूम की रोशनी में कुत्ते को बनाना जारी रखता है, चाहे आप कुछ भी कहें। ऐसा लगता है जैसे वह लिविंग रूम का लैंप बंद करना और चाँदनी को चालू करना भूल गया है।

यह शोध पत्र LumiCtrl पेश करता है, जो एक नया तरीका है जो इस जादुई कला शिक्षक को वास्तव में आपके निर्देशों के बारे में सुनने के लिए प्रशिक्षित करता है।

LumiCtrl कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: शिक्षक का "भाषा अंतराल" (Language Gap)

लेखकों ने पाया कि AI का "दिमाग" (विशेष रूप से इसका टेक्स्ट एनकोडर) "Tungsten," "6500K," या "Shade" जैसे शब्दों को वास्तव में नहीं समझता है।

  • उपमा: कल्पना कीजिए कि AI के लिए "Tungsten" शब्द केवल एक यादृच्छिक संख्या की तरह है, जैसे "42", न कि गर्म रोशनी के प्रकार के रूप में। यह शब्द को गर्म रोशनी के एहसास से नहीं जोड़ पाता है। इसलिए, जब आप "Tungsten लाइट" मांगते हैं, तो AI अपने डिफ़ॉल्ट "डेलाइट" चित्र को ही बना देता है क्योंकि उसे नहीं पता कि इसके अलावा क्या करना है।

2. समाधान: LumiCtrl का तीन-चरणीय जादू (Three-Step Magic Trick)

इसे ठीक करने के लिए, LumiCtrl AI को उसकी वस्तु को सही ढंग से बनाने की क्षमता को तोड़े बिना, उसे नए शब्द सिखाने के लिए तीन चतुर तरीकों का उपयोग करता है।

चरण A: "फिजिक्स लैब" (तापमान मैपिंग - Temperature Mapping)

AI को नए शब्द सिखाने से पहले, उन्हें यह दिखाना होगा कि वे शब्द दिखते कैसे हैं।

  • उपमा: कल्पना कीजिए कि आप किसी को सिखाना चाहते हैं कि "तीखा" स्वाद कैसा होता है। आप केवल शब्द नहीं बोल सकते; आपको उन्हें एक मिर्च देनी होगी। LumiCtrl आपके ऑब्जेक्ट की इमेज लेता है और भौतिकी (physics) का उपयोग करके उसे विभिन्न लाइटों के साथ गणितीय रूप से "पेंट" करता है (जैसे एक फोटो को सूर्यास्त के दृश्य में या फ्लोरोसेंट ऑफिस के दृश्य में बदलना)। यह उदाहरणों का एक पुस्तकालय बनाता है ताकि AI देख सके कि उस विशिष्ट वस्तु पर "Tengsten" वास्तव में कैसा दिखता है।

चरण B: "स्ट्रक्चरल चश्मा" (एज-गाइडेड डिसेंटैंगलमेंट - Edge-Guided Disentanglement)

यह सबसे महत्वपूर्ण ट्रिक है। जब AI एक नया शब्द सीखता है, तो वह अक्सर भ्रमित हो जाता है और वस्तु को प्रकाश के साथ मिला देता है।

  • उपमा: कल्पना कीजिए कि आप एक छात्र को "लाल" रंग पहचानना सिखा रहे हैं। यदि आप उन्हें एक लाल फायर ट्रक दिखाते हैं, तो वे शायद यह सीख सकते हैं कि "लाल" का अर्थ है "पहिए और सीढ़ी होना।" यह बुरा है!
    LumiCtrl एक विशेष चश्मा पहनता है जिसे ControlNet कहा जाता है। ये चश्मे केवल वस्तु के किनारों और आकारों (जैसे कुत्ते की रूपरेखा) को देखते हैं, रंगों को अनदेखा करते हैं। यह AI को मजबूर करता है कि वह कहे: "ठीक है, मैं देख सकता हूँ कि कुत्ते का आकार वही है। केवल प्रकाश का रंग बदल रहा है। मैं केवल प्रकाश के शब्द को सीखूँगा, कुत्ते के आकार को नहीं।"

चरण C: "स्पॉटलाइट मास्क" (मास्क्ड रिकंस्ट्रक्शन लॉस - Masked Reconstruction Loss)

जब आप किसी वस्तु पर प्रकाश बदलते हैं, तो बैकग्राउंड भी बदल जाता है, लेकिन यह साधारण या सपाट तरीके से नहीं होता। छाया और प्रतिबिंब जटिल होते हैं।

  • उपमा: कल्पना कीजिए कि आप एक पोर्ट्रेट पेंट कर रहे हैं। यदि आप पूरे कैनवास को बस एक नए रंग से पेंट कर देते हैं, तो बैकग्राउंड नकली और सपाट लगेगा। LumiCtrl एक मास्क (एक स्टेंसिल) को वस्तु के ऊपर रखता है।
    • यह AI को कहता है: "अपनी पूरी ऊर्जा कुत्ते पर सही रोशनी पाने में लगाओ।"
    • यह AI को कहता है: "बैकग्राउंड के लिए, बस अपनी कल्पना का उपयोग करें ताकि यह प्राकृतिक लगे।"
      इससे कुत्ता पूरी तरह से प्रकाशित दिखता है जबकि बैकग्राउंड स्वाभाविक रूप से अनुकूलित हो जाता है, जिससे एक वास्तविक दृश्य बनता है न कि केवल ऊपर से पेंट किया हुआ एक सपाट दृश्य।

3. परिणाम

इन तीन चरणों का उपयोग करके, LumiCtrl AI को यह समझने के लिए प्रशिक्षित करता है कि "Tungsten" का अर्थ "गर्म पीली रोशनी" है और "Shade" का अर्थ "ठंडी नीली रोशनी" है।

  • LumiCtrl से पहले: आप चाँदनी में एक कुत्ता मांगते हैं, और आपको धूप में एक कुत्ता मिलता है।
  • LumiCtrl के साथ: आप चाँदनी में एक कुत्ता मांगते हैं, और आपको चाँदनी में एक कुत्ता मिलता है, जिसमें बैकग्राउंड एक ठंडी, अंधेरी रात जैसा दिखता है, जबकि कुत्ता अभी भी बिल्कुल वैसा ही दिखता है जैसा आपने उसे दिखाया था।

यह क्यों महत्वपूर्ण है

वर्तमान में, यदि आप किसी फोटो में लाइटिंग बदलना चाहते हैं, तो आपको फोटोशॉप जैसे जटिल सॉफ़्टवेयर या विशेष 3D टूल्स की आवश्यकता होती है। LumiCtrl आपको यह सब केवल एक वाक्य टाइप करके करने की अनुमति देता है। यह हमारे द्वारा कही गई बातों ("इसे सूर्यास्त जैसा बनाओ") और कंप्यूटर द्वारा वास्तव में बनाए गए चित्र के बीच के अंतर को पाटता है, जिससे कलाकारों और डिजाइनरों को लाइटिंग विशेषज्ञ बने बिना भी अपनी छवियों के मूड और वातावरण पर पूर्ण नियंत्रण मिलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →