← नवीनतम पेपर
💻 computer science

Learn Once, Edit Anywhere: Visual Direction Transfer for Diffusion Models

यह शोध पत्र ViDiT को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो इमेज पेयर्स (image pairs) से एक एकल ग्लोबल एडिटिंग डायरेक्शन सीखता है ताकि बिना मॉडल फाइन-ट्यूनिंग या प्रति-इमेज ऑप्टिमाइज़ेशन के डिफ्यूजन मॉडल्स में सटीक, ज़ीरो-शॉट विजुअल एट्रिब्यूट ट्रांसफर को सक्षम बनाया जा सके।

मूल लेखक: Yusuf Dalva, Hidir Yesiltepe, Pinar Yanardag

प्रकाशित 2026-07-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yusuf Dalva, Hidir Yesiltepe, Pinar Yanardag

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ViDiT पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी समस्या: "भाषा की बाधा" (The Language Bottleneck)

कल्पना कीजिए कि आपके पास एक जादुई कलाकार (एक डिफ्यूजन मॉडल) है जो आपकी हर बात पर कुछ भी पेंट कर सकता है। लेकिन एक पेंच है: आप उससे केवल साधारण शब्दों में बात कर सकते हैं।

यदि आप कहते हैं, "दाढ़ी जोड़ दो," तो कलाकार दाढ़ी तो जोड़ देगा, लेकिन वह गलती से व्यक्ति की उम्र, त्वचा का रंग, या जबड़े का आकार भी बदल सकता है। क्यों? क्योंकि मानवीय भाषा अक्सर सूक्ष्म, सटीक दृश्य विवरणों (visual details) को समझाने के लिए बहुत अस्पष्ट होती है। आप आसानी से ऐसा वाक्य नहीं लिख सकते जो कहे, "केवल दाढ़ी जोड़ें, बाकी चेहरे को बिल्कुल वैसा ही रखें, और हेयरलाइन को न छुएं।"

यह "वर्णनात्मक बाधा" (descriptive bottleneck) है। हमारे पास एक तस्वीर है कि हम क्या चाहते हैं (एक "पहले" और एक "बाद" की इमेज), लेकिन हम उस तस्वीर को शब्दों में इतनी अच्छी तरह नहीं बदल सकते कि कलाकार उसे समझ सके।

समाधान: ViDiT (विजुअल डायरेक्शन ट्रांसफर)

लेखकों ने ViDiT (विजुअल डायरेक्शन ट्रांसफर फॉर डिफ्यूजन) नामक एक टूल बनाया है। कलाकार को जटिल शब्द समझाने की कोशिश करने के बजाय, ViDiT कलाकार को एक गुप्त हाथ का इशारा (secret hand gesture) सिखाता है।

यह कैसे काम करता है, इसके चरण यहाँ दिए गए हैं:

1. "एक बार सीखो" वाला सबक (The "Learn Once" Lesson)

कल्पना कीजिए कि आप कलाकार को दाढ़ी जोड़ना सिखाना चाहते हैं। प्रॉम्प्ट लिखने के बजाय, आप कलाकार को 1,000 "पहले" और "बाद" की तस्वीरों का एक छोटा ढेर दिखाते हैं (जैसे, एक बिना दाढ़ी वाला चेहरा और उसी चेहरे के बगल में दाढ़ी वाला चेहरा)।

ViDiT इन जोड़ों को देखता है और उनके बीच के सटीक गणितीय अंतर की गणना करता है। यह केवल दाढ़ी को नहीं देखता; यह कलाकार के मस्तिष्क में उस विशिष्ट "दिशा" (direction) को सीखता है जो किसी चेहरे को "बिना दाढ़ी" से "दाढ़ी वाले चेहरे" में बदल देती है, बिना किसी और चीज़ को बिगाड़े।

  • उपमा: सोचिए कि कलाकार का मस्तिष्क एक विशाल 3D मानचित्र है। ViDiT उस मानचित्र पर एक विशिष्ट तीर (arrow) ढूंढता है। यदि आप उस तीर की दिशा में चलते हैं, तो आपको दाढ़ी मिल जाती है। यदि आप तीर की विपरीत दिशा में चलते हैं, तो दाढ़ी हट जाती है। वह तीर इतना सटीक है कि उस पर चलने से आप गलती से दूसरे व्यक्ति में नहीं बदल जाते।

2. "कहीं भी बदलाव" का जादू (The "Edit Anywhere" Magic)

एक बार जब ViDiT इस "तीर" (या दिशा) को सीख लेता है, तो उसका काम पूरा हो जाता है। इसे फिर से कुछ भी सीखने की आवश्यकता नहीं है।

अब, आप दुनिया की किसी भी फोटो को ले सकते—एक असली व्यक्ति, एक कार्टून, एक बिल्ली की पेंटिंग, या एक स्केच—और उसी तीर को लागू कर सकते हैं।

  • उपमा: यह एक यूनिवर्सल रिमोट कंट्रोल रखने जैसा है। एक बार जब आप रिमोट को चैनल बदलकर "दाढ़ी" पर सेट कर देते हैं, तो आप इसे किसी भी टीवी (किसी भी इमेज) पर पॉइंट कर सकते हैं, और यह तुरंत चैनल बदल देगा। आपको हर टीवी के लिए नया रिमोट खरीदने की ज़रूरत नहीं है।

3. यह गलतियों से कैसे बचता है (दो-लॉस सिस्टम)

पेपर बताता है कि ViDiT यह सुनिश्चित करने के लिए कि संपादन (edit) एकदम सही हो, दो अलग-अलग "शिक्षकों" का उपयोग करता है:

  • शिक्षक A (बड़ी तस्वीर/Big Picture): यह शिक्षक समग्र अवधारणा (concept) को देखता है। "क्या यह दाढ़ी जैसा दिख रहा है?" यह सुनिश्चित करता है कि संपादन वैचारिक रूप से सही है।
  • शिक्षक B (बारीकियों का निरीक्षक/Detail Inspector): यह शिक्षक पिक्सेल के सूक्ष्म स्तर को देखता है। "क्या आपने नाक का आकार बदल दिया? क्या आपने चश्मे को धुंधला कर दिया?" यह शिक्षक सुनिश्चित करता है कि व्यक्ति की पहचान बिल्कुल वैसी ही रहे और केवल दाढ़ी ही बदले।

दोनों शिक्षकों की बात सुनकर, ViDiT एक ऐसा संपादन बनाता है जो सटीक भी है (यह निश्चित रूप से एक दाढ़ी है) और साफ-सुथरा भी (इसने गलती से व्यक्ति की उम्र या बैकग्राउंड को नहीं बदला)।

यह अन्य तरीकों से कैसे अलग है

  • पुराना तरीका (टेक्स्ट प्रॉम्प्ट): आप टाइप करते हैं "दाढ़ी जोड़ें।" कलाकार अनुमान लगाता है। अक्सर, कलाकार पूरी इमेज का मिजाज (vibe) ही बदल देता है।
  • पुराना तरीका (फाइन-ट्यूनिंग): आप कलाकार को हर नए विचार के लिए उसके पूरे मस्तिष्क को फिर से प्रशिक्षित करके एक नया कौशल सिखाते हैं (जैसे, उन्हें "दाढ़ी" सिखाना, फिर "चश्मा" के लिए फिर से प्रशिक्षित करना, फिर "टोपी" के लिए)। यह धीमा और महंगा है।
  • ViDiT का तरीका: आप कुछ उदाहरण एक बार दिखाते हैं। कलाकार एक अकेला "तीर" सीख जाता है। आप उस तीर को किसी भी इमेज पर तुरंत लागू कर सकते हैं, बिना कलाकार के मस्तिष्क को फिर से प्रशिक्षित किए।

यह पेपर वास्तव में क्या दिखाता है

पेपर प्रदर्शित करता है कि ViDiT क्या कर सकता है:

  • वास्तविक फोटो, कार्टून और पेंटिंग्स पर चेहरे की विशेषताओं (दाढ़ी, लिंग, उम्र, बालों का रंग) को बदल सकता है।
  • जानवरों की विशेषताओं को बदल सकता है (जैसे बिल्ली में शेर की अयाल जोड़ना)।
  • कलात्मक शैलियों (artistic styles) को बदल सकता है (फोटो को "पिक्सर" स्टाइल या "उकियो-ए" स्टाइल में बदलना)।
  • संपादन को मिला सकता है (एक ही समय में दाढ़ी और मुस्कान दोनों जोड़ना) बिना उन संvedनों के आपस में टकराए।

निष्कर्ष (The Bottom Line)

ViDiT "मैं शब्दों में ठीक से वर्णन नहीं कर सकता कि मुझे क्या चाहिए" की समस्या को हल करता है, जिससे कंप्यूटर सीधे तस्वीरों से सीख पाता है। यह कुछ उदाहरणों से एक सटीक "मूव" (move) सीखता है और आपको उस मूव को किसी भी इमेज पर तुरंत लागू करने देता है, जिससे मूल इमेज की पहचान सुरक्षित रहती है और आप वही बदलते हैं जो आप चाहते हैं।

नोट (सीमाएँ): पेपर स्वीकार करता है कि यदि आपके द्वारा दिखाए गए "पहले/बाद" के उदाहरण अव्यवस्थित हैं (उदाहरण के लिए, दाढ़ी वाले उदाहरणों ने गलती से त्वचा का रंग भी बदल दिया है), तो ViDT उस अव्यवस्था को भी सीख लेगा। यह केवल उतना ही अच्छा है जितने अच्छे उदाहरण आप इसे देते हैं। साथ ही, यह उन मूल AI मॉडलों से मौजूद किसी भी पूर्वाग्रह (bias) को भी अपना लेता है जिनका यह उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →