← नवीनतम पेपर
🤖 AI

DIAMOND: Directed Inference for Artifact Mitigation in Flow Matching Models

यह शोधपत्र DIAMOND को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), ज़ीरो-शॉट विधि है जो मॉडल के भार (weights) में संशोधन की आवश्यकता के बिना, जनरेशन को समस्याग्रस्त लेटेंट अवस्थाओं से सक्रिय रूप से दूर ले जाने के लिए इन्फरेंस के दौरान ट्रजेक्टरी सुधार (trajectory correction) लागू करके फ्लो मैचिंग और डिफ्यूजन मॉडल्स में दृश्य और शारीरिक विसंगतियों (visual and anatomical artifacts) को कम करता है।

मूल लेखक: Alicja Polowczyk, Agnieszka Polowczyk, Piotr Borycki, Joanna Waczyńska, Jacek Tabor, Przemysław Spurek

प्रकाशित 2026-02-03
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Alicja Polowczyk, Agnieszka Polowczyk, Piotr Borycki, Joanna Waczyńska, Jacek Tabor, Przemysław Spurek

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ (AI मॉडल) को आपके द्वारा दी गई रेसिपी (आपका टेक्स्ट प्रॉम्प्ट) के आधार पर एक बेहतरीन भोजन बनाने के लिए काम पर रख रहे हैं। शेफ अविश्वसनीय रूप से प्रतिभाशाली है और सुंदर व्यंजन बना सकता है, लेकिन कभी-कभी, खाना बनाते समय, वे गलती से कोई अजीब सामग्री मिला देते हैं—जैसे पिज्जा पर छह उंगलियों वाला हाथ या सूप में तैरता हुआ चम्मच। ये वे "आर्टिफैक्ट्स" (artifacts) हैं जिनके बारे में पेपर बात करता है।

आमतौर पर, यदि आपको एक खराब व्यंजन मिलता है, तो आपके पास दो विकल्प होते हैं:

  1. किचन में वापस भेजें और शेफ को फिर से खाना सीखना सिखाने के लिए कहें (मॉडल को रिट्रेन करना)। इसमें बहुत समय लगता है और यह महंगा है।
  2. इंतजार करें जब तक कि व्यंजन परोसा न जाए, फिर चिमटी (tweezers) से खराब हिस्सों को निकालने की कोशिश करें (पोस्ट-प्रोसेसिंग)। यह अस्त-व्यस्त है और अक्सर पूरे भोजन को खराब कर देता है।

DIAMOND इस समस्या को ठीक करने का एक नया, चतुर तरीका है जबकि शेफ अभी भी खाना बना रहा है, बिना उन्हें फिर से प्रशिक्षित किए या अंतिम प्लेट को छेड़े।

मुख्य विचार: "क्रिस्टल बॉल" चेक

यह पेपर एक विधि प्रस्तावित करता है जिसे DIAMOND (डायरेक्टेड इन्फरेंस फॉर आर्टिफैक्ट मिटिगेशन) कहा जाता है। यह कैसे काम करता है, यहाँ सरल उपमा (analogy) का उपयोग करके चरण-दर-चरण दिया गया है:

1. शेफ की प्रक्रिया (द ट्रजेक्टरी)
कल्पना कीजिए कि शेफ शोर (पुराने टीवी पर स्टैटिक) के एक खाली कैनवास से शुरू करता है और धीरे-धीरे इसे एक स्पष्ट छवि में बदल देता है। यह कई छोटे चरणों में होता है, जैसे रेडियो का डायल घुमाना जब तक कि संगीत स्पष्ट न हो जाए।

  • समस्या: कभी-कभी, 100 में से 50वें स्टेप पर, इमेज थोड़ी अजीब दिखने लगती है (शायद एक हाथ विकृत दिखता है)। यदि शेफ अंधे होकर आगे बढ़ता रहता है, तो अंतिम इमेज में वह विकृति होगी।

2. "क्रिस्टल बॉल" (द क्लीन एस्टीमेट)
अधिकांश विधियाँ इमेज को तब ठीक करने की कोशिश करती हैं जब वह अभी भी धुंधली और शोर भरी होती है। लेकिन पेपर का तर्क है कि एक धुंधली तस्वीर में गलती पहचानना कठिन है।

  • DIAMOND की ट्रिक: खाना बनाने की प्रक्रिया के हर एक स्टेप पर, सिस्टम तुरंत अंदाजा लगाता है कि यदि शेफ अभी रुक जाए और इसे पूरा कर दे, तो अंतिम, साफ व्यंजन कैसा दिखेगा।
  • यह इस "अंदाजे" को लेता है और इसे एक क्वालिटी इंस्पेक्टर (जिसे आर्टिफैक्ट डिटेक्टर कहा जाता है) को दिखाता है।

3. इंस्पेक्टर का हल्का सा धक्का (ग्रेडिएंट करेक्शन)
क्वालिटी इंस्पेक्टर उस "अंदाजे" को देखता है और कहता है, "हे, वह हाथ छह उंगलियों वाला लग रहा है!" या "वह शब्द गलत स्पेलिंग वाला है।"

  • अंत तक इंतजार करने के बजाय, सिस्टम तुरंत शेफ को एक हल्का सा धक्का (nudge) देता है।
  • कल्पना कीजिए कि शेफ इमेज बनाने के लिए एक रास्ते पर चल रहा है। यदि रास्ता एक "छह-उंगलियों वाले" आपदा की ओर जाता है, तो सिस्टम शेफ को उस रास्ते से थोड़ा हटाकर "पांच-उंगलियों वाले" रास्ते की ओर धकेलता है।
  • यह तुरंत, स्टेप-दर-स्टेप होता है, जो शेफ को गलतियों के स्थायी होने से पहले ही उनसे दूर ले जाता है।

यह विशेष क्यों है?

पेपर तीन मुख्य कारणों पर प्रकाश डालता है कि यह दृष्टिकोण पिछले तरीकों से बेहतर क्यों है:

  • कोई री-ट्रेनिंग आवश्यक नहीं: आपको शेफ को खाना बनाने का नया तरीका सिखाने की आवश्यकता नहीं है। आप बस उन्हें काम करते समय थोड़ा अतिरिक्त मार्गदर्शन देते हैं। यह "आउट ऑफ द बॉक्स" (जीरो-शॉट) काम करता है।
  • यह सटीक है: क्योंकि सिस्टम "धुंधले शोर" के बजाय "साफ अंदाजे" की जांच करता है, इसलिए इंस्पेक्टर गलतियों को बहुत पहले और अधिक सटीकता से पहचान सकता है।
  • यह हर जगह काम करता है: पेपर ने अलग-अलग प्रकार के "शेफ" (FLUX और Stable Diffusion जैसे AI मॉडल) पर इसका परीक्षण किया और पाया कि यह सभी के लिए काम करता है, जिससे अजीब त्रुटियां जैसे अतिरिक्त उंगलियां या विकृत टेक्स्ट काफी कम हो जाते हैं।

परिणाम

अपने परीक्षणों में, पेपर दिखाता है कि बिना DIAMOND के, मॉडल अक्सर कुछ कठिन कार्यों (जैसे हाथ बनाना या शब्द लिखना) पर 100% समय आर्टिफैक्ट्स वाली इमेज बनाते हैं। DIAMOND के साथ, उन्होंने इन त्रुटियों को कुछ मामलों में 10% से भी कम कर दिया, जबकि इमेज को बिल्कुल वैसा ही रखा जैसा उपयोगकर्ता ने मांगा था।

संक्षेप में: DIAMOND एक स्मार्ट असिस्टेंट की तरह है जो AI कलाकार के बगल में खड़ा है, फुसफुसाते हुए, "रुको, यह गलत लग रहा है, चलो अभी ब्रशस्ट्रोक को एडजस्ट करते हैं," यह सुनिश्चित करते हुए कि अंतिम चित्र एकदम सही हो, बिना कलाकार को निकाल दिए या नया काम पर रखे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →