← नवीनतम पेपर
🤖 machine learning

Linear-DPO: Linear Direct Preference Optimization for Diffusion and Flow-Matching Generative Models

यह शोध पत्र Linear-DPO का प्रस्ताव करता है, जो एक एकीकृत प्राथमिकता अनुकूलन ढांचा (unified preference optimization framework) है जो मानक सिग्मॉइड-आधारित उपयोगिता (sigmoid-based utility) के स्थान पर एक रैखिक उपयोगिता (linear utility) और एक EMA-अपडेटेड संदर्भ मॉडल (EMA-updated reference model) का उपयोग करके डिफ्यूजन और फ्लो-मैचिंग मॉडलों के लिए एक सामान्यीकृत उद्देश्य प्राप्त करता है, ताकि ऑब्जेक्टिव मिसमैच (objective mismatches) को दूर किया जा सके और टेक्स्ट-टू-इमेज जनरेशन संरेखण (alignment) में सुधार किया जा सके।

मूल लेखक: Kesong Li, Yixuan Xu, Kuo-kun Tseng, Weiyi Lu, Kan Liu, Tao Lan

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kesong Li, Yixuan Xu, Kuo-kun Tseng, Weiyi Lu, Kan Liu, Tao Lan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली कलाकार है जो आपके विवरणों के आधार पर चित्र बना सकता है। इस कलाकार ने इंटरनेट से अरबों छवियों और टेक्स्ट कैप्शन को देखकर सीखा है। वे चीजों को वास्तविक दिखाने में माहिर हैं, लेकिन उन्हें हमेशा यह नहीं पता होता कि इंसान वास्तव में क्या पसंद करते हैं। कभी-कभी वे ऐसी तस्वीरें बनाते हैं जो तकनीकी रूप से सही तो होती हैं, लेकिन थोड़ी अजीब, बदसूरत या वैसी नहीं होती जैसी आपने मांगी थी।

इसे ठीक करने के लिए, हमें इस कलाकार को मानवीय फीडबैक (human feedback) सुनना सिखाने की आवश्यकता है। यह शोध पत्र इस शिक्षण का एक नया, अधिक स्मार्ट तरीका पेश करता है, जिसे Linear-DPO कहा जाता है।

यहाँ इसका विवरण दिया गया है, जिसमें रोजमर्रा के उदाहरणों का उपयोग किया गया है:

1. समस्या: "एक ही आकार का शिक्षक" (The "One-Size-Fits-All" Teacher)

पहले, शोधकर्ता इन AI कलाकारों को सिखाने के लिए DPO (Direct Preference Optimization) नामक एक विधि का उपयोग करते थे। DPO को एक सख्त शिक्षक की तरह समझें जो कहता है, "यदि आप उत्तर सही देते हैं, तो बहुत अच्छा! यदि आप गलत होते हैं, तो तुरंत प्रयास करना बंद कर दें।"

  • समस्या: यह "तुरंत रुक जाओ" वाला नियम भाषा मॉडल (जैसे चैटबॉट्स) के लिए अच्छा काम करता है जहाँ आपको बस सही शब्द चुनना होता है। लेकिन इमेज जनरेशन के लिए, यह एक मूर्ति को तराशने की कोशिश करने जैसा है जहाँ आप केवल बड़े टुकड़ों को हटाते हैं और जैसे ही आकार थोड़ा ठीक दिखने लगता है, आप रुक जाते हैं। आप कभी भी बारीक विवरणों को सही नहीं कर पाते क्योंकि शिक्षक बहुत जल्दी फीडबैक देना बंद कर देता है।
  • अंतराल (The Gap): साथ ही, पुरानी विधि केवल एक विशिष्ट प्रकार के AI कलाकार (जिसे "डिफ्यूजन" मॉडल कहा जाता है) के लिए काम करती थी। नए और तेज़ कलाकारों (जिन्हें "फ्लो-मैचिंग" मॉडल कहा जाता है) को पूरी तरह से कक्षा से बाहर ही रखा गया था।

2. समाधान: एक एकीकृत कक्षा (A Unified Classroom)

इस शोध पत्र के लेखकों ने महसूस किया कि पुराने "डिफ्यूजन" कलाकार और नए "फ्लो-मैचिंग" कलाकार वास्तव में एक ही काम कर रहे हैं, बस थोड़े अलग तरीकों से। उन्होंने एक एकीकृत ढांचा (Unified Framework) बनाया।

  • उपमा: कल्पना कीजिए कि पुराना तरीका एक ऐसा शिक्षक था जो केवल नीली शर्ट पहने छात्रों से बात करता था। नया तरीका एक ऐसी सार्वभौमिक भाषा है जिसे "नीली शर्ट" वाले और "लाल शर्ट" वाले दोनों छात्र पूरी तरह समझते हैं। यह उन्हें सबसे नए और सबसे शक्तिशाली AI कलाकारों (जैसे SD3) को पहली बार 'पसेंड लर्निंग' (preference learning) के माध्यम से प्रशिक्षित करने की अनुमति देता है।

3. सीक्रेट सॉस: "लीनियर" उपयोगिता (The "Linear" Utility)

सबसे बड़ा नवाचार यह है कि शिक्षक फीडबैक कैसे देता है।

  • पुराना तरीका (Sigmoid): पुराने तरीके में "सिग्मॉइड" फंक्शन का उपयोग किया जाता था। इसे एक लाइट स्विच की तरह समझें। यह या तो OFF (0) होता है या ON (1)। एक बार जब छात्र का उत्तर "काफी अच्छा" हो जाता है, तो स्विच ON हो जाता है, और शिक्षक सुधार करना बंद कर देता है। इसके कारण छात्र "काफी अच्छा" स्तर पर ही अटक जाता है और आगे नहीं बढ़ पाता।
  • नया तरीका (Linear-DPO): लेखकों ने लाइट स्विच को एक डिमर स्विच (dimmer switch) (एक लीनियर फंक्शन) से बदल दिया।
    • यह कैसे काम करता है: भले ही छात्र अच्छा प्रदर्शन कर रहा हो, शिक्षक छोटे-छोटे, कोमल संकेत देता रहता है। यह एक कोच की तरह है जो कहता है, "अच्छा काम किया, लेकिन आइए रंगों को थोड़ा और चमकीला बनाते हैं," भले ही पेंटिंग पूरी हो चुकी हो।
    • परिणाम: यह सीखने की प्रक्रिया को सुचारू और निरंतर बनाए रखता है। कलाकार केवल इसलिए सुधार करना बंद नहीं करता क्योंकि उसने एक "अच्छा" स्कोर प्राप्त कर लिया है; वह विवरणों को तब तक निखारता रहता है जब तक कि चित्र वास्तव में सुंदर न हो जाए।

4. "मूविंग टारगेट" संदर्भ (The "Moving Target" Reference)

प्रशिक्षण के दौरान, आप आमतौर पर अपने छात्र के काम की तुलना एक "संदर्भ" (बेसलाइन मॉडल) से करते हैं ताकि यह सुनिश्चित हो सके कि वे पटरी से न उतर जाएं।

  • पुराना तरीका: संदर्भ एक स्थिर, जमी हुई मूर्ति की तरह था। एक बार जब छात्र मूर्ति से बेहतर हो गया, तो तुलना बेकार हो गई।
  • नया तरीका: लेखक एक EMA (Exponential Moving Average) संदर्भ का उपयोग करते हैं। कल्पना कीजिए कि संदर्भ एक छाया की तरह है जो धीरे-धीरे छात्र का पीछा करती है। जैसे-जैसे छात्र बेहतर होता जाता है, छाया भी उसके साथ चलती है। यह सुनिश्चित करता है कि छात्र को हमेशा अपने वर्तमान स्वरूप से थोड़ा बेहतर करने की चुनौती दी जाए, जिससे वह आलसी होने या एक जगह अटक जाने से बच सके।

5. परिणाम

इस शोध पत्र ने कई प्रसिद्ध AI कलाकारों (SD1.5, SDXL, और नए SD3) पर इस नए तरीके का परीक्षण किया।

  • निष्कर्ष: Linear-DPO के साथ प्रशिक्षित कलाकारों ने ऐसे चित्र बनाए जिन्हें इंसानों ने काफी बेहतर रेटिंग दी। वे अधिक वास्तविक दिखे, निर्देशों का अधिक बारीकी से पालन किया, और उनमें अधिक समृद्ध विवरण थे।
  • प्रमाण: आमने-सामने के परीक्षणों में, नए तरीके ने लगभग हर बार पुराने तरीकों (जैसे मानक DPO या साधारण फाइन-ट्यूनिंग) को मात दी, विशेष रूप से नवीनतम और सबसे शक्तिशाली मॉडलों पर।

सारांश

Linear-DPO को एक ऐसे शिक्षक के अपग्रेड के रूप में देखें जो लाइट स्विच (ऑन/ऑफ, बहुत जल्दी रुक जाना) के बजाय डिमर स्विच (सुचारू, निरंतर फीडबैक) का उपयोग करता है। उन्होंने यह भी सुनिश्चित किया कि यह शिक्षक सभी प्रकार के AI कलाकारों को सिखा सके, न कि केवल पुराने कलाकारों को। परिणाम स्वरूप, AI द्वारा बनाई गई कला बहुत अधिक वैसी दिखती है जैसा कि इंसान वास्तव में देखना चाहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →