← नवीनतम पेपर
🤖 machine learning

Drifting Preference Optimization for One-Step Generative Models

यह शोध पत्र ड्रिफ्टिंग प्रेफरेंस ऑप्टिमाइज़ेशन (DrPO) का प्रस्ताव करता है, जो एक ऑनलाइन फाइनट्यूनिंग विधि है जो गैर-डिफरेंशिएबल रिवॉर्ड्स का उपयोग करके डिटर्मिनिस्टिक टेक्स्ट-टू-इमेज जनरेटर्स के कुशल, सिंगल-स्टेप अलाइनमेंट को सक्षम बनाता है, जो रिवॉर्ड-मॉडल बैकप्रोपैगेशन की आवश्यकता के बिना रैंक किए गए सैंपल्स से फीचर-स्पेस अपडेट दिशाओं को संश्लेषित करता है।

मूल लेखक: Zhou Jiang, Yandong Wen, Zhen Liu

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhou Jiang, Yandong Wen, Zhen Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-फास्ट कलाकार है जो पलक झपकते ही एक वाक्य से तस्वीर बना सकता है। "वन-स्टेप" इमेज जनरेटर यही करते हैं। वे अविश्वसनीय रूप से तेज़ हैं, लेकिन अक्सर वे ठीक वैसा ही चित्रित करने में संघर्ष करते हैं जैसा इंसान देखना चाहते हैं। आमतौर पर, इन कलाकारों को बेहतर बनाने के लिए सिखाने की प्रक्रिया में उन्हें हजारों उदाहरण दिखाना, सूक्ष्म गणितीय त्रुटियों की गणना करना और उनके "दिमाग" को थोड़ा-थोड़ा करके बदलना शामिल होता है, जो एक बहुत ही धीमी और जटिल प्रक्रिया है।

यह पेपर एक नई विधि पेश करता है जिसे DrPO (Drift Preference Optimization) कहा जाता है। इसे एक स्मार्ट और तेज़ तरीके के रूप में समझें जिससे इस सुपर-फास्ट कलाकार को सिखाया जा सके, बिना उन भारी गणितीय गणनाओं की आवश्यकता के जो आमतौर पर "वन-स्टेप" की गति को धीमा कर देती हैं।

DrPO कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "ब्लैक बॉक्स" शिक्षक

सामान्यतः, एक AI को सिखाने के लिए आपको एक ऐसे शिक्षक की आवश्यकता होती है जो पेंटिंग को देख सके, गणना कर सके कि वह क्यों गलत है, और कलाकार को उसे ठीक करने के लिए एक गणितीय संकेत भेज सके।

  • समस्या: कभी-कभी, शिक्षक एक "ब्लैक बॉक्स" होते हैं (हमें नहीं पता कि वे कैसे सोचते हैं), या शिक्षक इतना बड़ा और जटिल होता है कि वह संकेतों को वापस भेजने में सक्षम नहीं होता। या फिर, शिक्षक केवल एक साधारण "अच्छा काम किया" या "बुरा काम किया" जैसा स्कोर देता है, न कि कोई विस्तृत पाठ योजना।
  • पुराना तरीका: इन शिक्षकों से कलाकार को सिखाने की कोशिश करने के लिए अक्सर कलाकार को धीमा करने या महंगी कंप्यूटर गणनाओं की आवश्यकता होती है जो "वन-स्टेप" की गति को तोड़ देती हैं।

2. समाधान: "ड्रिफ्टिंग फील्ड" (बहता हुआ क्षेत्र)

DrPO खेल बदल देता है। कलाकार को विस्तृत गणितीय संकेत भेजने के लिए कहने के बजाय, DrPO एक चुंबकीय क्षेत्र (magnetic field) की उपमा का उपयोग करता है।

  • सेटअप: आप कलाकार को एक ही प्रॉम्प्ट (जैसे "सोफे पर एक बिल्ली") के आधार पर 24 तस्वीरें बनाने के लिए कहते हैं।
  • रैंकिंग: आप इन 24 तस्वीरों को अपने शिक्षक (रिवॉर्ड मॉडल) को दिखाते हैं। शिक्षक को यह समझाने की आवश्यकता नहीं है कि वे अच्छी या बुरी क्यों हैं; वे बस उन्हें रैंक करते हैं। "यह सबसे अच्छी है," और "यह सबसे खराब है।"
  • चुंबक बनाना:
    • सबसे अच्छी तस्वीरें चुंबक की तरह काम करती हैं जो कलाकार की भविष्य की पेंटिंग्स को अपनी ओर खींचती हैं।
    • सबसे खराब तस्वीरें विकर्षक (repellers) की तरह काम करती हैं जो कलाकार की भविष्य की पेंटिंग्स को खुद से दूर धकेलती हैं।
  • ड्रिफ्ट (लहर/बहाव): कलाकार को रैंकिंग के पीछे के गणित को जानने की आवश्यकता नहीं है। वे बस फीचर स्पेस (एक छिपा हुआ नक्शा कि छवि कैसी दिखती है) में एक सौम्य "ड्रिफ्ट" या हवा महसूस करते हैं जो उन्हें अच्छे चुंबकों की ओर और बुरे चुंबकों से दूर धकेलता है।

3. सुरक्षा जाल: "फ्रोजन रेफरेंस" (जमी हुई संदर्भ रेखा)

यदि आप केवल कलाकार को चुंबकों की ओर बहने देते हैं, तो वे भटक सकते हैं या अजीब, विकृत चित्र बनाने लग सकते हैं।

  • समाधान: DrPO मूल कलाकार (बेस मॉडल) की एक "फ्रोजन" (स्थिर) प्रति रखता है।
  • उपमा: कल्पना कीजिए कि कलाकार एक रस्सी (tightrope) पर चल रहा है। "चुंबक" उन्हें लक्ष्य की ओर खींचते हैं, लेकिन "फ्रोजन रेफरेंस" एक सुरक्षा रेखा के रूप में कार्य करता है, जो उन्हें तब धीरे से वापस खींचता है जब वे अपने मूल स्टाइल से बहुत दूर जाने लगते हैं। यह छवियों को स्वाभाविक और स्थिर बनाए रखता है।

4. यह एक बड़ी बात क्यों है

  • गति: क्योंकि DrPO को केवल तस्वीरों को रैंक करने के लिए शिक्षक की आवश्यकता होती है (उन पर जटिल गणित करने की नहीं), यह किसी भी प्रकार के शिक्षक के साथ काम कर सकता है, यहाँ तक कि बहुत बड़े, गुप्त या केवल साधारण स्कोर देने वाले मॉडल के साथ भी।
  • दक्षता: पेपर का दावा है कि यह विधि जटिल शिक्षकों (जैसे HPSv3) का उपयोग करते समय प्रशिक्षण को 3.5 गुना तेज़ बनाती है क्योंकि यह भारी "बैकप्रोपैगेशन" (गणितीय संकेत भेजने की प्रक्रिया) के चरण को छोड़ देती है।
  • वन-स्टेप इन्फरेंस: सबसे अच्छी बात? कलाकार अभी भी एक ही स्टेप में पेंट करता है। प्रशिक्षण स्मार्ट हो जाता है, लेकिन वास्तविक पेंटिंग प्रक्रिया बिजली की तरह तेज़ बनी रहती है।

सारांश

Dr-PO को एक "हॉल ऑफ फेम" (सबसे अच्छी छवियां) और "हॉल ऑफ शेम" (सबसे खराब छवियां) दिखाकर एक स्पीड-पेंटर को सिखाने के रूप में समझें। पेंटर सीखता है कि हॉल ऑफ फेम की ओर कैसे बढ़ना है और हॉल ऑफ शेम से कैसे दूर रहना है, जिसे एक सुरक्षा रस्सी द्वारा निर्देशित किया जाता है जो उन्हें पटरी से उतरने से रोकती है। यह तब भी काम करता है जब जज (जो रैंकिंग दे रहा है) एक विशाल, जटिल कंप्यूटर हो जिससे आप आसानी से बात नहीं कर सकते, और यह पेंटर को अविश्वसनीय रूप से तेज़ बनाए रखता है।

मुख्य बात: लेखक दिखाते हैं कि यह विधि इन तेज़ इमेज जनरेटर्स को बेहतर, अधिक मानव-पसंद छवियां बनाने में मदद करती है, बिना जनरेशन प्रक्रिया को धीमा किए या रिवॉर्ड सिस्टम से जटिल गणितीय फीडबैक की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →