← नवीनतम पेपर
🤖 machine learning

Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models

यह शोध पत्र डिफ्यूजन LAIR (Diffusion LAIR) प्रस्तुत करता है, जो एक नवीन लिस्टवाइज प्रिफरेंस ऑप्टिमाइज़ेशन (listwise preference optimization) विधि है जो पारंपरिक पेयरवाइज दृष्टिकोणों की तुलना में टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल्स को अधिक प्रभावी ढंग से संरेखित करने के लिए निरंतर रिवॉर्ड स्कोर और एडवांटेज-वेटेड रिग्रेशन का लाभ उठाता है, जो विभिन्न जनरेशन और एडिटिंग बेंचमार्क पर उत्कृष्ट प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Austin Wang, Jiaqi Han, Stefano Ermon, Yisong Yue

प्रकाशित 2026-05-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Austin Wang, Jiaqi Han, Stefano Ermon, Yisong Yue

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े जिद्दी कलाकार (एक डिफ्यूजन मॉडल) को आपके विवरणों के आधार पर चित्र बनाना सिखा रहे हैं। आप चाहते हैं कि कलाकार ऐसे चित्र बनाए जो मनुष्यों को सुंदर और सटीक लगें।

पुराना तरीका: "यह बनाम वह" का खेल

लंबे समय तक, इस कलाकार को सिखाने का मानक तरीका "यह या वह" का खेल था।

  • आप कलाकार को "सूर्यास्त" के दो चित्र दिखाते हैं।
  • आप कहते हैं, "मुझे चित्र B की तुलना में चित्र A अधिक पसंद है।"
  • कलाकार सीखता है: "ठीक है, मुझे चित्र A की शैली को अधिक सामान्य और चित्र B की शैली को कम सामान्य बनाना चाहिए।"

समस्या: यह तरीका थोड़ा बर्बादी भरा है। क्या होगा अगर आप कलाकार को पाँच सूर्यास्त दिखा दें?

  • चित्र A अद्भुत है।
  • चित्र B ठीक-ठाक है।
  • चित्र C भयानक है।
  • चित्र D वास्तव में B से थोड़ा बेहतर है।
  • चित्र E सबसे खराब है।

पुराना "यह बनाम वह" तरीका आपको केवल दो (मान लीजिए A और E) चुनने के लिए मजबूर करता है और बाकी सबको अनदेखा कर देता है। यह उस मूल्यवान जानकारी को फेंक देता है कि चित्र D वास्तव में काफी अच्छा था, या चित्र C एक आपदा थी। यह भी अनदेखा करता है कि A, B की तुलना में कितना बेहतर है। क्या A, B से बस थोड़ा सा बेहतर है, या A एक उत्कृष्ट कृति है और B एक कचरा? पुराना तरीका सभी "जीत" को एक समान मानता है।

नया तरीका: डिफ्यूजन LAIR ("समूह स्कोरकार्ड")

लेखक इस नए तरीके का प्रस्ताव देते हैं जिसे Diffusion LAIR कहा जाता है। "यह बनाम वह" खेलने के बजाय, वे "पूरे समूह का स्कोरकार्ड" खेलते हैं।

यह कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:

1. स्कोरकार्ड (रिवॉर्ड स्कोर)
केवल एक विजेता और एक हारने वाले को चुनने के बजाय, सिस्टम एक "जज" (रिवॉर्ड मॉडल) का उपयोग करता है जो समूह के प्रत्येक चित्र को एक संख्यात्मक स्कोर देता है।

  • चित्र A: 95/100
  • चित्र B: 60/100
  • चित्र C: 10/100
  • चित्र D: 70/100
  • चित्र E: 5/100

2. केंद्रित लाभ (औसत से ऊपर या नीचे कौन है?)
सिस्टम केवल कच्चे स्कोर को नहीं देखता है। यह गणना करता है कि प्रत्येक चित्र समूह के औसत की तुलना में कितना बेहतर या बदतर है।

  • यदि औसत स्कोर 48 है, तो चित्र A (95) को एक बड़ा सकारात्मक उछाल (boost) मिलता है।
  • चित्र C (10) को एक नकारात्मक दंड (penalty) मिलता है।
  • यह प्रत्येक चित्र के लिए एक "भार" (weight) बनाता है: "आप औसत से ऊपर हैं, इसलिए हम आपको और चाहते हैं!" या "आप औसत से नीचे हैं, इसलिए हम आपको कम चाहते हैं!"

3. कोमल धक्का (रूढ़िवादी अपडेट्स)
यह सबसे चतुर हिस्सा है। पुराने तरीके अक्सर कलाकार को बहुत अधिक नाटकीय रूप से बदलने के लिए मजबूर करते हैं, जिससे कलाकार सामान्य रूप से पेंट करना भूल सकता है (एक समस्या जिसे "डिस्ट्रीब्यूशन शिफ्ट" कहा जाता है)।
डिफ्यूजन LAIR एक सुरक्षा ब्रेक जोड़ता है। यह कहता है: "ठीक है, हम चाहते हैं कि आप अच्छे चित्रों में सुधार करें और बुरे चित्रों को कम करें, लेकिन अपनी शैली को बहुत अधिक जंगली तरीके से न बदलें।" यह गणितीय रूप से बदलाव के आकार को सीमित करता है, यह सुनिश्चित करता है कि कलाकार जमीन से जुड़ा रहे और फिर भी सीखता रहे।

यह क्यों मायने रखता है (परिणाम)

लेखकों ने इस नए तरीके का परीक्षण दो प्रसिद्ध कलाकारों (Stable Diffusion 1.5 और SDXL) पर किया। उन्होंने पाया कि:

  • बेहतर सीखना: समूह के केवल दो चित्रों के बजाय सभी चित्रों का उपयोग करके, कलाकार ने तेजी से और बेहतर तरीके से सीखा।
  • अधिक सूक्ष्मता: कलाकार ने "काफी अच्छा" और "अद्भुत" के बीच अंतर करना सीखा, न कि केवल "अच्छा" बनाम "बुरा"।
  • बहुमुखी प्रतिभा: यह तरीका नए चित्र बनाने, विभिन्न वस्तुओं को मिलाने (जैसे, "टोपी पहने हुए बिल्ली"), और निर्देशों के आधार पर मौजूदा फोटो को संपादित करने के लिए भी अच्छी तरह से काम करता है।

संक्षेप में

इस पुराने तरीके को एक ऐसे शिक्षक के रूप में सोचें जो केवल हमेशा कहता है, "तुमने अपने दोस्त से बेहतर किया," और बाकी कक्षा को अनदेखा कर देता है।
Diffusion LAIR एक ऐसे शिक्षक की तरह है जो पूरी कक्षा को ग्रेड देता है, देखता है कि कौन उत्कृष्ट प्रदर्शन कर रहा है और कौन संघर्ष कर रहा है, और पूरे समूह को मिलकर सुधार करने के लिए एक अनुकूलित, कोमल धक्का देता है, बिना किसी को भ्रमित या अभिभूत किए।

पेपर का दावा है कि यह दृष्टिकोण उन चित्रों को बनाता है जिन्हें मनुष्य अधिक पसंद करते हैं, बिना महंगे, जटिल प्रशिक्षण सत्रों के, केवल अपने पास मौजूद डेटा का स्मार्ट तरीके से उपयोग करके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →