DeDPO: Debiased Direct Preference Optimization for Diffusion Models
यह शोध पत्र डिबायस्ड डायरेक्ट प्रिफरेंस ऑप्टिमाइज़ेशन (DeDPO) का प्रस्ताव करता है, जो एक अर्ध-पर्यवेक्षित (semi-supervised) ढांचा है जो सिंथेटिक AI फीडबैक में व्यवस्थित पूर्वाग्रहों को ठीक करने के लिए कारण संबंधी अनुमान (causal inference) तकनीकों को एकीकृत करता है, जिससे डिफ्यूजन मॉडल पूरी तरह से मानव-लेबल वाले प्रशिक्षण के तुलनीय या उससे बेहतर संरेखण प्रदर्शन प्राप्त कर सकते हैं और साथ ही डेटा लागत को महत्वपूर्ण रूप से कम कर सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली कलाकार (एक डिफ्यूजन मॉडल) को आपके विवरण के आधार पर चित्र बनाना सिखा रहे हैं। वह कलाकार पहले से ही सुंदर चित्र बनाने में बहुत कुशल है, लेकिन कभी-कभी वह उन सूक्ष्म विवरणों को भूल जाता है जिनकी आपको परवाह है, जैसे कि रोशनी को सही करना या यह सुनिश्चित करना कि बिल्ली एक कुत्ते की तरह नहीं बल्कि एक बिल्ली की तरह दिखे।
इसे ठीक करने के लिए, आपको आमतौर पर मानव आलोचकों (human critics) की एक टीम रखनी पड़ती है जो दो चित्रों को देखती है और कहती है, "मुझे यह वाला ज्यादा पसंद है।" इसे डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन (DPO) कहा जाता है। यह बहुत अच्छा काम करता है, लेकिन लाखों चित्रों को जज करने के लिए हजारों मनुष्यों को नियुक्त करना बेहद महंगा और धीमा है। यह ऐसा है जैसे आपको केवल एक मजबूत लकड़ी की बाड़ की जरूरत हो, लेकिन आप सोने की परत वाली बाड़ के लिए पैसे खर्च कर रहे हों।
समस्या: "सस्ता" आलोचक
पैसे बचाने के लिए, शोधकर्ताओं ने मानव निर्णयों के बजाय AI आलोचकों (अन्य कंप्यूटर प्रोग्रामों) का उपयोग करने की कोशिश की। उन्होंने सोचा, "जब हम कंप्यूटर का मुफ्त में उपयोग कर सकते हैं, तो इंसानों को क्यों भुगतान करें?"
लेकिन इसमें एक पेंच है। ये AI आलोचक पूर्ण नहीं होते। वे गलतियाँ करते हैं, उनके अजीब पूर्वाग्रह होते हैं, और कभी-कभी वे केवल अनुमान लगाते हैं। यदि आप अपने कलाकार को केवल इन त्रुटिपूर्ण AI मतों से प्रशिक्षित करते हैं, तो कलाकार भ्रमित हो जाता है और अजीब गलतियाँ करने लगता है। यह एक ऐसे GPS को सुनकर गाड़ी चलाना सीखने जैसा है जो कभी-कभी आपको झील में गाड़ी चलाने के लिए कहता है।
समाधान: DeDPO (द "स्मार्ट टीचर")
इस पेपर के लेखकों ने, DeDPO, एक चतुर तरीका निकाला जिससे वे अपने गलतियों से भ्रमित हुए बिना इन सस्ते, अपूर्ण AI आलोचकों का उपयोग कर सकें। उन्होंने दो विचारों को मिलाया:
- मानवों की एक छोटी टीम: आपके पास "गोल्ड स्टैंडर्ड" उत्तर देने के लिए वास्तविक मनुष्यों का एक छोटा समूह है।
- AI आलोचकों की एक विशाल सेना: आप चित्रों के एक विशाल ढेर को जज करने के लिए सस्ते AI का उपयोग करते हैं।
जादुई ट्रिक: "डिबायस्ड" (Debiased) सुधार
आमतौर पर, यदि आप मानव और AI मतों को मिलाते हैं, तो AI की गलतियाँ पूरे सिस्टम को नीचे खींच लेती हैं। DeDPO एक गणितीय "सुधार फिल्टर" (जिसे कॉज़ल इन्फरेंस नामक क्षेत्र से लिया गया है) का उपयोग करता है ताकि इस शोर को ठीक किया जा सके।
इसे इस प्रकार समझें:
- AI आलोचक एक शोर भरा रेडियो स्टेशन है। यह संगीत तो बजाता है, लेकिन इसमें बहुत अधिक स्टेटिक (शोर) है।
- मानव आलोचक एक पूर्ण, स्पष्ट रिकॉर्डिंग है।
- DeDPO एक स्मार्ट साउंड इंजीनियर है। वह पूरे कॉन्सर्ट के दौरान शोर वाले रेडियो (AI) को सुनता है, लेकिन उसके पास कुछ प्रमुख गानों के लिए वह पूर्ण रिकॉर्डिंग (मानव) भी होती है।
साउंड इंजीनियर यह समझने के लिए पूर्ण रिकॉर्डिंग का उपयोग करता है कि रेडियो संगीत को कैसे विकृत (distort) कर रहा है। एक बार जब वह विरूपण के पैटर्न को जान लेता है, तो वह बाकी शोर भरे रेडियो प्रसारण से उस स्टेटिक को "घटा" (subtract) सकता है। अचानक, सस्ता AI फीडबैक लगभग उतने ही अच्छे स्तर पर पहुँच जाता है जितना कि महंगा मानव फीडबैक।
व्यवहार में यह कैसे काम करता है
पेपर ने दो प्रसिद्ध इमेज जनरेटर्स (SD1.5 और SDXL) पर इसका परीक्षण किया। उन्होंने मॉडल को दिया:
- 25% डेटा वास्तविक मानव लेबल ( "पूर्ण रिकॉर्डिंग") के साथ।
- 75% डेटा AI-जनरेटेड लेबल ("शोर वाला रेडियो") के साथ।
परिणाम:
- मानक विधि (DPO): जब उन्होंने विशेष सुधार के बिना मानव और AI लेबल को मिला दिया, तो मॉडल और खराब हो गया। AI से आया शोर मानव मार्गदर्शन पर हावी हो गया।
- DeDPO: मॉडल ने पूरी तरह से सीखा। वास्तव में, इसने उतना ही अच्छा प्रदर्शन किया, और कभी-कभी 100% मानव लेबल पर प्रशिक्षित मॉडलों से भी बेहतर प्रदर्शन किया।
यह क्यों महत्वपूर्ण है
लेखकों ने सिद्ध किया है कि AI कला को मानवीय मूल्यों के अनुरूप बनाने के लिए आपको मानवों की एक सेना रखने की आवश्यकता नहीं है। आप एक बहुत बड़ी मात्रा में सस्ते AI फीडबैक को "कैलिब्रेट" करने के लिए थोड़े से मानव सहयोग का उपयोग कर सकते हैं।
- उपमा: यह एक विशेषज्ञ शेफ द्वारा सूप के एक बड़े बर्तन को चखने जैसा है ताकि यह बताया जा सके कि इसमें नमक की आवश्यकता है या नहीं। एक बार जब शेफ वह एक सुधार दे देता है, तो आप बाकी बर्तन के लिए स्वचालित सीजनिंग मशीन पर भरोसा कर सकते हैं।
- परिणाम: यह AI अलाइनमेंट (AI को सहायक और सुरक्षित बनाना सिखाना) को बजट बिगाड़े बिना या मानव फीडबैक की प्रतीक्षा किए बिना स्केल करना संभव बनाता है।
संक्षेप में, DeDPO एक ऐसी विधि है जो AI को "सस्ते" फीडबैक से सीखने देती है, जिसमें वह "महंगे" मानव ज्ञान का उपयोग करके शोर को साफ करता है, जिसके परिणामस्वरूप उच्च-गुणवत्ता वाली, संरेखित (aligned) AI कला प्राप्त होती है, बिना उच्च लागत के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।