← नवीनतम पेपर
💻 computer science

Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision

यह शोध पत्र डायरेक्ट डिफ्यूजन स्कोर प्रेफरेंस ऑप्टिमाइजेशन (DDSPO) को प्रस्तुत करता है, जो एक नवीन प्रशिक्षण विधि है जो कंट्रास्टिव पॉलिसी पेयर्स के माध्यम से बैकवर्ड डिनोइजिंग ट्रांजिशन पर सीधे स्टेपवाइज प्रेफरेंस सुपरविजन को परिभाषित करके डिफ्यूजन मॉडल अलाइनमेंट और सौंदर्य गुणवत्ता में सुधार करती है, जिससे टर्मिनल सैंपल्स से फॉरवर्ड-प्रोसेस एप्रोक्सिमेशन पर निर्भर मौजूदा विधियों की सीमाओं को दूर किया जा सके।

मूल लेखक: Dohyun Kim, Seungwoo Lyu, Seung Wook Kim, Paul Hongsuck Seo

प्रकाशित 2026-07-03
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Dohyun Kim, Seungwoo Lyu, Seung Wook Kim, Paul Hongsuck Seo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार को पेंटिंग करना सिखा रहे हैं। आप चाहते हैं कि रोबोट आपके विवरण से पूरी तरह मेल खाती सुंदर तस्वीरें बनाए, जैसे कि "एक धूप वाले समुद्र तट पर टोपी पहने हुए एक बिल्ली।"

समस्या: सिखाने का पुराना तरीका
वर्तमान में, सर्वश्रेष्ठ रोबोट कलाकार "डिफ्यूजन मॉडल्स" (Diffusion Models) नामक एक तकनीक का उपयोग करते हैं। वे एक बिखरे हुए, शोर-शराबे वाले (static-filled) कैनवास से शुरुआत करते हैं और धीरे-धीरे उसे तब तक साफ करते हैं, जब तक कि एक स्पष्ट छवि दिखाई न देने लगे।

इन रोबोटों को बेहतर बनाने के लिए, शोधकर्ता आमतौर पर उन्हें दो तैयार पेंटिंग्स दिखाते हैं: एक जिसे आप पसंद करते हैं ("विजेता") और एक जिसे आप नापसंद करते हैं ("हारने वाला")। फिर रोबोट यह समझने की कोशिश करता है कि बिखरे हुए कैनवास को "हारने वाली" पेंटिंग के बजाय "विजेता" में कैसे बदला जाए।

यह पेपर तर्क देता है कि पुराने तरीके में एक दोष है। यह किसी को कार चलाना सिखाने जैसा है जहाँ आप उन्हें केवल अंतिम गंतव्य और शुरुआती बिंदु दिखाते हैं, बिना बीच के मोड़ों, स्टॉप या स्टीयरिंग व्हील के मूवमेंट को देखे। पुराने तरीके हर कदम पर रोबोट को क्या करना चाहिए था, इसका अनुमान लगाते हैं, लेकिन वह अनुमान अक्सर गलत होता है क्योंकि वह रोबोट की वास्तविक चरण-दर-चरण सफाई प्रक्रिया से मेल नहीं खाता। इससे रोबोट भ्रमित हो जाता है या धुंधले और असंगत परिणाम देता है।

समाधान: DDSPO (डायरेक्ट डिफ्यूजन स्कोर प्रेफरेंस ऑप्टिमाइजेशन)
लेखक DDSPO नामक एक नया तरीका प्रस्तावित करते हैं। केवल "विजेता" और "हारने वाली" पेंटिंग्स को देखने के बजाय, DDSPO रोबोट को उसकी सफाई प्रक्रिया के हर एक कदम को देखकर सिखाता है।

वे इसे दो चतुर तरीकों (जिन्हें वे "कॉन्ट्रास्टिव पॉलिसी पेयर्स" कहते हैं) का उपयोग करके करते हैं:

  1. "जुड़वां रोबोट" विधि (डेटा-संचालित):
    कल्पना कीजिए कि आपके पास दो समान रोबोट कलाकार हैं। आप एक को विशेष रूप से "विजेता" शैली को पेंट करने के लिए और दूसरे को "हारने वाली" शैली को पेंट करने के लिए प्रशिक्षित करते हैं। अब, पेंटिंग प्रक्रिया के हर चरण पर, आप पूछते हैं: "क्या रोबोट 'विजेता' शैली के करीब जा रहा है या 'हारने वाली' शैली के करीब?" यदि वह हारने वाले की ओर बढ़ रहा है, तो आप उसे धीरे से विजेता की ओर वापस मोड़ देते हैं। यह रोबोट को निरंतर, चरण-दर-चरण फीडबैक देता है।

  2. "खराब प्रॉम्प्ट" विधि (ट्रेनिंग-फ्री):
    यह और भी स्मार्ट है क्योंकि इसके लिए नए रोबोटों को प्रशिक्षित करने की आवश्यकता नहीं होती है। आप एक मानक रोबोट लेते हैं और उसे आपका मूल विवरण (जैसे, "समुद्र तट पर एक बिल्ली") देते हैं। फिर आप उसी रोबोट को उसी विवरण का एक थोड़ा टूटा हुआ या भ्रमित करने वाला संस्करण देते हैं (जैसे, "एक बिल्ली... समुद्र तट... [बड़बड़ाहट]")।

  • अच्छे प्रॉम्प्ट के प्रति रोबोट की प्रतिक्रिया को "विजेता" दिशा के रूप में माना जाता है।
  • खराब प्रॉम्प्ट के प्रति रोबोट की प्रतिक्रिया को "हारने वाली" दिशा के रूप में माना जाता है।
  • सिस्टम मुख्य रोबोट को पेंटिंग के हर चरण में "अच्छे" रास्ते का पालन करने और "बुरे" रास्ते से बचने के लिए सिखाता है।

यह बेहतर क्यों है
पेपर का दावा है कि केवल "गंतव्य" (अंतिम छवि) पर ध्यान केंद्रित करने के बजाय "यात्रा" (चरण-दर-चरण सफाई) पर ध्यान केंद्रित करके, रोबोट बहुत तेज़ी से और अधिक सटीकता से सीखता है।

  • बेहतर संरेखण (Alignment): रोबोट आपके निर्देशों का अधिक बारीकी से पालन करता है। यदि आप "लाल कार" मांगते हैं, तो इसकी संभावना कम है कि वह नीली कार बनाएगी।
  • बेहतर गुणवत्ता: तस्वीरें अधिक कलात्मक और सुसंगत दिखती हैं।
  • कोई अतिरिक्त लागत नहीं: "खराब प्रॉम्प्ट" विधि का अर्थ है कि आपको हजारों चित्रों को रेट करने के लिए मनुष्यों को काम पर रखने या मुख्य रोबोट को सिखाने के लिए नए रोबोटों को प्रशिक्षित करने की आवश्यकता नहीं है। आप इसे उन उपकरणों के साथ कर सकते हैं जो आपके पास पहले से मौजूद हैं।

परिणाम
लेखकों ने विभिन्न कार्यों पर इसका परीक्षण किया, जैसे कि टेक्स्ट विवरण से मेल खाती छवियां बनाना और छवियों को अधिक सुंदर बनाना। उन्होंने पाया कि उनका चरण-दर-चरण शिक्षण तरीका (DDSPO) लगातार पुराने तरीकों की तुलना में बेहतर परिणाम देता है जो केवल अंतिम चित्र को देखते थे। यह विभिन्न प्रकार के रोबोट कलाकारों पर अच्छी तरह से काम किया, जिससे साबित हुआ कि "कदमों" को सिखाना केवल "अंतिम परिणाम" का अनुमान लगाने से अधिक प्रभावी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →