← नवीनतम पेपर
💻 computer science

Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training

यह शोध पत्र \textsc{SURE} का प्रस्ताव करता है, जो एक एकीकृत लेटेंट-स्पेस फ्रेमवर्क है जो सैंपल-अनुकूलित अनिश्चितता अनुमानों के साथ रिवॉर्ड वितरण को सीखकर डिफ्यूजन मॉडल पोस्ट-ट्रेनिंग को बढ़ाता है ताकि पिक्सेल-स्पेस डिकोडिंग की आवश्यकता के बिना अनुकूलन के लिए विश्वसनीय, सघन फीडबैक प्रदान किया जा सके।

मूल लेखक: Rui Li, Yuanzhi Liang, Ke Hao, Ziqiao Weng, Haibin Huang, Chi Zhang, XueLong Li

प्रकाशित 2026-08-07
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rui Li, Yuanzhi Liang, Ke Hao, Ziqiao Weng, Haibin Huang, Chi Zhang, XueLong Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार को पेंटिंग करना सिखा रहे हैं। आप तब तक इंतज़ार नहीं करना चाहते जब तक कि रोबोट पूरी उत्कृष्ट कृति (masterpiece) न बना ले और फिर आप उसे कहें, "नहीं, वह कुत्ता एक आलू जैसा दिख रहा है।" आप चाहते हैं कि वह कैनवास पर रंग मिलाते समय ही उसे संकेत देते रहें। यह डिफ्यूजन मॉडल्स (diffusion models) की दुनिया है, जो एक प्रकार का AI है जो स्थिर शोर (static noise) को धीरे-धीरे स्पष्ट चित्रों में बदलकर चित्र और वीडियो बनाता है। इन रोबोट्स को वह पेंट करने के लिए जो इंसान वास्तव में पसंद करते हैं, हमें एक "रिवॉर्ड सिस्टम" (इनाम प्रणाली) की आवश्यकता होती है—एक ऐसा शिक्षक जो अच्छे आर्ट के लिए अंक दे और बुरे आर्ट के लिए अंक काटे।

पारंपरिक रूप से, यह शिक्षक तब तक इंतज़ार करता है जब तक रोबोट पेंटिंग पूरी नहीं कर लेता, फिर अंतिम तस्वीर को देखता है, और फिर एक स्कोर देता है। लेकिन यह धीमा और महंगा है क्योंकि रोबोट को संकेत पाने के लिए पूरी छवि बनाने का इंतज़ार करना पड़ता है। नए तरीके शिक्षकों को आधे-अधूरे स्केच (जिन्हें "लेटेंट्स" कहा जाता है) को झाँकने और पहले फीडबैक देने की अनुमति देते हैं। हालाँकि, इसमें एक पेच है: ये शिक्षक आमतौर पर केवल एक संख्या चिल्लाकर बताते हैं, जैसे "10 में से 8," बिना यह बताए कि वे अपनी बात को लेकर कितने आश्वस्त हैं। यदि शिक्षक अंदाज़े लगा रहा है लेकिन फिर भी उच्च स्कोर चिल्लाता है, तो रोबोट भ्रमित हो सकता है और उस नकली स्कोर के पीछे भागने के लिए अजीब चीजें बनाना शुरू कर सकता है। यह पेपर इस समस्या को हल करता है कि रोबोट को अपने शिक्षक पर भरोसा करना कैसे सिखाया जाए, और कब उसे अनदेखा करना है।


समस्या: अति-आत्मविश्वासी शिक्षक

एक सख्त कला शिक्षक की कल्पना करें जो आपके स्केच को ग्रेड दे रहा है। अतीत में, यह शिक्षक आपके आधे-अधूरे ड्राइंग को देखता और बस कहता, "अच्छा काम किया!" या "बुरा काम किया!" और एक संख्या देता। समस्या यह है कि शिक्षक कभी-कभी नहीं जानता कि वे क्या कह रहे हैं। हो सकता है कि स्केच इतना धुंधला हो कि शिक्षक केवल अंदाज़ा लगा रहा हो, लेकिन फिर भी वह उच्च स्कोर चिल्लाता है। यदि आप, छात्र, आँख बंद करके उस उच्च स्कोर का पालन करते हैं, तो आप बार-बार वही गलती कर सकते हैं, यह सोचकर कि आप बहुत अच्छा कर रहे हैं जबकि वास्तव में आप पटरी से उतर रहे होते हैं। AI की दुनिया में, इसे "रिवॉर्ड हैकिंग" (reward hacking) कहा जाता है, जहाँ AI बेहतर आर्ट बनाने के बजाय केवल एक उच्च स्कोर पाने के लिए कोई खामी ढूंढ लेता है।

इस पेपर के पीछे के शोधकर्ताओं ने, जो अपने सिस्टम को SURE (Sample-Adaptive Latent Rewards for Uncertainties-Guided Diffusion Post-Training) कहते हैं, महसूस किया कि मौजूदा शिक्षक एक महत्वपूर्ण जानकारी मिस कर रहे थे: आत्मविश्वास (confidence)। उन्हें एक ऐसे तरीके की आवश्यकता थी जिससे शिक्षक कह सके, "मैं 90% आश्वस्त हूँ कि यह एक अच्छी ड्राइंग है," या "मैं केवल 20% आश्वस्त हूँ, इसलिए मेरी बात पर बहुत अधिक ध्यान न दें।"

समाधान: एक शिक्षक जो अपनी शंका स्वीकार करता है

लेखकों ने इसे ठीक करने के लिए एक दो-भाग वाला सिस्टम बनाया।

भाग 1: अनिश्चितता-जागरूक शिक्षक (SURE-LRM)
सबसे पहले, उन्होंने एक नए प्रकार का रिवॉर्ड मॉडल बनाया। केवल एक स्कोर देने के बजाय, यह मॉडल एक स्कोर और इस बात का माप भी देता है कि वह स्कोर कितना डगमगा रहा है। इसे एक मौसम पूर्वानुमान की तरह समझें। एक सामान्य शिक्षक कहता है, "बारिश होगी।" नया SURE-LRM शिक्षक कहता है, "बारिश होगी, और मैं 95% आश्वस्त हूँ," या "शायद बारिश हो, लेकिन मैं केवल 40% आश्वस्त हूँ क्योंकि बादल अजीब हैं।"

उन्होंने इस शिक्षक को एक विशेष विधि का उपयोग करके प्रशिक्षित किया जहाँ यह छवियों के जोड़ों (एक अच्छी, एक बुरी) को देखता है और न केवल यह सीखता है कि कौन सी बेहतर है, बल्कि यह भी कि "अच्छाई" कितनी भिन्न होती है। यदि शिक्षक एक बिखरा हुआ, भ्रमित करने वाला स्केच देखता है, तो वह उच्च "अनिश्चितता" स्कोर देना सीख जाता है। यदि वह एक स्पष्ट, स्पष्ट उत्कृष्ट कृति देखता है, तो वह कम अनिश्चितता स्कोर देता है। महत्वपूर्ण रूप से, पेपर दिखाता है कि यह शिक्षक केवल मानक "अच्छे बनाम बुरे" उदाहरणों को देखकर अपना आत्मविश्वास स्तर सीख सकता है, बिना किसी मानवीय लेबलिंग के कि वे कितने आश्वस्त थे।

भाग 2: स्मार्ट छात्र (SURE-REFL)
इसके बाद, उन्होंने SURE-REFL नामक एक प्रशिक्षण पद्धति बनाई जो इस नए शिक्षक का उपयोग करती है। जब AI कलाकार सीख रहा होता है, तो वह ड्राइंग प्रक्रिया के कई चरणों में शिक्षक से फीडबैक मांगता है। आमतौर पर, AI हर फीडबैक को लेगा और आँख बंद करके उसका पालन करने की कोशिश करेगा। लेकिन SURE-REFL के साथ, AI पहले शिक्षक के "कॉन्फिडेंस मीटर" को देखता है।

यदि शिक्षक कहता है, "स्कोर: 8/10, आत्मविश्वास: कम," तो AI सोचता है, "ठीक है, मैं सुनूँगा, लेकिन मैं इसके आधार पर अपनी पूरी पेंटिंग नहीं बदलूँगा।" यदि शिक्षक कहता है, "स्कोर: 8/10, आत्मविश्वास: उच्च," तो AI सोचता है, "समझ गया! मैं निश्चित रूप से ऐसा ही और करूँगा।" सिस्टम मूल रूप से फीडबैक को तौलता है: उच्च आत्मविश्वास को भारी वजन दिया जाता है, और कम आत्मविश्वास को हल्का वजन। यह AI को शिक्षक के अंदाज़ों से भ्रमित होने से रोकता है।

उन्होंने क्या पाया

शोधकर्ताओं ने इमेज जनरेटर (जैसे बिल्लियों के चित्र बनाना) और वीडियो जनरेटर (जैसे छोटी मूवी क्लिप बनाना) दोनों पर इस सिस्टम का परीक्षण किया।

  • बेहतर शिक्षक: नया SURE-LRM शिक्षक पिछले तरीकों की तुलना में मानव प्राथमिकताओं का बेहतर अनुमान लगाने में सक्षम था। 2,000 इमेज पेयर्स के परीक्षण में, जब उन्होंने केवल उन भविष्यवाणियों को रखा जहाँ शिक्षक सबसे अधिक आश्वस्त था (सबसे कम अनिश्चितता वाले 50%), तो सटीकता लगभग 79.4% से बढ़कर 90.1% हो गई। यह साबित करता है कि शिक्षक का "कॉन्फिडेंस मीटर" वास्तव में यह बता रहा था कि कौन सी भविष्यवाणियाँ विश्वसनीय थीं।
  • स्थिर शिक्षण: जब उन्होंने AI को प्रशिक्षित करने के लिए SURE-REFL का उपयोग किया, तो सीखने की प्रक्रिया बहुत अधिक स्थिर रही। पुराने तरीकों के परीक्षणों में, AI का स्कोर तो ऊपर जाता था लेकिन वास्तविक आर्ट की गुणवत्ता नीचे गिर जाती थी (जो रिवॉर्ड हैकिंग का संकेत है)। SURE-REFL के साथ, स्कोर और वास्तविक गुणवत्ता लंबे समय तक एक साथ चलते रहे।
  • शीर्ष प्रदर्शन: अंतिम परिणामों में, SURE-REFL पद्धति ने इमेज और वीडियो दोनों के लिए मानक बेंचमार्क पर उच्चतम स्कोर प्राप्त किया। वीडियो जेनरेशन के लिए, इसने 0.8357 का कुल गुणवत्ता स्कोर प्राप्त किया, जो अगले सबसे अच्छे तरीके से 0.0109 अधिक था।

यह क्यों मायने रखता है

यह पेपर सुझाव देता है कि AI को बेहतर आर्ट बनाने के लिए सिखाने की कुंजी केवल एक स्मार्ट शिक्षक होना नहीं है, बल्कि एक ऐसा शिक्षक होना है जिसे पता हो कि वह कब नहीं जानता। AI को शिक्षक के डगमगाते अंदाज़ों को अनदे로 करने और केवल उनके प्रति आश्वस्त होने की अनुमति देकर, सिस्टम उसे केवल उच्च स्कोर पाने के लिए अजीब, टूटी हुई कला बनाने के धोखे से बचने में मदद करता है। यह उन AI कलाकारों को बनाने की दिशा में एक कदम है जो न केवल रचनात्मक हैं बल्कि विश्वसनीय भी हैं, जो शोर (noise) से भ्रमित हुए बिना फीडबैक से सीखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →