← नवीनतम पेपर
🤖 AI

Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling

यह शोध पत्र DiNa-LRM को प्रस्तुत करता है, जो एक गणनात्मक रूप से कुशल, डिफ्यूजन-नेटिव लेटेंट रिवॉर्ड मॉडल है जो विज़न-लैंग्वेज मॉडल-आधारित रिवॉर्ड्स के डोमेन मिसमैच और उच्च लागतों को दूर करने के लिए शोर वाले डिफ्यूजन स्टेट्स पर सीधे प्रेफरेंस लर्निंग को फॉर्मुलेट करता है, जिससे काफी कम संसाधनों के साथ बेहतर अलाइनमेंट प्रदर्शन प्राप्त होता है।

मूल लेखक: Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wenhan Luo

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wenhan Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार को आपके विवरण के आधार पर चित्र बनाना सिखा रहे हैं। रोबोट एक जटिल आंतरिक प्रणाली (जिसे डिफ्यूजन मॉडल कहा जाता है) का उपयोग करता है जो धुंधले, शोर वाले स्टैटिक (static) से शुरू होती है और एक स्पष्ट छवि दिखाई देने तक इसे धीरे-धीरे साफ करती है।

आपको यह सिखाने के लिए कि रोबोट वास्तव में क्या बनाना पसंद करता है, आपको एक "शिक्षक" (एक रिवॉर्ड मॉडल) की आवश्यकता होगी जो रोबोट के रेखाचित्रों को देखे और कहे, "अच्छा काम किया!" या "फिर से कोशिश करो।"

समस्या: पुराना शिक्षक बहुत भारी और बेमेल था

वर्तमान में, सबसे अच्छे "शिक्षक" विशाल विज़न-लैंग्वेज मॉडल्स (VLMs) हैं। इन्हें एक सुपर-इंटेलिजेंट, विशाल पुस्तकालय के रूप में सोचें जिसने दुनिया की हर किताब पढ़ी है और हर तस्वीर देखी है।

  • समस्या: ये विशाल पुस्तकालय भारी होते हैं। उन्हें चलाने के लिए बहुत अधिक कंप्यूटर शक्ति की आवश्यकता होती है और वे धीमे होते हैं।
  • बेमेल होना: रोबोट कलाकार एक "संकुचित, अमूर्त दुनिया" (लेटेंट स्पेस) में काम करता है, लेकिन विशाल पुस्तकालय वाला शिक्षक अंतिम, हाई-डेफिनिशन फोटो (पिक्सेल स्पेस) को देखता है। यह ऐसा ही है जैसे किसी शेफ से सूप के कच्चे तत्वों को चखने के बजाय, सूप पकने के बाद उसे चखकर उसका न्याय करने के लिए कहना। यह बेमेल होना शिक्षण को अक्षम और भ्रमित करने वाला बनाता है।

समाधान: DiNa-LRM (नेटिव शिक्षक)

लेखकों ने एक नया प्रकार का शिक्षक बनाया जिसे DiNa-LRM कहा जाता है। एक विशाल, बाहरी पुस्तकालय को काम पर रखने के बजाय, उन्होंने रोबोट कलाकार के अपने ही आंतरिक मस्तिष्क को शिक्षक में बदल दिया।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "शोर-कैलिब्रेटेड" (Noise-Calibrated) आँख

रोबोट कलाकार शोर (static) से शुरू करके और उसे समय के साथ साफ करके चित्र बनाता है।

  • पुराना तरीका: शिक्षक केवल अंतिम, साफ छवि को देखता है।
  • DiNa-LRM का तरीका: यह नया शिक्षक तब भी छवि को देखने में सहज है जब वह अभी भी शोर वाली और धुंधली अवस्था में होती है।
  • उपमा: एक संगीत निर्माता की कल्पना करें जो एक बैंड को सिखा रहा है। एक पारंपरिक शिक्षक गाना पूरी तरह से मिक्स और मास्टर होने के बाद ही उसकी आलोचना करता है। DiNa-LRM उस निर्माता की तरह है जो रिकॉर्डिंग के दौरान ही स्टूडियो में बैठता है, कच्चे, शोर वाले ट्रैक्स को सुनता है। क्योंकि शिक्षक "शोर" को स्वाभाविक रूप से समझता है, इसलिए वह जानता है कि प्रत्येक चरण में कितनी अनिश्चितता की उम्मीद करनी है। यदि छवि बहुत धुंधली है, तो शिक्षक कहता है, "मैं अभी 100% निश्चित नहीं हूँ, इसलिए मैं अपनी ग्रेडिंग में थोड़ा सावधान रहूँगा।" यदि छवि स्पष्ट है, तो वह उच्च विश्वास के साथ ग्रेड देता है।

2. "टाइम-ट्रैवल" एनसेम्बलिंग (Time-Travel Ensembling)

जब शिक्षक को किसी तैयार छवि को अंतिम स्कोर देने की आवश्यकता होती है, तो वह केवल उसे एक बार नहीं देखता है।

  • उपमा: कल्पना करें कि आप किसी फिल्म के कथानक का अनुमान लगाने की कोशिश कर रहे हैं। आप केवल अंतिम दृश्य देख सकते हैं, लेकिन वह भ्रामक हो सकता है। या, आप फिल्म को 10%, 50% और 90% पूर्णता पर देख सकते हैं और बेहतर समझ प्राप्त करने के लिए उन सभी दृश्यों को जोड़ सकते हैं।
  • DiNa-LRM कैसे करता है: यह छवि को "स्वच्छता" के विभिन्न चरणों (विभिन्न शोर स्तरों) पर देखता है और उन सभी मतों को एक अंतिम, सुपर-सटीक स्कोर में जोड़ देता है। इसे नॉइज़ एनसेम्बलिंग (Noise Ensembling) कहा जाता है। यह शिक्षक को बिना बड़ा दिमाग बनाए बहुत अधिक मजबूत और विश्वसनीय बनाता है।

3. परिणाम: तेज़, सस्ता और स्मार्ट

लेखकों ने इस नए शिक्षक का परीक्षण पुराने विशाल पुस्तकालयों और अन्य प्रयासों के विरुद्ध किया।

  • प्रदर्शन: DiNa-LRM उन बेहतरीन विशाल पुस्तकालयों के लगभग बराबर है जो यह तय करते हैं कि मनुष्य किन चित्रों को पसंद करते हैं।
  • दक्षता: क्योंकि यह रोबोट के अपने "संकुचित संसार" के भीतर रहता है, इसलिए इसे जज करने के लिए छवि को पूर्ण फोटो में डिकोड करने की आवश्यकता नहीं है।
    • यह 51% कम मेमोरी का उपयोग करता है (जैसे कि आपके कंप्यूटर पर आपकी RAM की आधी क्षमता की आवश्यकता होना)।
    • यह वास्तविक निर्णय लेने के लिए 71% कम कंप्यूटिंग पावर का उपयोग करता है।
  • प्रशिक्षण: जब इसका उपयोग रोबोट कलाकार को प्रशिक्षित करने के लिए किया जाता है, तो रोबोट तेजी से सीखता है और शिक्षक के दृष्टिकोण और कलाकार के दृष्टिकोण के बीच के बेमेल होने से भ्रमित नहीं होता है।

सारांश

यह पेपर DiNa-LRM को पेश करता है, एक रिवॉर्ड मॉडल जो उस इमेज जनरेटर की "भाषा" बोलता है जिसे वह सिखा रहा है। एक विशाल, बाहरी विशेषज्ञ को अपने विचारों को जनरेटर की भाषा में अनुवाद करने के लिए मजबूर करने के बजाय, DiNa-LRM जनरेटर की अपनी आंतरिक संरचना का उपयोग अपने काम को ग्रेड करने के लिए करता है। यह अनिश्चितता (शोर) को संभालने में स्मार्ट है, बेहतर अंतिम निर्णय लेने के लिए प्रगति पर काम को देख सकता है, और यह सब काफी कम कंप्यूटर शक्ति का उपयोग करते हुए करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →